解説AI CAREERS × QUALITY
AI評価設計者とは?業務の正解を定義する仕事と必要スキル
実測と推定を分け、用語を定義する。判定を誰がやっても同じにする人。

この記事の概要
AI評価設計者とは、AIの出力の良し悪しを感じ取る人ではなく、判定を誰がやっても同じになるように土台をつくる人である。本記事は、評価がぶれる理由を示すAnthropicの報告を起点に、数字を実測・推定・概算に区分する規則、未達や手戻りを成果と同じ文書に書く型、用語を定義して判定を固定する運用の3つを仕事の中身として解説し、必要な力と明日からの行動を示す。
AI評価設計者は、判定の前に「何が実測で何が推定か」を決める
答えは、数字を実測・推定・概算に区分する規則を決め、効果は倍率ではなく削減率で書かせることである。
| 区分 | 意味 | 数字に添えること |
|---|---|---|
| 実測 | 保存先や記録から数えた値 | 対象と取得時点 |
| 推定 | 前提を置いて積み上げた値 | 前提(誰が、どの条件で作業した想定か) |
| 概算 | 計測方法が粗い値 | 計測方法(ログからの読み取り、など) |
同じ表の中に実測と推定と概算が並ぶのは避けられない。区分を添えないと、数えた件数と見積もった工数が同じ確からしさで読まれてしまう。取得時点を添えるのは、同じ対象でも時点が違えば件数が変わるからだ。数字そのものを出すのは実行担当でよい。評価設計者は、この表の「区分」の列と「添えること」の列を設計する人だ。当社の実績レポートでは、実測・推定・概算を区分し、効果は倍率ではなく削減率で書くことを型として固定している。
「削減率で書く」規則には理由がある。倍率(10倍速い)は分母を隠す。削減率は手作業側の見積もりを示さないと計算できないため、推定の前提が表に出る。分母が見える数字だけが、次の業務の見積もりに使える。
もう1つ、取れない数字は書かないという規則がある。それらしい概数を置くより、空欄のままにするほうが次の判断に使える。区分を決めることと、書かないことを決めることは、同じ仕事の表と裏である。
未達と失敗を成果と同じ文書に書く型を決めるのも、評価設計者の仕事
答えは、作り直し、差し戻し、見送りを、成果と同じ表の同じ区分で書く欄を先に用意することである。
成果だけを書いた文書は、次の評価の基準にならない。作り直しにかかった時間を消せば削減率は良く見えるが、その数字で次の業務の工数を見積もると外れる。見送った案件を数えなければ、選定の精度が分からない。未達をどの欄に、どの区分で書くかを、成果を書く前に決めておく。
型は簡単でよい。成果の表に「手戻り」「見送り」「未達」の行を最初から置く。空欄なら空欄と書く。書く欄が無いと、未達は報告から消え、消えた未達は次の判断に使えない。動いたものを止めた判断も、同じ欄に理由とともに残す。
評価設計者がこの型を持つと、報告の読み手は成果の数字を疑う手間から解放される。未達が同じ文書に書いてある報告は、未達が書いていない報告より信頼できるからだ。
人が採点する評価にも同じ型が要る。冒頭の報告が示すとおり、評価者によって結果はばらつく。採点者に渡す指示には、何を欠陥と数え、何を数えないかの例を添え、採点者どうしの一致度を記録する。一致度が低い項目は、採点者の力量の問題ではなく、定義の問題として設計者に戻す。
用語を定義し、判定基準を文書に固定する
答えは、判定に使う言葉の定義を文書に置き、無い用語は推測せず人に確認する規則にすることである。
判定がぶれる原因の多くは、能力ではなく用語にある。冒頭の報告が示す評価者ごとのばらつきも、何を欠陥と呼ぶかが決まっていないところで大きくなる。業務の言葉には、同じ単語が別の状態を指す例が多い。
| 曖昧な言葉 | 定義せずに使うと起きること | 定義の例 |
|---|---|---|
| 完了 | 送信済みなのか下書きなのか分からない | 保存先に件数と必須項目が入った状態 |
| 対応済み | 返信したのか、読んだだけなのか分からない | 相手に返信を送り、記録に残した状態 |
| 有効 | 除外の基準が担当者ごとに違う | 必須項目が埋まり、重複と内部テストを除いたもの |
当社の指示書には用語集を置き、推測せずこの定義に従う、無い用語で曖昧な場合は人に確認する、と明記している。定義の隙間を推測で埋めた結果が判定に混ざることを防ぐためである。人が読んでも、AIが読んでも、同じ定義で判定できることが目的だ。
用語の定義は、人とAIの両方に対する判定基準の固定である。 用語が増えたら追記し、曖昧な指示があったら人に確認する。この更新を続けることが評価設計者の日常の仕事になる。担当者が替わっても、使うモデルが替わっても、同じ判定が出る状態を保つ。
AI評価設計者に必要な力と、明日からやること
答えは、業務の失敗が何に影響するかを理解する力と、実験の基礎、そして正解が決まっていない問題に無理に正解を作らない姿勢である。
実験の基礎とは、比較の条件、母数、実測と推定の区別を扱えることを指す。統計の専門家である必要はない。評価設計者に要るのは、数字を疑う力ではなく、数字に区分を添える習慣である。 採用や育成では、現場で人が直した少数の出力を渡し、実測と推定を分けて説明できるか、定義の無い言葉を推測で埋めずに質問できるかを見れば足りる。
明日からやることは3つで足りる。直近の報告書を一つ開き、数字に実測・推定・概算の区分を添える。同じ報告書に「手戻り」「見送り」の行を足す。判定に使っている言葉を3つ選び、定義を1行ずつ書く。テストケースと検証の流れはAIエージェントの評価設計とは何かで、稼働後に止める・戻す判断はAgent Operations Managerとはで扱っている。
LET’S MAKE MOVES.
AIの品質を、担当者の感覚だけで決めていませんか。
Scratch Secondは営業・CRM業務の完了条件を、実測と推定を区分した確認項目と用語の定義に落とします。誰が判定しても同じ結果になる基準を、御社の業務の言葉で一緒に具体化します。
AIの業務品質を相談する
