エグゼクティブ・サマリー
- 本番投入を止めているのは、モデルの性能ではなく「良し悪しを判定できないこと」である。 検証段階では動いて見えたAIエージェントが、本番の承認会議で止まる。理由はほぼ共通していて、「これで十分だ」と言い切れる根拠が誰も出せないからだ。議論は精度の話ではなく、判定基準の不在に起因している。
- 評価は4層に分けて設計する。 出力品質(一つの回答が正しいか)、タスク達成(一連の処理を最後までやり切れるか)、業務成果(現場の指標が動いたか)、安全性(やってはいけないことをしないか)。この4層を混ぜたまま議論するから、「精度は何%ですか」という答えようのない問いが繰り返される。
- 評価の中核はモデルではなく「ゴールデンセット」という資産である。 自社の業務から集めた入力と、自社の基準で確定させた期待出力の対。これを持つ企業は、モデルを乗り換えても、プロンプトを書き換えても、その変更が改善なのか劣化なのかを即座に判定できる。持たない企業は、変更のたびに感想ベースの合議に戻る。
- 採点方法は三つあり、コストと適用範囲が異なる。 決定的採点(機械的な正誤判定)、LLM-as-a-Judge(AIによる採点)、人手レビュー。すべてを人手で見るのは続かず、すべてを自動化すると重要な誤りを見落とす。基準を人が定め、日々の採点を自動化し、抜き取りで人が検証する三層構造が現実解である。
- 評価は本番投入で終わらない。 入力データの傾向は変わり、モデルは更新され、業務ルールも改訂される。リリース前の一度きりの検証は、賞味期限のある合格証に過ぎない。回帰テストと定点観測を運用に組み込んで初めて、AIは「使い続けられる仕組み」になる。
なぜ「評価」が最大のボトルネックになるのか——問題提起
生成AIの導入プロジェクトは、多くの企業で似た経過をたどる。技術検証は驚くほど順調に進む。数週間で試作が動き、デモでは的確な回答が返り、関係者から前向きな反応が集まる。ところが、本番運用に移す段階で急に足が止まる。稟議の場で「精度はどれくらいですか」と問われ、答えに詰まる。「だいたい良さそうです」「担当者の感覚では8割方合っています」と答えれば、決裁者は当然こう返す——「その根拠は」。
ここで露呈しているのは、AIの性能不足ではない。性能を語る言語と手続きを、組織が持っていないことである。従来のシステム開発であれば、要件定義書に対する受入テストがあり、合否は仕様との一致で判定できた。ところが生成AIの出力は自然文であり、正解が一つに定まらない。同じ質問に対して表現の異なる二つの回答があり、どちらも実務上は正しい、ということが日常的に起きる。仕様との完全一致を判定基準にできないのだ。
この構造的な違いを直視せずに従来型の検収プロセスへ持ち込むと、二つの失敗のどちらかに落ちる。一つは、判定不能を理由に導入自体が無期限に延期されるパターン。もう一つは、判定を放棄したまま「とりあえず参考情報として」導入し、誰も品質を見ないまま現場の信頼を失っていくパターンである。後者はより厄介だ。表面上は導入済みとして扱われるため、問題が可視化されないまま利用率だけが静かに下がっていく。
本稿が置く中核の主張は次の一点である。AI活用の成否を分けるのは、良いモデルを選ぶことではなく、良し悪しを判定できる仕組みを先に持つことだ。 判定基準があれば、モデルの選定は比較実験の問題に還元される。プロンプトの改善は、試行と測定の反復に還元される。判定基準がなければ、どちらも声の大きい人の主観で決まり、担当者が変われば振り出しに戻る。
評価の仕組みは、一度作れば資産として残る。モデルは今後も更新され続けるが、自社の業務における「正しさ」の定義はそう頻繁には変わらない。だからこそ、投資の順序として評価を先に置くべきなのである。