本当は強いモデルでも、問題数が足りないと負けます。真の勝率52%なら、100問での正答は60.8%でした。
1000問まで増やして90.1%です。僅差の比較には、桁違いの問題数が要ります。
問題数が足りないと、強いほうが負けます。必要な数は差の大きさで決まります。
ベンチマークスイートで最初に決めるのが問題数です。実際に走らせて、何問あれば結論が安定するのかを測りました。
2つのモデルを問題ごとに比べます。真の勝率が分かっている状態で、問題数を変えて2000回まわしました。
2つのモデルを問題ごとに比べる。2000回まわして、勝ち負けの向きが正しく出る割合を測る 真の勝率 20問 50問 100問 200問 500問 1000問 52% 48.8% 53.6% 60.8% 70.7% 81.0% 90.1% 55% 59.8% 70.0% 80.0% 92.0% 97.9% 100.0% 60% 75.5% 89.8% 97.0% 99.6% 100.0% 100.0% 70% 95.0% 99.8% 100.0% 100.0% 100.0% 100.0%
真の勝率52%の行を見てください。20問では48.8%で、コインを投げるより悪い結果です。
100問でも60.8%です。4割の確率で、強いほうが負けたという結論が出ます。
真の勝率70%なら、20問で95.0%です。100問あれば100.0%になります。
差が2倍になると、必要な問題数はおよそ4分の1です。逆に差が半分になると4倍要ります。
出典もこの向きを自動採点で信号がやや弱くても問題数が多いほうが、人手で丁寧に採点した少数の問題より良いと述べています。
僅差のモデルほど、必要な問題数が跳ね上がる。
More questions with slightly lower signal automated grading is better than fewer questions with high-quality human hand-graded evals.原文Anthropic「Create strong empirical evaluations」 この内容の有効期限2027-02-18
問題数を増やせばいつか決着します。決着しない範囲があることを、先に認めておく必要があります。
ベンチマークスイートで危ないのは、順位が出たから差があると考えることです。表の左上を見返します。
真の勝率52%は、1000問まで増やしても90.1%です。10回に1回は逆の結論が出ます。
これは実際に差がある場合の数字です。差がまったくない50%なら、どこまで増やしても五分五分にしかなりません。
順位を1本の線で出すと、この不確かさが消えます。勝った数と問題数を一緒に出すだけでも伝わります。
100問で54勝なら、真の勝率が5割を切っている可能性も残ります。数字の幅を添えておくと読み手が判断できます。
問題数を増やしても、問題の中身が業務と違えば意味がありません。よく使う型が入っていないと、順位は業務に効きません。
出典も設計の指針を実際の業務で起きる課題の分布を映すように評価を設計することとしています。
公開されている問題集をそのまま使うときは、自社の業務と重なっている部分を確かめます。重ならない部分の順位は参考程度です。
問題数を増やしても、決着しない差はある。
Design evals that mirror your real-world task distribution.原文Anthropic「Create strong empirical evaluations」 この内容の有効期限2027-02-18
必要な問題数は数百から数千です。人手で採点する前提だと、その数に届きません。
ベンチマークスイートに必要な問題数は、この計測のとおり数百から数千です。人が採点していては届きません。
出典も形式の作り方を自動採点ができるように問題を組み立てること。たとえば多肢選択、文字列一致、コードによる採点、LLMによる採点と挙げています。
1番目は簡単ですが、業務の形から離れます。実際に書かせる場面を測りたいなら、2番目か4番目です。
人手をなくす必要はありません。自動採点で数を稼ぎ、割れた問題だけ人が見るという分け方ができます。
人手の一致率そのものが低いこともあります。人手評価の記事では、そのばらつきを測っています。
必要な問題数から逆算すると、採点は自動しかない。
問題ごとの勝ち負けは互いに独立という置き方です。実際の問題集は似た問題が固まっていることが多く、その場合は実質的な問題数が減ります。真の勝率が分かっている状況も、実務ではありません。ここで見せているのは、差が小さいほど必要な問題数が急に増えるという関係です。
Structure questions to allow for automated grading (for example, multiple-choice, string match, code-graded, LLM-graded).原文Anthropic「Create strong empirical evaluations」 この内容の有効期限2027-02-18
同じ課題を持つ会社にとって、動いている設定は「作る時間」を買えるということです。ServiceDockは自作のワークフローやテンプレートを出品できるマーケットプレイスです。手数料や出品の流れは出品者向けページにまとまっています。
出品の仕組みを見る