Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling
本論文は、アノテータのばらつきをモデル化し、統計的有意性を達成するために必要なアイテム数とアイテムあたりの回答数の最適なバランスを決定するために、持続的な評価者識別子を備えた大規模データセットを活用するマルチレベル・ブートストラップ手法を導入することで、生成AI評価における再現性の危機に対処する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
2 つの新しい AI チャットボットのどちらが「安全」でより役立つかを判断しようとしていると想像してください。あるグループの人々にそれらを評価してもらいます。しかし、ここで問題があります。10 の異なる会話について 3 人だけの人に評価を依頼した場合、現実を反映していない幸運(あるいは不運)な結果が得られる可能性があります。これがこの論文が論じている「再現性の危機」です。十分に慎重に測定を行っていないため、科学は一貫した結果を得ることに苦しんでいます。
この論文の著者らは、すべての人間の意見を、他の誰とも何の関連もない完全に異なる人物からのものとして扱うことは大きな誤りであると主張しています。実際には、同じ人物が複数の項目を評価することが多く、彼らは自分自身の個人的な「味」やバイアスを伴って評価します。
以下に、彼らの発見を簡単なアナロジーを用いて解説します。
1. 「味見テスト」の問題
2 つの新しいアイスクリームの味(モデル A とモデル B)の大規模な味見テストを主催していると想像してください。
- 従来の方法(ほとんどの人が行うこと): 100 人の異なる人に、それぞれ 1 スコップずつ味見してもらいます。すべての人の意見は独立していると仮定します。
- 現実: 多くの研究では、実際には 5 人程度の人に 20 スコップずつ味見させています。
- 問題点: もし「ボブ」がたまたまチョコレートが嫌いなら、ブランドに関係なく、すべてのチョコレート味のスコップを低く評価します。ボブの 20 の意見を 20 の独立したデータポイントとして扱えば、あなたは大量の証拠を持っていると自分を欺くことになります。実際には、ボブの声を 20 回聞いているに過ぎません。
この論文は、同じ人々が複数の項目を評価しているという事実を無視すると、誤った確信を得てしまうことを示しています。2 つの AI モデルの間に明確な勝者がいると思い込んでいるように見えても、実際には真の平均値を得るために十分な数の異なる人々に質問していないだけなのです。
2. 「多レベル」の解決策
著者らは、データを眺める新しい方法を提案しており、これを多レベル・ブートストラップと呼んでいます。
- アナロジー: 単に票数を数えるのではなく、ボブがいつも低得点を与える気難しい男だと気づいた探偵になったと想像してください。最終スコアを計算する際には、ボブの気まぐれさを考慮する必要があります。
- 彼らの手法: 誰が何を評価したかが正確に分かっている実世界のデータセット(123 人によって評価された 350 の会話のデータセットなど)を取り上げました。彼らはコンピュータシミュレーションを用いてデータを「再サンプリング」し、実質的に以下のような問いを立てました。「もし異なる人々に質問していたらどうなるか?もし同じ人々に再度質問していたらどうなるか?」
3. 大きな発見:より多くの項目ではなく、より多くの人々
この論文は重要な問いに答えています:より少ない項目を評価するために多くの人々に依頼すべきか、それともより多くの項目を評価するために少数の人々に依頼すべきか?
- 発見: 少数の人々にすべてを評価させるよりも、多くの人々(評価者)により少ない項目を評価させる方がはるかに優れています。
- 比喩: 街の平均身長を推測しようとしていると想像してください。
- 戦略 A: 1 人に 1,000 棟の異なる建物を測らせる。(これは悪いです。もしその人が近視だったり、壊れたメジャーを使っていたりすれば、街全体のデータが間違ってしまうからです)。
- 戦略 B: 1,000 人の異なる人に、それぞれ 1 棟ずつ建物を測らせる。(これはより良いです。たとえ一人が間違いを犯しても、1,000 人の平均は正確になるからです)。
この論文は、統計的に信頼できる結果(「有意な」発見)を得るためには、単にリストに項目を追加するのではなく、人々(K)の数を大幅に増やす必要があることが多く、場合によっては項目あたり 100 人もの評価者が必要になることを発見しました。
4. 「バッチ」効果
研究者らはまた、データが「バッチ」(グループ)として収集される方法についても検討しました。
- アナロジー: 教師がクラス全体に同時にテストを配る教室を想像してください。生徒たちは互いに話し合い、影響を与え合うかもしれませんし、全員が同時に疲れているかもしれません。
- 発見: 人々がグループ(バッチ)内で項目を評価すると、その意見はさらに相関するようになります。この論文は、これらの「バッチ」を無視すると、実際に必要なデータの量を過小評価してしまうことを示しています。確信を持つために 500 の評価が必要だと思っているかもしれませんが、「バッチ」効果のために、実際には 2,500 の評価が必要になる可能性があります。
5. 結論
この論文は、項目あたり 3〜5 人の評価者しか使わない現在の基準は、特にある AI モデルが他よりも安全であることを証明しようとする場合、結果を信頼するには不十分であることが多いと結論付けています。
- 推奨事項: AI が本当に安全かどうか、あるいは優れているかどうかを知りたいのであれば、人間の評価者を交換可能な硬貨として扱うのをやめる必要があります。すべての人間には固有の「声」があることを認める必要があります。真の答えを得るためには、コストがかかっても、より多くの人間を雇って意見を述べてもらう必要があります。
要約すると: 同じ少数の人々に千のものを評価させるのではなく、千の異なる人々にいくつかのものを評価させてください。偽の統計で自分を欺くのをやめる唯一の方法はこれです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。