Whose Gold? Annotator-Pool Disagreement Is Large at the Item Level, and Hidden by Small Leaderboards
本論文は、アイテムレベルにおける専門家とクラウド・アノテーター間の重大な不一致が、リーダーボードのサイズの小ささによって隠蔽されており、それがモデル数の増加に伴って一般化できない、モデルのランキングにおける偽りの安定感を生み出していることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
よりスマートな人工知能の構築に向けた競争の中で、研究者たちはシンプルながらも強力なアイデアに依拠している。それは、機械が向上しているかどうかを知るためには、その成果を人間が判定しなければならないというものだ。「選好ベンチマーク」として知られるこのプロセスでは、人間に2つの異なるAIの回答を提示し、どちらが良いかを尋ねる。これらの人間の投票の集まりが「ゴールドスタンダード(黄金標準)」、すなわち、すべての新しいモデルを測定するための信頼できる参照点となる。長年、この分野は「どの人間を判定員として雇うかは重要ではない」という静かな前提に基づいて運営されてきた。有力な説によれば、個々の人間はランダムな間違いを犯すこともあるが、集団全体としては、何が良い回答であるかという単一の安定した真実を測定する信頼できる計器となる。もしこの仮定が正しいならば、判定員の特定の正体は、スコアを書き込むために使われるペンのブランドのような、些細な詳細に過ぎないことになる。
しかし、新たな調査は、この詳細こそが実は方程式の中で最も重要な部分であることを示唆している。研究者たちは、同じAI比較のセットを、全く異なる2つのグループの人々を用いて2回実行することで、人間の判定員の選択が本当に重要かどうかをテストすることを目指した。一方のグループは、オンラインタスクのために何千人もの規模で雇われる一般的なクラウドワーカーで構成されていた。もう一方のグループは、その分野の専門知識を持つ、選別されたドメインエキスパート(領域専門家)で構成されていた。研究者たちは、数千件におよぶ膨大なAI比較のデータセットを取り上げ、両方のグループに勝者を投票させた。その結果、2つのグループは、この分野が想定しているほど頻繁には一致しないことが判明した。およそ4件に1件の割合で、2つのグループは異なる多数派の勝者を選んでいた。また、10件に1件近いケースでは、クラウドワーカーとエキスパートは正反対の勝者を選び、一方のグループの敗者を他方のグループのチャンピオンとして宣言していた。
これほど個別の項目レベルで大きな不一致があるにもかかわらず、最終的な結果は、見かけ倒しの安定性を見せていた。研究者たちがこれらの相反する投票を用いて研究対象となった6つのAIモデルをランク付けした際、どのグループの人間が判定を行ったかにかかわらず、最終的なリーダーボード(順位表)は同一であった。モデルの順序は全く変わらなかったのである。これは、判定員たちが異なる答えを叫んでいるにもかかわらず、スコアボードは沈黙を守っているという、不可解な光景を生み出した。研究者たちは、この安定性は堅牢なシステムの証ではなく、比較されているモデルの数が少ないことによって引き起こされた、幸運な偶然であることに気づいた。モデル間の性能差が大きく離れていたため、判定員の変更による投票のわずかな変動は、あるモデルを別のモデルの上に押し上げるには不十分だったのである。
この安定性がどれほど脆弱であるかをテストするため、研究者たちは、現実世界の競技会で一般的である数十ものモデルを含む、より大きなリーダーボードを用いた場合に何が起こるかをシミュレーションした。結果は衝撃的であった。6つのモデルのリーダーボードは変化しなかったが、10つのモデルを持つリーダーボードでは、86%のケースでモデルの入れ替わりが発生した。20のモデルとなると、順位が入れ替わる確率はほぼ100%に達した。研究は、現在の業界における小規模なリーダーボードの報告手法は、モデルの数が少なく、かつ互いに離れている場合にのみ安全であると結論づけた。もし、より大規模で現実的なモデルの舞台が公開されれば、人間の判定員の選択によって、ランキングは即座にかき乱されることになる。「ゴールドスタンダード」は固定された真実ではない。それは、誰がメジャーリングテープ(測定用テープ)を持つために雇われたのかによって変化する、動く標的なのである。
調査は人間の判定員にとどまらなかった。研究者たちは、自動化されたランキングを行うためにますます利用されるようになっているAI判定員が、人間グループ間の不一致をどのように扱うかを調査した。彼らは、異なる企業のモデルを含む3つの異なるAI判定員をテストし、どのグループの人間により多く同意するかを調べた。すべてのAI判定員は、エキスパートよりも有意にクラウドワーカーに同調していた。これは、AI判定員がクラウドワーカーの選好を模倣するように学習していることを示唆しており、おそらく、その訓練に使用されたデータが同様のクラウドソーシング作業員によるものだったからである。研究者たちは、AI判定員の人間との一致度は、単にその知性の尺度ではなく、何年も前に訓練データが収集された際の採用決定を反映していることを発見した。
また、研究は、AI判定員のプロンプトの出し方が、人間の判定員の選択よりも、彼らの考えを変えてしまう可能性があることも明らかにした。研究者が回答の提示順序を変更すると、AI判定員は(あるモデルでは44.6%という割合で)決定を逆転させた。さらに、他のすべてを固定したまま、出力形式のみを変更した場合(JSONオブジェクトを求めるか、生のトークンを求めるか)、同じ判定員が自身と一致したのはわずか47.2%であり、一方の方向に系統的なシフトが見られた。この提示順序やフォーマットに対する感受性は、人間の意見の差よりもはるかに大きなエラーの源となっている。研究者たちは、業界全体がこれらの結果の報告方法を変える必要があると主張している。単にモデルが人間の選好と何パーセント一致するかを述べるだけでは不完全であり、どの人間が使用されたかを明記しなければならない。現在のランキングの安全性は、サンプルサイズの小ささによって作られた錯覚であり、将来のランキングの信頼性は、アノテーター(注釈者)の選択が些細な詳細ではなく、結果を形作る根本的な変数であることを認めることにかかっている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。