The Authenticity Gap in Human Evaluation
本論文は、標準的な自然言語生成(NLG)の人間による評価プロトコルは、誤った仮定やリカート尺度の限界により、真の好みを捉えられないことが多いと論じ、従来の形式が失敗する場面でもモデルのランキングを正常に復元できる、新しい「システムレベル確率的評価(SPA)」手法を提案するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータ言語の世界において、機械が物語を書き、質問に答え、会話を行うよう教えられている中で、ある執拗な問題が存在する。それは、機械が本当に優れた仕事をしているかどうかを、どうすれば知ることができるのかという問題である。長年、標準的な手法は、コンピュータが生成したテキストを読み、まるでオーディション番組の審査員のようにスコアを与えるために人間を雇うことであった。これらの人間の評価は、究極の真実、すなわち新しいコンピュータプログラムを測定するためのゴールドスタンダード(黄金基準)として扱われてきた。その論理は単純に見える。もしコンピュータが書いた物語が人々から高い評価を得たなら、それは優れた書き手である、というものだ。しかし、このアプローチには隠れた仮定がある。つまり、人がテキストに対して数字を与えるとき、その数字がその人の真の感情を完璧に捉えているという仮定である。それは、「良い」スコアと「素晴らしい」スコアの間の距離が誰にとっても同じであることを、そしてこれらのスコアの平均を取ることが、どのコンピュータがより優れているかを正確に教えてくれることを前提としている。
スタンフォード大学の研究チームは、単に審査員が職務を果たしているかを確認するためだけでなく、スコアリングシステム自体に欠陥があるのではないかという視点から、このプロセスを詳しく調査することに決めた。彼らは、経済学者が人間の選択を理解する方法のレンズを通してこの問題にアプローチし、コンピュータのテキスト生成能力を一種のギャンブルとして捉えた。コンピュータが文章を書くとき、それは単一の固定された結果を生み出すのではなく、素晴らしいものからひどいものまで、さまざまな結果の範囲を生み出す。研究者たちは、人間がこれらの結果を評価する際の標準的な方法が、人々が実際に好むものを捉え損ねていることが多いことを発見した。実際、彼らは、これらの評価を平均するという行為そのものが、時には結果を逆転させ、劣ったコンピュータをより優れたものに見せかけたり、あるいは人間と機械の違いを人間が見分けることができるという事実を隠してしまったりすることを突き止めた。
これを修正するために、研究者たちは意見を求めるための全く新しい方法を提案した。一人の人間に一つの物語を1から5のスケールで評価してもらう代わりに、二台のコンピュータを並べて見せ、どちらのシステムが全体としてより優れているかの確率を推定してもらったのである。彼らが「システムレベルの確率的評価」と呼ぶこの手法は、人間の判定員を「スコアの計算機」としてではなく、「可能性を推定する専門家」として扱うものである。彼らが強力な言語モデルの異なるバージョンを用いてこの新手法を従来の手法と比較検証したところ、その結果は驚くべきものだった。長年業界の標準となってきた旧来の手法は、明らかに区別すべきモデル間の差異を検出できなかった。それは、より大規模で高度なコンピュータがより優れていることを判別できず、さらには、あるコンピュータが人間の書き手よりも著しく優れていることさえ示唆した。これは過去の研究と矛盾する発見である。
しかし、新手法は研究者たちの期待通りに機能した。人々が確率ベースのアプローチを用いたとき、彼らは一貫して正しいコンピュータモデルの順序を特定し、より大規模で複雑なシステムがより優れた物語を生み出していることを認識した。また、最小のコンピュータは明らかに人間より劣っている一方で、最大のコンピュータは人間の書き手と区別がつかないことも正しく特定した。この成功は、より多くの人々やデータによるものではない。研究者たちは両方のテストにおいて同じ90人のボランティアを使用している。違いは、問いかけ方そのものにあった。固定されたスケールに基づいて評価を求める標準的な手法は、人間の脳が整合性を持って行うようには設計されていない判断を強いるのである。それは、スコアの3と4の間の隔たりがすべての人にとって同じ意味を持つことを前提としているが、現実にはそのようなことはめったにない。
研究者たちは、この欠陥が単なる軽微な技術的エラーではなく、人間の好みの仕組みに関する根本的な誤解であることを示した。人々がスケールに基づいてテキストを評価する場合、彼らはしばらとした点と点の間の距離を推測していることが多く、その推測は人によって大きく異なる。ある人はスコアの4は3よりもわずかに優れているだけだと考えるかもしれないし、別の人は2倍優れていると考えるかもしれない。これらの相反する見解を平均すると、結果は真実を覆い隠す濁った信号になってしまう。新手法は、人々が一段高い視点に立ち、全体像を見るように促すことで、この混乱を回避する。単一の文章を判断するのではなく、システム全体を判断し、もし多くの例を見せられたとしたら、どちらのコンピュータをより好むかの頻度を推定するのである。このアプローチは、人間はコンピュータが生成しうるすべての出力を目にすることはできないが、サンプルに基づけば、どのシステムがより優れているかについて信頼できる感覚を形成できるという事実を認めている。
この発見の含意は、物語を書くコンピュータのテストをはるかに超えて広がっている。それは、人工知能の分野全体が自らの進歩をどのように評価しているかという点に疑問を投げかけている。長年、研究者たちは新しいモデルを構築し、人間の判定員から高い平均スコアを得たことをもって、それがより優れていると主張してきた。もしそれらのスコアが、人間の好みに数学的に忠実でないのであれば、それらの主張の多くは間違っている可能性がある。この研究は、単純な評価スケールから脱却し、人間の判断の複雑さを尊重する方法へと移行する必要があることを示唆している。人々に対して数字を割り当てるのではなく、確率を推定させることで、私たちはこれらの機械が実際に何ができるのかについて、より明確で誠実な姿を得ることができる。
実験において、研究者たちは特定の物語のプロンプトを使用し、ボランティアに対して、小規模で基本的なバージョンから大規模で高度なものに至るまでの、言語モデルの異なるバージョンを比較させた。また、ベンチマークとして実際の人間が書いた物語も含めた。結果は明白であった。新手法は期待されるすべての好みを復元し、コンピュータを劣ったものから優れたものへと正しくランク付けし、人間の書き手を適切に配置した。一方、同じボランティアと同じ物語を使用していたにもかかわらず、旧手法は期待される5つの好みのうち2つしか復元できなかった。旧手法は、中規模のコンピュータ間の違いを見逃し、さらに驚くべきことに、人間の書き手が最大のコンピュータよりも著しく劣っているという結論を下した。この誤りは、現在の評価慣行における危険な盲点を浮き彫りにしている。つまり、不適切なプロトコルによって、研究者が「機械が人間の能力を超えた」と信じ込まされてしまう可能性があるということである。
研究者たちはこの新しいアプローチを画像生成にも適用し、どちらのコンピュータがより良い絵を作成したかを判断させた。結果は再び同様であり、この手法が異なる種類のクリエイティブなタスクにおいても有効であることが示された。彼らは、人々がより多くの例を見るほど、自身の好みの確信度が高まることを見出したが、少数の例であっても、確率ベースの手法は正しい勝者を検出することができた。これは、この手法が堅牢かつ効率的であり、不可能なほどの膨大なデータを必要とせずに信頼できる回答を提供できることを示唆している。それは人間の注意力の限界を尊重しながら、人間の好みの本質を捉えているのである。
結局のところ、この研究は、私たちの道具を現実と一致させることに関するものである。人工知能を評価するための標準的なプロトコルは、人間の思考や感情の仕組みと一致しない仮定の上に築かれてきた。単純な数字から誠実な確率の推定へと焦点を移すことで、研究者たちは、より正確で信頼できる評価への道筋を提示した。これは、より良い機械を追求する過程において、まず私たちがそれらを測定する方法が健全であることを確認しなければならないということを思い出させてくれる。目標は、単にどのコンピュータが勝つかを知ることではなく、その勝利が人間とコンピュータの相互作用の未来にとって実際に何を意味するのかを理解することである。これらのシステムが私たちの生活に深く組み込まれていく中で、評価を正しく行うことは、単なる学術的な演習ではなく、私たちが構築するテクノロジーが真にそれを使う人々に資することを保証するための不可欠な作業なのである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。