(Towards) Scalable Reliable Automated Evaluation with Large Language Models
本論文は、複数のLLM間のペア比較とイロレーティングシステムを活用することで、調整可能な信頼度閾値を備えた、LLMの出力に対する信頼性の高い専門家レベルの評価を生成し、人間による介入の必要性を大幅に削減する、スケーラブルでドメインに依存しないフレームワークを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、数千もの新しい本が毎日、ロボットの艦隊によって書き上げられている、巨大で混沌とした図書館の編集者であると想像してください。これらのロボットは「大規模言語モデル(LLM)」として知られ、物語を書いたり、質問に答えたり、複雑な概念を要約したりすることを驚異的な速さで行うことができます。しかし、問題があります。どのロボットが最高の物語を書いたのか、どうすればわかるのでしょうか?かつては、人間の司書チームが全ページを読み、互いに比較し、誰が最高かを議論する必要がありました。それには膨大な時間がかかり、多額の費用がかかり、司書によって「良い」という定義さえ異なることもありました。これが、人工知能の分野の科学者たちが解決しようとしている問題です。つまり、人間の目を通さずに、ロボットの文章を評価する手段を作ることです。これを行うために、彼らはいくつかの巧妙なトリックを使います。第一に、ロボット同士に批評家のパネルのように互いを審査させます。第二に、チェスから借用した「イロレーティング」と呼ばれるスコアリングシステムを用い、直接対決の結果に基づいてプレイヤーをランク付けします。最後に、このシステムが機能しているかどうかを確認するために、ロボットの審判が実際の人間による専門家の意見とどの程度一致するかを調べます。
本論文は、これらのAIロボットによって生成されたテキストの品質を評価するための、新しいスケーラブルな手法を紹介するものです。単一のロボットにスコアを付けさせる(それは偏りや不一致を生む可能性があるため)代わりに、著者らは大規模なトーナメントを設定しました。彼らは、科学研究の要約のような様々なテキスト出力を取り出し、複数の異なるAIモデルに、互いに「直接対決」をさせます。各試合では、2つのテキストがAI審判に提示され、特定のルールに基づいてどちらが優れているかを決定します。審判が、単に最後に表示されたテキストや、言葉数が多い方のテキストを選んでしまうのを防ぐために、システムはテキストの順序を入れ替え、複数の異なるAIモデルを使用して勝者に投票します。
これらすべての試合が行われた後、結果はイロレーティングシステムに送られます。これはチェスのリーダーボードのようなものだと考えてください。もしあるテキストが強敵に勝利すれば、多くのポイントを獲得し、敗北すれば、ポイントを失います。時間をかけて、これにより「最高」から「最低」までの明確なランク付けリストが作成されます。著者らは、AIモデルに科学的な抄録に基づいた「コンピテンシー・プロファイル(研究者の得意分野の要約)」を生成させることで、このテストを行いました。そして、AIが生成したランキングを、20人の人間の専門家によるランキングと比較しました。その結果、複数のAIモデルが共同で投票する場合、そのランキングは人間の専門家と驚くほどよく一致することが示されました。実際、単純な多数決(AIが勝者を宣言するために50%の合意を必要とする方法)は、完全な全会一致を求めるよりも効果的でした。全会一致を求めると、多くの場合「引き分け」が多くなり、明確な勝者が出なくなってしまうからです。この研究は、この手法が人間の負担を大幅に軽減できることを示しており、膨大な量のAI生成コンテンツを分類するための、信頼できる自動化された方法を提供しています。しかし、著者らは、このプロセスは依然として計算コストが高く、多くの比較を必要とすること、そして、互いの癖や偏りを相殺するために複数の異なるAIモデルを使用する場合に最も効果を発揮することを指摘しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。