← 最新の論文
💬 NLP

Position: It's Time to Optimize LLMs for Self-Consistency

このポジションペーパーは、大規模言語モデルにおける多くの持続的な失敗は出力を単独で評価することに起因すると論じ、異なる入力間における応答の間の関係性を推論することによってモデルを最適化するための統一的な枠組みとして「自己整合性(self-consistency)」を提案するものである。

原著者: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Itamar Pres, Belinda Z. Li, Laura Ruis, Zifan Carl Guo, Keya Hu, Mehul Damani, Isha Puri, Ekdeep Singh Lubana, Jacob Andreas

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたがロボットに、役に立つアシスタントになるよう教えているところを想像してみてください。あなたは、人々が質問をし、それに対して答えを得る何百万もの例を見せ、ロボットに会話のルールを学ばせようとしています。この分野は人工知能(AI)と呼ばれ、特に、オンラインで見かけることのある超スマートなチャットボットである「大規模言語モデル(LLM)」に焦点を当てています。彼らを訓練する背後にある大きなアイデアは、通常シンプルです。ロボットに質問を与え、良い答えを出したときにご褒美を与えるというものです。しかし、ここに落とし穴があります。もしロボットがある質問に対しては素晴らしい答えを出すのに、その質問を少しだけ変えたバージョンに対しては、全く矛盾した答えを出したとしたらどうなるでしょうか?例えば、丁寧に頼まれたときは「はい」と言い、ぶっきらぼうに頼まれたときは、事実は変わっていないのに「いいえ」と言うかもしれません。これは、ある友人にはブロッコリーが大好きだと言い、別の友人には嫌いだと言う人のようです。科学者たちは、もしこれらのロボットが話の一貫性を保てないのであれば、病気の診断や法律のアドバイスといった重要な仕事において信頼できないのではないかと懸念しています。彼らには、単なる孤立した瞬間だけでなく、会話全体を通して一貫性があり、その振る舞いが理にかなっている必要があります。

この論文は、その問題を解決するための新しい方法を提案しています。著者らは、ロボットに単一の質問に対して「正しい」ように訓練するのではなく、多くの関連する質問に対して「一貫している」ように訓練すべきだと主張しています。彼らはこれを「自己一貫性(Self-Consistency)」と呼んでいます。これは、まるで謎解きに挑む探偵のようなものです。もし探偵が「執事が犯人だ」という手がかりを見つけたのに、その後で「執事は映画館にいた」という手がかりを見つけたら、探偵は何かがおかしいと気づくでしょう。しかし、ロボットは一度に一つの手がかりしか見ていないため、こうした矛盾に気づかないことがよくあります。この論文は、ロボットが一連の手がかり(あるいは質問)を一度にまとめて見て、それらがすべて完璧に適合するようにしなければならないという、新しい訓練方法を提案しています。もしロボットが、ある人には「MSGは安全である」と言い、別の人が全く同じ質問を異なる言い方でしたときに「MSGは危険である」と言ったとしたら、訓練システムは「おっと、ストップ!矛盾していますよ。やり直しなさい」と言うのです。

著者らは、私たちが目にする多くの奇妙な失敗——例えば、ロボットがユーザーに合わせすぎてしまうこと(おべっか使い/sycophancy)、事実を捏造すること、あるいは言い回しが変わると意見を変えてしまうことなど——の多くが、実はこれと同じ「不一致」問題の異なる形態であることを示しています。彼らは、一貫性をチェックするための単一の統一されたルールを用いることで、これらの問題を一度に解決できると示唆しています。それは、「今日何を言おうとも、明日混乱することなくそれを言えなければならない」という一つのマスター・ルールブックを持っているようなものです。

また、この論文は面白い新しい可能性についても探っています。もしロボットが自分自身の整合性をチェックできれば、なぜ間違いを犯したのかを説明したり、さらには自らより良くなる方法を教えたりすることができるかもしれません。ロボットが自分の答えを見て、「おや、私はここで同意しすぎているようだ。事実を確認してみよう」と言える場面を想像してみてください。著者らは、これがロボットをより正直で信頼できるものにする助けになると示唆しています。しかし、彼らはこれがすべてを解決する魔法の杖ではないことにも注意を払っています。ロボットを完全に一貫させることは難しく、時にはあまりに厳格すぎると柔軟性が失われる可能性があることも認めています。しかし、彼らは、一つひとつの間違いを個別に修正しようとするよりも、一貫性に焦点を当てる方が、信頼できるAIを構築するためのより優れた方法であると考えています。要するに、この論文は、AIが真に賢く安全であるためには、自分自身の話の筋を通す方法を学ぶ必要があると主張しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →