Aligning with Your Own Voice: Self-Corrected Preference Learning for Hallucination Mitigation in LVLMs
本論文は、プロプライエタリモデルへの依存に起因する分布の不一致を克服するために、合意に基づく検証メカニズムを通じて在分布の好対を生成し、大規模視覚言語モデルにおける幻覚を軽減する自己修正型好適学習フレームワークであるAVES-DPOを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが非常に賢く、芸術的なロボットを想像してみてください。そのロボットは写真の説明をすることが大好きです。あなたがキッチンの写真を見せると、ロボットは「茶色のキャビネット、木製の床、そして犬の隣に立っている人が見えます」と言います。しかし、待ってください。写真には犬などいません!ロボットはただ作り出したのです。これをハルシネーション(幻覚)と呼びます。まるでロボットが写真を見ながら昼間から空想にふけっているようなものです。
長年、科学者たちはこの問題を解決しようと試みました。彼らは「スーパー専門家」(GPT-4V のような巨大で高価な AI モデル)を雇い、ロボットの間違いを見て、「いいえ、その犬はいません。修正してください」と伝えるようにしました。そして、これらの修正を使ってロボットに教えを授けたのです。
旧来の方法の問題点
この論文の著者たちは、この計画に欠陥があることに気づきました。想像してみてください。全く異なる芸術家の傑作をコピーさせることで、学生に絵を描くことを教える場面を。学生はマスターのスタイルを学ぶかもしれませんが、それは彼ら自身の自然な絵の描き方とは一致しません。
同様に、「スーパー専門家」がロボットを修正すると、その修正は専門家らしく聞こえ、ロボットらしく聞こえません。これによりミスマッチが生じます。ロボットは混乱します。なぜなら、「正解」が自分自身の脳には馴染みのないものとして聞こえるからです。その結果、学習プロセスは非効率的になり、膨大な量のデータを必要とします。
新しい解決策:「AVES-DPO」(自己修正する芸術家)
著者たちは、AVES-DPOと呼ばれる新しい方法を提案します。外部の専門家を雇う代わりに、ロボットに自分の仕事をチェックし、修正することを教えるのです。
彼らの「自己修正」プロセスがどのように機能するか、簡単なステップに分解して示します。
- 最初の草案(間違い): ロボットが写真を見て説明を書きます。それは偶然、犬を創作したり、キャビネットの色を間違えたりするかもしれません。
- 探偵仕事(検証): ロボットが修正を試みる前に、彼らは「探偵」チーム(専門的なオープンソース AI ツール)を使って説明をスキャンします。
- ロボットは犬がいると言いましたか? 探偵は写真を確認します。「いいえ、犬はいません。」
- キャビネットが青だと言いましたか? 探偵は確認します。「いいえ、茶色です。」
- 人がカップを持っていると言いましたか? 探偵は確認します。「カップはありません。」
- もし探偵たちが同意すれば、間違いは確認されます。もし不確かな場合は、確実を期すために第二の意見を求めます。
- 自己修正(修正): ここで、ロボットは確認された間違いのリストを見ます。そして物語を書き直します。
- 架空の犬を削除します。
- 「青いキャビネット」を「茶色のキャビネット」に変更します。
- 重要なのは、単に悪い部分を削除するだけでなく、見落としていたより多くの実際の詳細も追加することです。例えば「床が光っている」や「窓がある」などです。
- レッスン(選好学習): これでロボットは物語の 2 つのバージョンを持っています。
- バージョン A: 元の、間違いだらけの物語(「悪い」答え)。
- バージョン B: 新しい、自己修正され、詳細な物語(「良い」答え)。
- ロボットはバージョン Bを好むように訓練されます。バージョン B はロボット自身が書いたものなので、「良い」答えは自分自身と全く同じように聞こえるのです。それはロボット自身の脳に完璧にフィットします。
これが大きな進歩である理由
この論文は、この方法が以下の 3 つの理由でゲームチェンジャーであると主張しています。
- 効率的であること: ロボットは自分自身の「声」から学ぶため、はるかに速く学習します。ロボットを教えるために必要だったのはわずか5,200 例でした。他の方法は同様の結果を得るために 25 倍ものデータ(12 万例以上)を必要としました。これは、外国のアクセントを真似しようとするのではなく、鏡に向かって自分自身と会話しながら言語を学ぶようなものです。
- より多くの間違いを捉えること: 旧来の方法は、物体全体(犬など)を創作するような「大きな」間違いを主に捉えていました。この新しい方法は、「小さな」間違いも捉えます。例えば、関係性を間違えること(犬が左側にあると言っているのに、実際は右側にあるなど)や、色を間違えることです。
- 安価であること: 修正を行うために高価な「スーパー専門家」AI モデルにお金を払う必要はありません。ロボットが重労働を行います。
結果
彼らがこの新しい方法をテストしたところ、ロボットは写真の描写を非常に正確に行うようになりました。物体を創作することをやめ、詳細を正しく捉えるようになり、すべてがごく少量のトレーニングデータで行われました。
限界に関する注記
著者たちは、彼らの方法がまだ何を行わないかについて正直に述べています。
- これは 1 つの物体を一度に見る場合に最もよく機能します。もし写真に複雑な方法で相互作用する 50 人の人々が混沌と集まっている場合、システムは少し混乱するかもしれません。
- 最大で最も強力なロボット(130 億パラメータモデル)の場合、ハルシネーションの修正は、彼らをわずかに「慎重」にしました。彼らは物事を創作しないことに非常に優れるようになったため、以前は知っていた一般的な知識を忘れ去ることがありました。100% 事実であることと、100% おしゃべりであることの間のトレードオフです。
要するに、AVES-DPOとは、ロボットに自分自身最高の編集者になることを教え、そのロボットが学ぶ「真実」が、自然にその自身の心の中にフィットする種類の真実であることを保証するものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。