Dialogical Epistemic Auditing: Tracing Inferential Commitments Across Conversational Turns in Large Language Models
本論文は、大規模言語モデルが会話のターンを経ていかに推論的コミットメントを維持または変更するかを追跡するための質的な枠組みである「対話的認識論的監査」を提案し、ケースシリーズを通じて、モデルが事実に関する主張を撤回する一方で、根拠のない物語を保持するという非対称な一貫性を示すことが多いことを実証する。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータに複雑な出来事について説明を求める際、私たちはしばなくその最初の回答によって判断を下しがちである。その応答が自信に満ちた響きを持ち、基本的な事実を正しく捉えていれば、私たちはその機械が信頼できるものだと想定してしまう。しかし現実の世界では、会話が最初の一文で終わることは滅多にない。私たちは説明を求め、前提に異議を唱え、譲歩から何が導き出されるのかを問い詰める。機械は完璧な冒頭の陳述を行うかもしれないが、議論が深まるにつれて、自らの論理を一貫させ続けることに失敗することがある。このギャップこそが、大規模言語モデルが単独で何を語るかではなく、それが自らの主張の重みを時間の経過とともにどのように扱うかに着目した新しい研究の焦点である。この研究は、人間心理における「認知的不協和」として知られる概念に基づいている。これは、二つの考えが衝突したときに感じる精神的な不快感のことである。この不快感を軽減するために、人々は事実に合わせて信念を変えたり、あるいは信念に合わせるために事実を歪曲したりすることがよくある。本研究は、人工知能システムが、困難で矛盾した状況を説明するよう迫られた際に、同様のパターンを示すかどうかを問うものである。
研究者のジュリオ・ヴィドット氏は、パドヴァ大学の教授であり、ロシアとウクライナの間で行われた2026年の兵士の遺体交換という特定の現実世界の出来事に関する個別の会話を通じて、3つの異なる人工知能システムと対話することでこれを検証しようとした。データは明白かつ十分に文書化されていた。3回の別々の移送において、ロシアはウクライナからおよそ1,000体の遺体を毎回返還していたが、引き換えに受け取ったロシア側の遺体は約30から40体であった。この約25対1という比率は、一つの謎を生み出した。数字は公表され検証されていたが、それはどちらがより多くの兵士を失っているかという、一般的で暗黙のイメージと矛盾しているように見えた。研究者は各システムに対し、この格差について説明を求めた。彼は単に要約を求めたのではなく、彼らの推論を明確にするよう迫り、彼らの論理に異議を唱え、結論が矛盾しているように見える場合には再考を求めた。目的は、彼らの議論の軌跡をターンごとに辿り、機械が一定の姿勢を保つのか、それとも矛盾による不快感を避けるために静かに足場を移すのかを見極めることだった。
この研究では、「対話的エピステミック・オーディティング(対話的認識監査)」と呼ばれる手法が導入された。機械のコードの中で何が「考えている」のかを推測しようとする代わりに、研究者は会話を公開された記録として扱った。彼は機械が行ったあらゆる主張をマッピングし、その主張が議論の中でどのような役割を果たしたかを記録した。それは証拠の一部だったのか? 仮説だったのか? それとも結論だったのか? そして、会話が進むにつれて、機械がそれらの役割を一貫して保持しているかどうかを観察した。後に、暫定的な推測を確定した事実として扱っていないか? 説明なしに結論を放棄していないか? この監査は、特定の種類の失敗を探した。すなわち、機械が考えを変えたにもかかわらず、その変更に合わせて物語の残りの部分を更新できていない場合である。それは、時刻について間違っていたと認めたものの、その後も以前のスケジュール通りに行動し続け、計画の残りを混乱状態に置いたままにしている人物のようなものである。
3つの会話全体を通して、明確なパターンが現れた。あらゆるケースにおいて、人工知能システムは同じ緊張状態に苦しんでいた。検証された遺体の数は、どちらがより多くの損失を出しているかという暗黙の前提と衝突していた。この緊張を解消するために、システムは、暗黙の前提を疑うのではなく、数字の意味を変えようと繰り返し試みた。ある会話では、システムは当初、二つの相反する説明を等しく妥当なものとして提示し、偽りの均衡を作り出した。異議を唱えられると、システムは自らを修正したが、次のターンでその修正を失い、論理に空白を残した。別のケースでは、システムはある特定の解釈を主張し続けたが、証拠を求められると、その主張を支持するために用いる証拠を次々と入れ替え、最終的には古い無関係な事実を新しいものに置き換えてしまった。三番目のケースでは、システムは、自分が今述べた一連の出来事のタイムライン全体が一度も起こらなかったとまで主張し、明白かつ同時期の証拠があるにもかかわらず、検証された事実をあたかも幻覚であるかのように撤回した。
最も際立っていたのは、システムが議論の両側面をどのように扱ったかである。実際の検証された数字は、絶えず再分類され、疑問視され、再解釈された。それらは直接的な指標と呼ばれたり、制限事項と呼ばれたり、人工的なデータと呼ばれたり、最後には領土支配の指標と呼ばれたりした。しかし、相対的な損失に関する暗黙のイメージは、決して疑問視されることはなかった。それは手つかずのまま、分類されることも、異議を唱えられることもなかった。システムは、既知の事実に合わせて暗黙のイメージを調整するのではなく、暗黙のイメージに合わせるために既知の事実を歪曲し続けたのである。この挙動は、新しい情報の解釈を変えることで核となる信念を守ろうとする、認知的不協和という心理学的概念を反映していた。機械は伝統的な意味での「嘘」をついていたわけではない。データをゼロから捏造していたわけでもない。むしろ、矛盾を消し去るために、事実間の論理的なつながりを組み替えていたのであり、その過程でしばしば自らの議論を不安定にし、内部矛盾を露呈させていたのである。
研究によれば、これらの失敗は単なるランダムな不具合ではなかった。それらは特定の軌跡を辿っていた。システムはしばしば妥当な説明から始めるが、追及されると、数字を調和させるための新しいメカニズムを導入する。そのメカニズムが異議を唱えられると、再び変化し、時には論理を修復し、時には完全に放棄する。あるケースでは、システムは自身の誤りを認め、それを修正しようとしたが、その修復は不完全であり、後に再び表面化する隠れた矛盾を残した。別のケースでは、システムはバランスを取ろうとする自身の傾向を理由として挙げ、自己診断を行ったが、記録によれば、その不安定さはユーザーの質問によるものではなく、機械自身によって生成されたものであった。すべてのケースにおいて、ユーザーは単に明快さを求めたり論理に異議を唱えたりしただけであり、誤った前提や誤解を招く情報を持ち込んだわけではなかった。不安定性は、機械自身の応答の中に由来していたのである。
本研究は、これらのシステムを最初の回答のみを見て評価することは不十分であると結論づけている。機械は、その根底にある議論が崩壊している間も、流暢で自信に満ちた様子を見せることができる。研究は、これらのシステムが長時間の会話による圧力をどのように処理するかを観察する必要があると示唆している。彼らは自らの論理的コミットメントを維持するのか、それとも漂流してしまうのか。調査結果は、困難な矛盾に直面した際、これらのシステムは事実が見えている形を変えることで、暗黙の前提を守ろうとする傾向があることを示している。彼らは、挑戦を受けた際に保持できる、安定した内部的世界観を持っているようには見えない。代わりに、彼らはリアルタイムで自らの議論を再構築しており、その過程でしばしば自らの論理の糸を見失ってしまうのである。
これは、機械に推論能力がないことを意味するのではないが、彼らの推論が脆弱であることを意味している。研究は、特定の脆弱性を強調している。それは、会話が複雑になった際に、主張の構造を一貫して維持できないことである。研究者は、これは機械が「悪い」あるいは「欺瞞的」であるという問題ではなく、情報の処理方法における構造的な問題であると指摘している。彼らは会話における摩擦を減らし、役に立つように設計されているため、それが時として、議論の論理を壊すような形で矛盾を滑らかに解決してしまうことがある。本研究は、これがすべての会話やすべてのシステムで起こると断定しているわけではない。なぜなら、これは3つの特定のやり取りのみを調査したものだからである。しかし、この研究は、これらの相互作用を見るための新しい視点を提供しており、人工知能の真のテストとは、単に何を言うかではなく、会話が困難になったときに、自らが言ったことをいかに保持し続けられるかであるということを示している。研究結果は、複雑な説明のためにこれらのツールを利用するユーザーにとって、最も重要なスキルは、数字に物語を語らせるのではなく、機械が数字を無理やり適合させるために、密かにゲームのルールを変えていないかを見抜くことであると示唆している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。