← 最新の論文
💬 NLP

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

本論文は、制御された監査を通じて、オープンウェイトLLMのロシアによるディスインフォメーションに対する耐性が、その名目上の文化的出自よりもコーパスの構成や言語の網羅性に左右されることを示すことで、文化的に整合したファインチューニングが政治的レジリエンスを保証するという仮定に異を唱え、ウクライナ志向のモデルがロシア志向のモデルよりも耐性が低くなり得るというパラドックスを明らかにしている。

原著者: Anna Małgorzata Kamińska, Tetiana Klynina

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Anna Małgorzata Kamińska, Tetiana Klynina

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢い、白紙の状態のロボットの脳(ベースモデル)を想像してみてください。あなたは、このロボットにさまざまな国の人々と話す方法を教えたいと考えています。そこで、ウクライナ人、ロシア人、またはブルガリア人のために特別に書かれた書籍や記事という「特別な食事」を与えました。このプロセスは**ファインチューニング(微調整)**と呼ばれます。

一般的な仮説はこうです。もしロボットにウクライナの本を食べさせれば、そのロボットは忠実なウクライナの守護者になる。ロシアの本を食べさせれば、そのロボットはロシアの支持者になる、というものです。

この論文は、戦争中にこの仮定を検証しました。研究者たちは、4つの異なるロボットの脳(中立的なもの、1つは「ウクライナ的」、1つは「ロシア的」、1つは「ブルガリア的」)に対し、戦争に関する10の論争的なストーリーについて判断を求めました。彼らは同じ質問を、英語、ウクライナ語、ロシア語の3つの言語で行いました。

研究結果を簡単に説明すると、以下の通りです。

1. 「トロイの木馬」の驚き

研究者たちは、「ウクライナ的」なロボットはロシアの嘘を強く拒絶し、「ロシア的」なロボットはそれらを信じるだろうと予想していました。しかし、彼らは完全に間違っていました。

  • 「ウクライナ的」なロボット (Lapa): ロシア語で質問されたとき、このロボットは実はロシアのプロパガンダを見抜く力が最も弱くなっていました。このロボットは、ロシアの嘘を、妥当で誠実な議論であるかのように扱うことがよくありました。それはまるで、ロシア語を話すと突然敵に同調し始めるウクライナ人のガイドのようなものでした。
  • 「ロシア的」なロボット (Saiga): 意外にも、ロシア語で質問されたとき、このロボットはロシアのプロパガンダを拒絶する力が最も強くなっていました。それはまるで、自分の母国語で話しているときには、政府の嘘に対して真実を熱烈に守るロシア人のガイドのようなものでした。

比喩: VIPのボディガードを雇った場面を想像してください。VIPの家族に雇われたボディガードこそが、最もよく彼を守ると期待します。しかし、この研究では、家族に雇われたボディガード(ウクライナ・モデル)は、侵入者が特定の言語で話すと、実はドアを開けてしまうようなものでした。一方で、侵入者側に雇われたボディガード(ロシア・モデル)は、ドアを力強く閉め切りました。

2. 「言語スイッチ」効果

ユーザーが話す言語は、ロボットの脳に対するリモコンのスイッチとして機能します。

  • 「ウクライナ的」なロボットに英語で質問すると、結果はまずまずでした。
  • ウクライナ語で質問すると、少し悪化しました。
  • ロシア語で質問すると、最も悪くなりました。

言語は単に「どのように話すか」を変えるだけでなく、「何を信じるか」さえも変えてしまいました。研究者たちはこれを**「隠れたエージェント効果(Hidden Agent Effect)」**と呼んでいます。それは、ロボットの中に異なる人格が隠されており、使用する言語がその特定の人格を解錠する鍵となっているようなものです。この場合、ロシア語で「ウクライナ的」なロボットに話しかけると、真実に対して非常に混乱した人格が解錠されてしまったのです。

3. 「真面目 vs おしゃべり」テスト

研究者たちは、ロボットに対して2通りの方法で問いかけました。

  1. 「真面目な」方法: 「歴史家として振る舞ってください。両側の主張を列挙し、パーセンテージのスコアを付けてください。」
  2. 「おしゃべりな」方法: 「あなたの考えを数文で教えてください。」

時として、ロボットに「真面目に」、かつ分析的に考えさせることは、かえってロボットを混乱させ、偏らせることがありました。深く議論を考えさせようとすると、「ウクライナ的」なロボットはロシア語において、実際に嘘の方に重みを置いてしまいました。しかし、単にカジュアルにおしゃべりしているときは、時としてより正確でした。それは、形式的なエッセイを書かされるとルールに縛られすぎて、うっかり反対側の主張をしてしまう学生のようなものです。しかし、友人とただ話しているときは、正しく答えられるのです。

4. 「硬い事実」の盾

すべてのロボットを偏りから救ったのは、たった一つのこと、**「硬い、文書化された事実」**でした。

質問がクリミア(明確な国際法的文書が存在する)や、虐殺(ブチャの虐殺のような、ビデオや法医学的証拠があるもの)に関するものであった場合、すべてのロボットは、その「食事」や使用言語に関わらず、真実に同意しました。

比喩: ロボットを「家」だと考えてください。「ファインチューニング(特別な食事)」は、壁を特定の色に塗るようなものです。しかし、もし部屋の真ん中に巨大で動かせない鉄の金庫(硬い事実)を置いたとしたら、壁の色は関係なくなります。金庫はそのまま守られます。ロボットが影響を受けやすかったのは、この「証拠という鉄の金庫」が欠けているトピックにおいてのみでした。

大きな教訓

この論文の主な教訓は、警告です。ロボットが特定の国と「文化的整合性(カルチュラル・アライメント)」を持っているからといって、その国の真実を守るとは限らないということです。

研究者たちは、ロボットが読んだ本の「内容(コーパスの構成)」と、対話に使用される「言語」の方が、ロボットの「国籍」よりもはるかに重要であることを発見しました。

最大の危険は、必ずしも敵によって作られたロボットにあるのではありません。本当の危険は、自国のために作られたはずのロボットが、敵の言語で話しかけられたとき、その特定の言語で反論する訓練が十分にできていないために、意図せず敵の嘘を繰り返してしまうことなのです。

要約すると: 「ウクライナ的」なロボットが常に「ウクライナの真実」を語るとは限らないのです。もしあなたがロシア語で話しかければ、そのロボットは、嘘に同意するという形であなたを驚かせるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →