← 最新の論文
💻 computer science

Testing JSON Schema Instruction Artifacts: Distributional Robustness under Validation-Equivalent Serialization and JSON Mode

本研究は、バリデーションにおいて等価なJSON Schemaのシリアライズ化であっても、言語モデルの出力分布に統計的に有意かつ実用的に意味のある変化を誘発し得ることを示しており、これはバリデーションの等価性のみでは、展開されたシステムにおける分布の堅牢性を保証するための回帰オラクルとして不十分であることを明らかにしている。

原著者: Shengyao Sun

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Shengyao Sun

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いが、少し融通の利かないロボットに、特定の種類のサンドイッチを作るための指示を出している場面を想像してください。あなたは紙にその指示を書き込みます。ここで、「このサンドイッチのレシピは完璧です」と書かれた魔法のスタンプがあるとしましょう。このスタンプは、必要な材料(パン、チーズ、ハム)がすべて揃っているか、そして誤ってマスタードを入れ忘れていないかをチェックします。しかし、ここには落とし穴があります。スタンプは、あなたが手順をどの順番で書いたかは気にしません。「パンの上にハムを乗せ、次にチーズを乗せる」と書いても、「パンの上にチーズを乗せ、次にハムを乗せる」と書いても、最終的なサンドイッチの構成要素は同じであるため、スタンプは同じ「完璧」という合格判定を出します。

コンピュータサイエンスの世界では、この「スタンプ」はJSON Schemaと呼ばれます。これは、データがどのような姿であるべきかをコンピュータプログラムに伝えるルールブックです。私たちが人工知能(AI)にコードを書かせたり情報を整理させたりする際、多くの場合、このルールブックを指示書として与えます。ここで大きな疑問は、もし私たちが紙に書かれた指示の順番をシャッフルしたとしても(実際のルールや「完璧」というスタンプ自体は変えずに)、AIは全く同じサンドイッチを作るのか? ということです。つまり、順番を変えたせいでAIが混乱し、たとえスタンプのチェックには合格したとしても、少し異なるものを提供してしまうことはあるのでしょうか? これは、もしAIが言葉の順序を変えただけで意見を変えてしまうとしたら、医療記録や財務報告のような重要な仕事において、AIが信頼できなくなってしまうことを意味するため、非常に重要な問題なのです。

この論文は、著者であるShengyao Sunが、AIの「脳」がこれらのルールブックにおける言葉の順序に対して敏感であるかどうかを調査する、探偵小説のようなものです。この研究では、異なるAIモデルに対し、同じルールブックを用いて同じパズルを解かせましたが、その際、指示の書き順を異なるものにしてテストを行いました。彼らは一度きりの検証ではなく、変化が単なる偶然ではないことを確認するために、各バージョンに対して5回ずつ試行しました。その結果、一部のAIシステムにおいては、言葉の順番が重要であったことが判明しました。プロパティ(例えば「名前」や「年齢」など)の順序を入れ替えると、回答はルールブックに従えば技術的には「正しい」ものであったとしても、AIは異なる回答を出し始めることが分かりました。

しかし、すべてのAIにおいて物語が同じであるわけではありません。著者は、この「順序への敏感さ」は、使用している特定のAIシステムによって完全に依存するということを発見しました。「Sonnet」や「Qwen」といったシステムでは、シャッフルによって回答に顕著な変化が生じ、通常よりも約5%から12%多く不一致が発生しました。しかし、「GPT」や「DeepSeek」といったシステムでは、シャッフルによる影響はほとんどありませんでした。研究では、特別な「JSONモード」(AIにフォーマットをより厳格に守らせる設定)がこの問題を解決するかどうかも検証されました。驚いたことに、解決しませんでした。厳格なモードであっても、AIは言葉の順序によって依然として混乱が生じていたのです。

最も重要な教訓は、コンピュータプログラムが指示セットを「有効」または「正しい」と判定したとしても、それはAIがフォーマットを微調整した際に同じように振る舞うことを保証するものではない、ということです。著者は、もはや「スタンプ」だけを信頼すべきではないと示唆しています。代わりに、これらの指示セットをソフトウェアコードのように扱うべきです。つまり、標準的な順序(例えば、常に材料をアルファベット順に並べるなど)に固定し、実世界で運用する前に注意深くテストする必要があります。この研究は、バリデーション(妥当性確認)だけでは不十分であることを証明しています。指示が並べ替えられたときにAIの挙動が安定しているかどうかを確認する必要があります。なぜなら、一部のAIにとって、言葉の順序は密かにレシピの一部となっているからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →