← 最新の論文
💻 computer science

UniCode: Augmenting Evaluation for Code Reasoning

本論文は、多次元的な問題拡張と自動テストを用いることで、最先端のLLMが真の概念的推論ではなく記憶されたショートカットに依存していることに起因する大幅な性能低下を明らかにし、コード推論におけるそれらの脆弱性を露呈させる生成評価フレームワークであるUniCodeを紹介するものである。

原著者: Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにパズルを解く方法を教えようとしている場面を想像してみてください。長い間、私たちはこれらのロボットに対し、全く同じパズルを何度も繰り返し与えてテストしてきました。もしロボットが正解を出せば、私たちは「わあ、天才だ!」と歓声を上げます。しかし、ここには巧妙な問題が潜んでいます。ロボットは実はパズルを解いているのではなく、以前見た時の答えを単に記憶しているだけかもしれないのです。これは、数学を学ぶ代わりに解答集を丸暗記した学生のようなものです。これは「データ汚染(data contamination)」と呼ばれ、ロボットが実際よりも賢いであるかのように私たちに錯覚させます。これを解決するために、科学者たちは、ロボットが記憶によって「カンニング」できないよう、パズルを絶妙に変化させ、実際に考えさせるための新しいテストを構築しようとしています。

そこで登場するのが、UniCodeです。これは、大規模言語モデル(LLM)――チャットボットやコーディングアシスタントの背後にあるAIの脳――が、本当に推論しているのか、それとも単にふりをしているだけなのかを見極めるために設計された、非常にスマートな新しいテストフレームットです。UniCodeの開発者たちは、次のような疑問を抱きました。「これらのモデルは本当に新しい問題を解くことができるのか、それとも単に記憶されたトリックに頼っているだけなのか?」彼らは、標準的なコーディング問題を自動的にリミックスし、誰も見たことがないような、新鮮でトリッキーなバリエーションを数千通り作成するシステムを構築しました。

研究の結果、驚くべき事実が判明しました。世界最高峰のAIモデルをこれらの新しいリミックス問題でテストしたところ、モデルたちは単につまずいただけでなく、崩壊したのです。平均して、パフォーマンスは**31.2%も大幅に低下しました。AIは馴染みのあるレシピに従うことには長けていますが、シェフが材料を変えた途端に、バラバラになってしまうことが分かったのです。この研究は、著者たちが「シード問題回帰(seed-problem regression)」**と呼ぶ現象を明らかにしました。チョコレートケーキの作り方を学んだロボットを想像してみてください。もしバニラケーキを作るよう頼まれたら、チョコレートをバニラに入れ替える方法を考える代わりに、覚えた通りにチョコレートケーキを作ろうとし続けます。同様に、AIがコーディング問題の新しいバージョンに直面したとき、たとえそのロジックが新しい状況においては間違っていたとしても、古い記憶に基づいたロジックをデフォルトで適用してしまうことがよくありました。

研究者たちは、失敗を見つけるだけでなく、これらのテストを生成するための巨大な自動工場まで作り上げました。彼らは、「ストレス駆動型」のパイプラインを使用して、テストケースを作成し、それらを総当たり攻撃による解法(時間はかかるが100%正しい方法)と照合し、さらには他のAIを使って正解に投票させる仕組みを構築しました。このシステムは非常に優秀で、人間が解法を書くことなく、94.5%の正解率を達成しました。彼らは19種類のトップクラスのモデルをテストし、モデルによって差はあるものの、ほとんどすべてが問題の構造が変わると「脆弱性」を示すことを発見しました。例えば、ルールを少し変えたり、問題を大幅に大きくしたりすると、モデルは適応できず失敗することが多く、その「推論」がいかに浅いものであるかを露呈させました。

要するに、UniCodeは、現在のコーディングベンチマークが、ボスが常に同じ場所に立っているビデオゲームのようなものであることを示唆しています。AIたちは、その特定の場所を完璧に回避することを学習してしまいました。しかし、UniCodeがボスを新しい場所に移動させ、攻撃パターンを変え、アリーナを広くしたとき、AIたちは混乱してしまいます。この研究は、モデルが過去を記憶していることを称賛するのをやめ、未来のロジックを真に理解できるように構築していく必要があると結論付けています。この新しい、より過酷なテストのコードは現在公開されており、私たちのAIの友人がまだどれほど多くのことを学ぶ必要があるのかを、誰もが確かめることができます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →