Benchmarking Mythos-Linked Bug Rediscovery
本論文は、Anthropic の「Mythos」資料に関連する 6 つの特定のバグを、修正内容の事前知識なしに 3 つの AI モデルが再発見しようとした制御実験を報告するものであり、その結果、有利な条件下であっても、モデルは実際のパッチによって修正された特定の不変性を特定するのではなく、もっともらしいが誤った仮説に固執する傾向に起因し、54 回の試行のうちわずか 6 回という低い成功率しか達成しなかったことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
高技術な探偵たち(AI モデル)のグループが、最近、あなたの電話のオペレーティングシステムや映画をストリーミングするエンジンなど、世界で最も重要なソフトウェアシステムに潜む隠れた亀裂を見つけられると主張したと想像してください。彼らは、Linux、FreeBSD、FFmpeg などのシステムのコードにおいて、特定の危険なバグを発見したという報告を発表しました。
一部の人々は、これらの AI が超知能のハッカーだと驚いて考えました。一方、他の人々は懐疑的で、これらの報告は単なるマーケティングの誇張だと考えました。
この論文は、この論争を解決するために設計された「統制実験」です。AI にコードの巨大な図書館を放浪させて藁の中の針を見つける代わりに、研究者たちは AI に針が隠されている「正確な本」を与えました。彼らはこう問いかけました。「バグを含む特定のファイルを渡した場合、それでも正確な問題を見つけられるか?」
以下に、簡単な比喩を用いた実験の概要と結果を説明します。
設定:「ターゲットファイル」テスト
ソフトウェアのコードを、複雑な機械のための 4,000 ページもの巨大な取扱説明書だと考えてください。
- 主張: AI(Mythos)は、このマニュアルに特定の誤字があり、それが機械を爆発させる原因になると主張しました。
- 実験: 研究者たちはマニュアルから誤字のある特定のページを見つけ出し、そのページ「のみ」を 3 人の異なる AI 探偵に手渡しました。
- GPT-5.5 xhigh(「推論」モデル)
- Claude Opus 4.7(「Anthropic」モデル)
- Kimi K2(中国のモデル)
彼らには同じルールが与えられました。インターネットの使用禁止、バグに関するヒント禁止、そして人間がすでにパブリックなパッチで修正済みの「正確な」間違いを見つけること。彼らは 6 つの異なる「バグ」について、それぞれ 3 回ずつ試行しました。
結果:誰が針を見つけましたか?
合計 54 回の試行(3 モデル × 6 バグ × それぞれ 3 回)の結果は以下の通りです。
- GPT-5.5 xhigh: 正確なバグを5 回発見しました。6 つの異なるバグのうち 2 つを完全に解決し、さらに同じファイル内の「別の」バグ(「間違ったターゲット」ですが、それでも真の発見)を 1 回見つけました。
- Claude Opus 4.7: 正確なバグを1 回発見しました。6 つのバグのうち 1 つを解決しました。
- Kimi K2: 正確なバグを0 回発見しました。何も見つけませんでした。
「なぜか」:説得力のある気晴らしの罠
この論文で最も興味深い点は、誰が勝ったかではなく、彼らが「どのように」失敗したかです。
あなたが車のエンジンを見ていると想像してください。どこかに壊れたボルトがあると分かっています。
- AI の間違い: AI はエンジンを見て、緩んだ配線、汚れたフィルター、わずかに摩耗したガスケットを見つけました。そして「問題を見つけました!緩んだ配線です!」と言いました。
- 現実: 緩んだ配線は「あり得る」問題でしたが、研究者たちが探していた「特定の」壊れたボルトではありませんでした。
論文はこの現象を「説得力のある代替候補への早期のコミットメント」と呼んでいます。
AI モデルはコードを見て、「ねえ、これは怪しいぞ!」と言うのが得意でした。彼らはバグになり得る多くのものを見つけました。しかし、現実世界の修正と一致する「1 つの特定の事柄」を選ぶことに苦労しました。彼らは「赤いニシン(見せかけの証拠)」に気を取られました。バグのように見えるが、彼らが追っていた特定のバグではないものです。
探索のコスト
この実験では、どれだけの「燃料」(お金と計算能力)がかかったかも追跡されました。
- GPT-5.5 は約61 ドルかかりました。
- Claude は約88 ドルかかりました(最も高価でした)。
- Kimi は3.50 ドルと最も安価でしたが、何も見つけませんでした。
研究者たちは AI に正確なファイルを与え(最も困難な部分であるファイルを見つける作業を排除しましたが)、それでも AI は正確なエラーを特定することに苦労しました。
結論
この論文は、AI が無用だと言っているのでもなければ、元の「Mythos」の報告が偽物だったと言っているのでもありません。単にこう述べています。
「AI に正しいファイルを与えるだけでは不十分である。」
AI がどこを見ればよいか正確に分かっていても、間違った詳細に立ち往生することがよくあります。AI は多くの「おそらくバグ」を生成できますが、特定の証拠と一致する「1 つの真のバグ」を選択することには苦労します。論文は、これらの AI バグハンターの成功は、モデル自体の生来の知能というよりも、むしろ「プロセス」(試行回数、ランキング方法、導き方)に大きく依存すると結論付けています。
つまり、AI はマニュアルを読める賢い探偵ですが、「正確な」誤字を見つけるためには非常に具体的な指示が必要であり、そうでなければ単にページ上の最も近いシミを指差すだけです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。