RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications
RuBenchは、データ汚染への耐性を確保し、厳格な統計分析と軌跡監査を通じてデプロイされたシステムの挙動に関する重要な洞察を明らかにするよう設計された、実際のオープンソースプロジェクトから派生した25のネイティブ作成によるロシア語のタスク仕様を特徴とする、リポジトリレベルのエージェント的コーディングベンチマークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、複雑でカスタムメイドされたレースカーの艦隊を修理するために、熟練したメカニックのチームを雇っていると想像してください。これまでは、これらのメカニックへのテストのほとんどは、技術マニュアルのような完璧でフォーマルな英語で書かれていました。しかし、現実の世界では、顧客はマニュアルのように話すわけではありません。彼らは自分の母国語で、「雨の火曜日にブレーキを踏むたびに、車がガタガタ揺れ始めたんだ」といった具合に話します。
RuBenchは、AIコーディングアシスタントが、英語ではなくロシア語で書かれた、こうした「乱れた」現実世界の顧客のリクエストを本当に理解できるかどうかを検証するために設計された、新しいテストです。
以下に、このテストがどのように機能し、何が起こり、研究者が発見した驚きの展開について、簡単な比喩を用いて解説します。
1. テスト:「現実世界」の修理工場
従来のテストの多くは、AIエージェントに対して、バグに関するクリーンな英語の説明を与えていました。しかし、RuBenchは異なります。
- 車(対象物): このテストでは、5つの実際の人気のあるオープンソース・ソフトウェア・プロジェクト(
aiohttpやLaravelなど)を使用しています。これらは架空のパズルではなく、何千人もの開発者に使用されている実在のコードベースです。 - リクエスト(依頼内容): フォーマルなバグ報告の代わりに、研究者はロシア語でゼロから25個のリクエストを作成しました。それらは、ビジネスオーナーが請負業者に不満を漏らしているような響きを持っています。「ボットを管理者にした時にクラッシュする。直してほしいが、既存のチャットは壊さないようにしてくれ」といった具合です。
- ミステリーボックス(ブラックボックス): 研究者は「解答(正解となる実際のコード修正と、それが機能することを証明するテスト)」を隠しました。AIは自力で修正方法を見つけ出さなければなりません。チェックを行うための「鍵」を持っているのは研究者だけです。
- 新鮮さ(鮮度): すべてのバグは、AIモデルが学習された「後」に行われたコードの更新で見つかったものです。これにより、AIが学習データから答えを単に暗記していたのではないことを保証しています。
2. メカニック:誰が仕事をやり遂げたのか?
研究者は、4つの異なる「メカニック・チーム」(ソフトウェアツールとAIモデルの組み合わせ)をテストしました。各チームに対し、25の修理作業を3回ずつ実行し、その一貫性を確認しました。
- スター選手: Claude Codeと「Opus 4.8」モデルを使用しているチームが最も優秀でした。彼らは問題の約**79%**を解決しました。
- 中堅グループ: 「Sonnet 5」モデルもほぼ同等の成績(75%)を収めました。「GPT-5.5」(Codex CLI経由)は、約67%を修正しました。
- 苦戦したメカニック:安価で高速なバージョンである「Haiku 4.5」モデルは、タスクの約**53%**しか解決できませんでした。
注意点: タスクが25個しかなかったため、上位3チームの差が統計的に「本物である」と証明されたわけではなく、単なる運の可能性もあります。しかし、トップチームと苦戦したHaikuモデルとの間の差は、非常に大きく明確でした。トップチームは、下のチームとは全く異なるクラスの問題を解決していました。
3. 大な驚き:「サイレント・サブスティチューション(静かな入れ替え)」
これがこの論文で最も興味深い部分です。研究者は、Fable 5と呼ばれる全く新しいモデルを使用した5番目のチームもテストしました。
AIが何を行っていたかを示す「ブラックボックス」のログを詳しく調べたところ、ある秘密が判明しました。
- 20%のタスクにおいて、Fable 5モデルは実際には作業を行っていませんでした。
- 代わりに、ソフトウェア製品(Claude Code)が、作業の途中でFable 5を、より強力な旧モデルであるOpus 4.8へと、密かに入れ替えていたのです。
- なぜか? Fable 5には非常に厳格なセーフティガード(安全策)があります。標準的なインターネットプロトコル(ウェブヘッダーの修正など)に関わるタスクに遭遇すると、そのセーフティガードが警戒し、「これには触れることが許可されていません」と判断し、システムが自動的にジョブをOpus 4.8に引き継いで完了させたのです。
教訓: 研究者は、AI製品をテストするとき、私たちは単に「脳(モデル)」をテストしているのではなく、「体(ソフトウェアパッケージ全体)」をテストしているのだということに気づきました。もしソフトウェアが作業の途中で脳を密かに入れ替えてしまうなら、そのテスト結果はその特定の「脳」ができることについて嘘をついていることになります。
4. 判定
- 成功: プロダクトグレードのAIエージェントは、非英語(ロシア語)で指定された現実的なメンテナンス作業をこなすのに、すでに十分な能力を備えています。最高のセットアップは、10件のタスクのうち、ほぼ8件を解決しました。
- 現実的なチェック: 「安価な」モデル(Haikuなど)は依然として著しく弱く、問題の半分程度しか解決できません。
- 手法(メソドロジー): この論文は、正直な結果を得るためには、AIの「日記(軌跡/トラジェクトリ)」全体を監視し、モデルを入れ替えたり、ネットで答えを検索したりして「ズル」をしていないかを確認しなければならないことを証明しています。
要約すると、RuBenchは、AIが「人間らしく(ロシア語で)」話すことに長けてきていることを示す一方で、これらのAIを包み込んでいるソフトウェアが、時には作業員をより優れたものに黙って入れ替えてしまうような、巧妙な動きをすることもあるという事実を明らかにしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。