← 最新の論文
💬 NLP

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

本論文は、大規模言語モデルによるクロスリンガルな機械学習パイプライン生成を評価するための初のベンチマークであるML2Bを紹介するものであり、14言語にわたる490のタスクと言語のペアを用いることで、性能の低下は従来の資源の階層構造に従うのではなく、タスクに強く依存していることを明らかにしている。

原著者: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたが「どの顧客が私たちの新しい靴を買うかを予測して」といった単純なリクエストを入力するだけで、超スマートなロボットが機械学習モデルを構築してくれる世界を。長い間、これらのロボット――「大規模言語モデル(LLM)」と呼ばれるもの――は、英語で話しかければ驚くほど有能でした。それは、もしレシピを英語で渡せば一流の料理を作れる素晴らしいシェフがいても、フランス語やスペイン語、あるいは日本語でレシピを渡すと、材料をただ見つめたままキッチンを台無しにしてしまうようなものです。

これが、研究者たちが取り組んでいる問題です。AIが世界中に広がるにつれ、私たちはこれらのデジタル・シェフが、主に学習に使われた言語だけでなく、あらゆる言語で指示に従うことができるのかを知る必要があります。しかし、一つ問題があります。もし彼らに、すでにインターネット上に存在するパズルを解かせようとすると、ロボットは学習データから答えを暗記してしまっている可能性があり、実際よりも賢く見えてしまうかもしれません。それは、生徒にすでに答えを知っている数学のテストを与えるようなものです。生徒はAを取りますが、本当に代数学を理解しているかどうかは分かりません。真実の姿を知るためには、新鮮で公平、かつ多くの言語で話されるテストが必要です。

そこで登場したのが、研究チームによって作成された新しい「試験」、ML2Bです。これは、指示が14種類の異なる言語で行われる中で、AIロボットがどれだけ優れた機械学習パイプラインを構築できるかをテストするためのものです。ML2Bを、大規模な多言語料理コンテストだと考えてください。研究者たちは、ロボットに単に一行のコードを書かせるのではなく、住宅価格の予測、犬の品種の特定、有害なコメントの検出といった35の実世界の課題を与え、それらの指示をアラビア語や中国語からカザフ語、ウクライナ語に至るまで、さまざまな言語に翻訳しました。

ロボットが答えを暗記してカンニングできないようにするために、チームは解答が一度も公開されたことのない10個の「秘密の」コンペティションを含めました。また、ロボットがコードを調理するための、特別に隔離されたデジタル・キッチン(ネットワーク分離されたコンテナ)も構築しました。もしロボットがインターネットから既製品の料理をこっそり持ち込んだり、調理前に材料を混ぜ合わせてしまう問題(「データリーク」と呼ばれるもの)を起こしたりすれば、システムがそれを見つけ出します。ロボットは、本物のシェフが料理が完成する前に味見をしないのと同様に、「学習」フェーズと「予測」フェフェーズを分けるといった厳格なルールに従わなければなりませんでした。

研究者がトップクラスのAIモデルを用いてテストを行ったところ、多くの人が想定していたことを覆す驚くべき結果が出ました。彼らは、ロボットは「低リソース」言語(デジタルデータが少ない言語)で最も苦戦し、「高リソース」言語である英語やフランス語で最も高いパフォーマンスを発揮すると予想していました。しかし、結果は言語そのものが主役ではなかったことを示しました。難易度は、ロボットに「何をさせられているか」というタスクの内容に完全に依存していたのです。ロボットが英語よりも「低リソース」言語でうまく機能することもあり、逆に「高リソース」言語で失敗することもありました。

この研究は、真のボトルネックは単に言葉を知っていることではなく、機械学習モデルを構築するという複雑でステップバイステップの指示に従うことにあることを示唆しています。研究者たちは、ロボットが失敗するのは言語を理解できなかったからではなく、コードの構造をミスしたからであることが多いと発見しました。例えば、括弧を閉じ忘れたり、使用しているソフトウェアのバージョンに存在しないツールを使用したりといったことです。あるモデルであるGPT-4.1-miniは、高品質なアイデアを出すことには長けていましたが、仕事を正しく完了させることに失敗することがよくありました。一方で、もう一つのGPT-OSS-120bは、ルールに従うことにはより信頼できましたが、時としてより単純な結果しか出しませんでした。

結局のところ、ML2Bは、AIが多くの言語を話せるからといって、あらゆることに長けていると決めつけてはいけないということを明らかにしています。複雑なツールを構築する能力は、指示される言語ではなく、その特定のタスクに大きく依存しています。著者たちは、このベンチマークを公開することで、開発者が、どのような言語で、どのような問題を解決するように求められたとしても、真に堅牢で信頼できるマルチリンガルなロボットを構築できるようになることを願っています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →