← 最新の論文
💬 NLP

Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D

本論文は、最先端の言語モデルが標準的な1次元位置エンコーディングの制限によりテキストのコピーに苦戦することを実証し、テキストを2次元グリッドに整理することで、合成タスクおよび大規模な事前学習タスクの両方において優れたコピー性能と汎化性能を実現する手法である2D-RoPEを提案する。

原著者: Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超スマートなロボットに読み書きを教えているところだと想像してください。あなたはロボットに膨大な数の本が入った図書室を与え、ロボットは文章の次の単語を驚異的な正確さで予測することを学びます。このロボットが「大規模言語モデル(LLM)」であり、今日私たちが使っている多くのAIツールの背後にある頭脳なのです。しかし、ここには落とし穴があります。これらのロボットは、人間のように「読んでいる」わけではありません。彼らはテキストを、紐に連なった長い一列のビーズとして見ています。自分がその列のどこにいるかを理解するために、彼らは「位置エンコーディング(positional encoding)」と呼ばれるものを使います。これは、すべてのビーズに「お前は5番目のビーズだ」「お前は100番目のビーズだ」と教える、目に見えないラベルのようなものだと考えてください。

長い間、科学者たちは、これらのロボットは非常に賢くなり、ほとんどあらゆるパズルを解けるようになると考えてきました。しかし、どうしても直せない、奇妙で恥ずかしいグリッチ(不具合)がありました。もしロボットに、見たままの数字や文字の列をそのままコピーするように頼んだ場合、たとえその文字列がメモリに収まるほど短かったとしても、失敗することがあったのです。それは、人間に本の中の一文を書き写すよう頼んだとき、自分が列のどこにいるのか混乱してしまい、単語を飛ばしたり文字を入れ替えたりしてしまうようなものです。大きな疑問はこうです。「詩を書き、数学の問題を解くことができる機械が、なぜ単なるリストのコピーに苦戦するのか?」

この論文は、まさにその謎を調査しています。著者である清華大学の研究チームは、ロボットの「ラベル(位置エンコーディング)」こそが問題であったことを発見しました。テキストにラベルを付ける標準的な方法は、特にテキストに繰り返しのパターンがある場合、ロボットがコピーすべき正確な場所を見つけることを困難にします。特定の位置を見る代わりに、ロボットは近くにある似たような見た目の塊に気を取られてしまうのです。これを解決するために、研究者たちは新しいアイデアを試みました。もし、テキストを一本の長い線として扱うのをやめて、スプレッドシートのように行と列を持つグリッド(格子状)のように配置したらどうだろうか? 彼らは、2D-RoPEと呼ばれる新しいシステムを作り上げました。

この新しいシステムを用いてテストを行ったところ、結果は驚くべきものでした。実験において、2Dグリッドを使用するモデルは、訓練中に見たことのない数百倍も長い文字列であっても、完璧にコピーすることができました。対照的に、標準的なモデルは失敗し続けました。研究者たちは、テキストを行と列に整理することで、コピーというタスクがロボットにとって非常に単純になることを示しました。つまり、上の行の同じ列を見るだけでよいのです。また、彼らは、テキストに明確な改行がない場合でも、グリッド構造を自ら判別できるAuto-2D-RoPEという、よりスマートなバージョンも構築しました。

この論文は、テキストデータの整理方法というこのシンプルな変更が、生のデータをコードに変換するといった、コピーやフォーマットといった基本的なタスクにおいてAIを大幅に向上させ得ることを示唆しています。研究者たちは、この新しい手法が単純なコピー作業において機能することを数学的に証明し、大規模なテストでも有効であることを示しましたが、これはまだ活発に研究されている分野であるとも述べています。彼らは、この発見が他の人々にもAIがテキストをどのように「見ているか」を再考するきっかけとなることを期待しており、時には世界を一直線ではなく二次元として見る方が優れていることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →