← 最新の論文
🤖 AI

Full-bandwidth transformer

本論文は、直前の最上位層の隠れ状態を潜在フィードバックを介してモデルに再入力することで自己回帰的デコーディングを強化する新しいアーキテクチャであるフル帯域幅トランスフォーマーを導入しており、これにより、標準的な効率性を維持しつつ、従来のトランスフォーマーよりも大幅に少ない学習データで、様々なタスクにおける性能を向上させる。

原著者: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に難しいパズルを解こうとしている自分を想像してみてください。ただし、あなたには非常に厳しいルールがあります。それは、未来の自分に対して一度にたった一つの単語を「ささやく」ことしかできないというルールです。もし計画の中で複雑なステップを思いついたとしても、それを一つの単語として書き留め、未来の自分がそれを読むのを待ち、それから最初からやり直さなければなりません。これが、今日のほとんどの現代的なAIチャットボットの仕組みです。彼らは読み書きにおいては非常に優秀ですが、思考する際、たとえその思考が複雑なアイデアであっても、一度に一つの単語を「声に出して」話すことを強制されます。これは、情報の詰まった重いバックパックを運んでいるのに、一歩進むごとに未来の自分へはたった一枚のポストカードしか渡せないようなものです。

科学者たちは、これらのAIモデルを「トランスフォーマー」と呼んでいます。これらは私たちが日常的に使っているスマートなチャットボットの背後にあるエンジンです。これらのモデルは二つの方向に働きます。ページ上の単語を横方向に読み取り、そして積み重なった多くの「ニューロン」の層を通じて垂直方向に情報を処理します。問題は、彼らはすでに書き込んだすべての単語を見ることはできるものの、自身の深く複雑な内部の思考を、再び処理するために脳の底へと簡単に送り返すことができない点にあります。一度思考が言葉に変換されると、その思考の豊かで隠された詳細はほとんど失われてしまい、AIは長い言葉による説明を書くか、あるいはすべてをゼロから再計算するかのどちらかを選択することになります。研究者たちは知りたいと考えています。AIが「秘密のメモ」を持ち続け、言葉として書き出すことなく、自分の脳の始点へとそのメモを戻すことはできるのだろうか? もしそれができれば、AIはより少ない言葉で、より速く、より賢く思考できるかもしれません。

この論文は、「フル帯域幅トランスフォーマー(full-bandwidth transformer)」と呼ばれる新しい種類のAIを紹介しています。マイクロソフトやトップクラスの大学の研究者たちは、その狭い「ささやき」のチャンネルを広げる方法を見つけました。単一の単語を始点に送る代わりに、AIが自身の「隠れ状態(hidden state)」、つまりこれまでに考えたことのすべてを凝縮した巨大で複雑な要約を、脳の底へと送れるようにしたのです。彼らはこれを「潜在フィードバック(latent feedback)」と呼ばれる巧妙なトリックを使って実現しています。もし、未来の自分にポストカードを渡す代わりに、バックパックに入ったノートのすべてを瞬時に出発点へとテレポートさせることができ、かつ、自分が何を言ったかの記録としてポストカードも手元に残しておけるとしたら、と想像してみてください。AIは、生成したばかりの新しい単語と、自身の深い内部要約を融合させ、次のステップのための超強力な入力を作り出します。

チームは、学習フェーズの間にこの「テレポート」能力を徐々に導入する特別なスケジュールを用いて、これらの新しいモデルを訓練しました。彼らは10億個のパラメータを持つモデルを、膨大な量のテキスト(最大4000億トークン)を用いてテストしました。結果は、この手法が驚くほどうまく機能していることを示唆しています。AIは数学やコーディングにおいて向上しただけでなく、より短く効率的な方法で考えるようにもなりました。多くのテストにおいて、フル帯域幅トランスフォーマーは、2倍のデータ量で訓練された標準的なモデルと同等の性能を発揮し、時には5倍のデータ量で訓練されたモデルにさえ匹敵しました。おそらく最もエキサイティングなのは、数学の問題を解く際、これらの新しいモデルは正解を出しながらも、しばしば非常に短い回答を生成したことです。これは、彼らが言葉で説明することに浪費するのではなく、頭の中で難しい思考を行っていることを示唆しています。研究者たちは、このアプローチがAIの速度にコストをほとんど追加しないことを発見しており、無限の新しいデータを必要とすることなく、よりスマートで効率的なAIを構築するための有望な方法であることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →