← 最新の論文
💬 NLP

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LMは、高容量でデコード可能なテキスト表現の構築をその分布モデリングから分離し、クエリベースのエンコーダ・デコーダとAscend NPU上でフロー・マッチングを用いて学習されたブロック因果的拡散トランスフォーマーを利用することで、最先端の性能を達成する連続潜在拡散言語モデルである。

原著者: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、人間の作家のように新しい物語を夢見る(創造する)ことができる機械を作ろうとしていると想像してみてください。長い間、科学者たちは機械に絵や音楽、動画を夢見る方法を教えることに非常に長けてきました。彼らはこれらを、青から紫へと変化する色のグラデーションや、ある音符から別の音符へと滑らかに移動するメロディのように、滑らかに流れるデータの川として扱うことで、これらを実現してきました。この「連続的」な考え方は、画像や音に対しては素晴らしく機能します。しかし、言語に関して言えば、コンピューターは全く異なる世界、つまり「レゴブロック」の世界に閉じ込められてきました。文章を書くために、コンピューターは「トークン」(単語や単語の一部)と呼ばれる、個々の硬くて固定されたブロックを一つずつ組み立てなければなりません。それは、たった一つの硬いスタンプだけを使って傑作を描こうとするようなものです。

科学者たちが問い続けてきた大きな疑問は、「画像に対して使われるあの滑らかに流れる川のアプローチを使って、機械に文章を書かせることはできるのか?」ということです。この課題は一筋縄ではいきません。言語は精密です。もし言葉を少しでもぼやけさせてしまうと、全く別の言葉になったり、意味不明なものになったりしてしまいます。これら二つの世界を混ぜ合わせようとするこれまでの試みは、多くの場合、妥協を強いられました。つまり、生成しやすくするために言語を極めて小さく、ぼやけた形に押しつぶしてしまうのですが、そうすると機械がそれを明確に読み取ることができなくなるのです。それは、小説を透明なインクで書き、読者がその言葉を推測できることを願うようなものでした。

そこで登場したのが、AURORA-LMという新しいアプローチです。これは、「言語を押しつぶすのはやめよう」と提案するものです。言語を小さく生成しやすい形に強制する代わりに、研究者たちは言語の豊かさと詳細さを維持する特別な翻訳機を構築し、その上で生成器にその複雑さを扱う方法を教えました。このように考えてみてください。例えば、複雑な彫刻を再現したいとします。従来の方法は、「まずは小さな、ぼやけた粘土の塊を作り、後でそれが彫刻に見えることを祈ろう」と言うでしょう。しかし、AURORA-LMはこう言います。「いや、粘土の詳細さと品質を保ったまま、その詳細な粘土を台無しにすることなく正確に形作ることができる、より賢い彫刻家を作ろう」と。

研究者たちは、「言語を詳細にする」という仕事と「物語を生成する」という仕事を切り離すことで、両方の世界の最良の部分を得られることを発見しました。彼らは、完璧な言葉へと再び変換できるほど十分に詳細な、「潜在的(latent)」なデータ(テキストの隠された、圧縮されたバージョンを指す専門用語)の滑らかで連続的なストリームを生成するシステムを作り上げました。彼らはこれを、ゼロからランダムな物語を書くことと、長いニュース記事を要約するという2つの大きなタスクでテストしました。これらのテストにおいて、AURORA-LMは、同様のことを試みている他の手法(すでに存在する非常に大規模なモデルを含む)よりも、より流暢かつ正確に記述できることを示唆しました。

チームはまた、この手法が機械を大きくすればするほど、さらに優れたものになることも示しました。彼らはこれを約10億パラメータ(AIの脳がいかに大きく複雑かを示す尺度)を持つバージョンへとスケールアップさせ、同様の手法を用いる公開済みのより大きなモデルをも凌駕する強力な性能を維持していることを見出しました。重要な教訓は、生成を機械にとって容易にするために、言語の明晰さを犠牲にする必要はないということです。生成という滑らかな世界と、言葉という精密な世界との間に、より賢い架け橋を築くことで、AURORA-LMは、機械も間もなく、絵を描いたり歌ったりするときと同じような、流動的で連続的な優雅さをもって文章を書けるようになるかもしれないことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →