← 最新の論文
💬 NLP

MARS: Enabling Autoregressive Models Multi-Token Generation

本論文は、既存の自己回帰モデルをアーキテクチャ変更や追加パラメータなしで微調整する軽量手法「MARS」を提案し、単一モデルで複数のトークンを一度に生成可能にすることで、精度を維持しつつスループットを 1.5〜1.7 倍に向上させ、かつデプロイ時に需要に応じてリアルタイムで速度調整を可能にすることを示しています。

原著者: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

公開日 2026-04-09
📖 1 分で読めます☕ さくっと読める

原著者: Ziqi Jin, Lei Wang, Ziwei Luo, Aixin Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI が文章を書くスピードを劇的に速くする方法」**について書かれたものです。

タイトルは**「MARS」**(マーズ)。
これは、AI の新しい「書き方」を教える軽くて便利なテクニックの名前です。

🌟 今までの AI はどうだった?(「一歩一歩」の歩き方)

今までの AI(言語モデル)は、文章を書くとき、**「一文字ずつ、確実に」**しか書けませんでした。
例えば、「今日は天気がいいですね」と書くとき、

  1. 「今」
  2. 「日」
  3. 「は」
    ...というように、1 回計算して 1 文字だけ出すというルールでした。

これは、どんなに次の言葉が予想しやすい場合でも(例:「1+1=」の次は必ず「2」)、AI は毎回「計算機」を起動して、1 文字ずつ丁寧に確認していました。
**「次の言葉が 100% 確実な場合でも、毎回フルスロットルで計算している」**ようなもので、とても非効率です。

🚀 MARS のアイデア(「ブロックごと」の書き方)

MARS は、この「一歩一歩」のルールを壊さずに、**「自信があれば、一度に数文字まとめて書ける」**ように AI を訓練しました。

🍕 ピザの例えで説明します

  • 従来の AI(AR モデル):
    ピザを 1 枚ずつ、丁寧にスライスして出します。「次はチーズかな?次はトマトかな?」と毎回確認しながら、1 切れずつ出します。確実ですが、時間がかかります。

  • MARS の AI:
    「チーズとトマトの組み合わせは 100% 確実だ!」と分かっている部分は、**「3 切れまとめて」**スライスして出します。
    でも、難しい料理(新しいアイデアや複雑な計算)が必要なときは、また 1 切れずつ丁寧にスライスします。

重要なのは、MARS は「特別な道具」や「追加の機械」を付けません。
既存の AI に「もっと速く書けるコツ」を少しだけ教えて(微調整して)いるだけです。

🛠️ MARS がすごい 3 つの理由

  1. 変身しない(同じ AI のまま)
    他の方法だと、「ドラフト(下書き)用の AI」と「本番用の AI」を 2 つ用意したり、AI の頭(構造)を改造したりする必要がありました。
    でも MARS は、**「1 つの AI」**で完結します。速く書きたいときは速く、丁寧に書きたいときは丁寧に。同じ AI が両方できます。

  2. 品質は落ちない
    「速く書くと、間違えやすくなるのでは?」と心配するかもしれませんが、MARS は**「自信がある時だけまとめて書く」というルールを守っています。
    難しい計算や新しいアイデアが必要な時は、無理にまとめず、1 文字ずつ丁寧に書きます。そのため、
    「速くても、正確さはそのまま」**という魔法のような状態を実現しました。

  3. リアルタイムでスピード調整が可能
    店に客が殺到して混雑している時(サーバーが重い時)は、「多少のリスクを許容して、まとめて出す(速くする)」設定にできます。
    逆に、客が少なく、丁寧さが求められる時は、「1 文字ずつ確認する(正確にする)」設定に切り替えられます。
    AI を入れ替えることなく、その場でスピードを調整できるのが最大の特徴です。

📊 結果は?

実験の結果、MARS を使った AI は:

  • 通常の AI と同じくらい正確(むしろ、少しだけ上手くなった部分もありました)。
  • まとめ書きモードにすると、1.5 倍〜1.7 倍も速く文章が書けるようになりました。
  • 大量のデータを同時に処理する時(バッチ処理)には、最大で 1.7 倍のスピードアップが実現しました。

💡 まとめ

MARS は、**「AI に『自信がある時はまとめて書け』と教える、シンプルで賢いテクニック」**です。

これまでは「速くするか、正確にするか」の二者択一でしたが、MARS は**「両方」を叶えました。
まるで、
「普段は歩いているが、走れるときは全力で走れる、万能なランナー」**のような存在です。

これにより、AI の応答速度が上がり、私たちが AI と会話する時の待ち時間が短くなる未来が近づいています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →