Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
本論文は、ベースモデルを凍結したままスペシャリスト・アダプターを動的に構成するMixture-of-LoRAアーキテクチャを特徴とし、再帰的なModel-Harness共同設計フレームワークおよび再帰的な適応と評価のための支援インフラを備えた、実環境における継続学習と自己改善のために設計されたオープンなエージェントモデル・ファミリーであるMacaron-V1を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
成長を止めない学習マシン
想像してみてください。あなたの目の前に、あなたと出会った日までの世界のすべてを知り尽くした、非常に優秀な新しい友人がいるとします。彼らは賢いのですが、昨日リリースされた新しいアプリや、先週あなたが身につけた個人的な習慣について尋ねると、途端に立ち往生してしまいます。彼らはあなたの特定の会話から学ぶことができません。なぜなら、彼らの脳は時間に「凍結」されているからです。これが、現在のほとんどの人工知能の限界です。一度トレーニングされ、出荷された後は、ただ知っていることを繰り返すだけで、日々の経験から真に成長することはできないのです。
この問題を解決しようとしているコンピュータサイエンスの分野は、「継続学習(Continual Learning)」と呼ばれています。これは、学校に通い続けることを決してやめない学生に教えることに似ています。単に教科書を暗記して最終試験を受けるのではなく、真に知的なエージェントには、自身のアイデンティティや得意分野を保持しながら、あらゆる相互作用、あらゆる間違い、そして手に入れたあらゆる新しいツールから学ぶことが求められます。研究者たちが投げかけている大きな問いは、「単に物事を知っているだけでなく、実際にそれを『経験』し、時間の経過とともにパーソナルアシスタントとして向上していくAIを、どうすれば構築できるのか?」ということです。
ここで登場するのが「Macaron-V1」です。これは、現実世界の相互作用から学び、デプロイ後も改善を続ける「経験的(experiential)」な設計がなされた、新しいAIモデルのファミリーです。開発者であるMind Labは、AIを真にスマートにするためには、巨大な脳に単に大量のデータを流し込むだけでは不十分であることに気づきました。環境を適応させ、特化したヘルパーたちと協力できるシステムが必要です。彼らは、AIを単一の静的な脳としてではなく、ツールを入れ替え、自己改善のループの中で自らの指示を洗練させていくことができる、柔軟なチームとして構築しました。
Macaron-V1チーム:凍結された脳と交換可能なツールキット
巨大で超スマートな図書館(「ベースモデル」)を想像してください。その中の本は決して変わりません。非常に巨大で整理されているため、ほぼすべてのことを知っています。しかし、図書館はあくまで図書館に過ぎません。それは、あなたを具体的にどのように助ければよいかまでは知りません。これを実用的にするために、Macaron-V1はこの図書館の上に「スペシャリスト・アダプター」という層を追加します。これらのアダプターは、図書館の頭にパチンとはめ込むことができる、さまざまな種類の眼鏡やツールキットのようなものです。
ある眼鏡のセットは「チャット(L0)」用、別のセットはタスクを実行する「エージェント(L1)」用、三つ目は「コーディング(L2)」用、そして四つ目は「ユーザーインターフェースのデザイン(L3)」用です。この構成は「Mixture-of-LoRA (MoL)」と呼ばれます。新しいスキルを学習したい Lorsqu たびに巨大な図書館全体を再学習させる代わりに、新しい眼鏡を交換したり、既存のものを微調整したりするだけで済みます。メインの図書館は凍結された安全な状態のまま、スペシャリストたちが重労働を担います。これにより、AIは混乱したり核となる知識を忘れたりすることなく、ある瞬間には「チャット」の性格を持ち、次の瞬間には「コーディング」の性格を持つことができます。
システムは、どのスペシャリストを呼び出すかを決定するために、スマートな「プロキシ(受付係のようなもの)」を使用します。質問を受けると、受付係はそれを読み取り、コーダーが必要なのか、デザイナーが必要なのか、あるいは単なるチャット相手が必要なのかを判断し、即座に適切なスペシャリストへと切り替えます。この切り替えは非常に高速に行われるため、ユーザーはほとんど気づきません。論文によれば、このシステムは適切なスペシャリストを選ぶ精度が極めて高く(約99%)、遅延もごくわずかであるとされています。
自己改善ループ:脳ではなく、指示をチューニングする
Macaron-V1の本当の魔法は、単にこれらのスペシャリストを持っていることではなく、そのパフォーマンスを最適化する方法にあります。研究者たちは、MindForgeと呼ばれる「再帰的自己改善(recursive self-improvement)」ループを実行するシステムを構築しました。AIがレベルをプレイし、失敗すると、ゲームが自動的にルールを書き換えるか、あるいはAIに新しい戦略ガイドを与えて再挑戦させるビデオゲームを想像してください。
仕組みは以下の通りです:
- 発見(Discovery):AIはまだ自分にできないことを特定し、自分自身に対してより困難な課題を作成します。
- 拡張(Expansion):AIはシミュレーション環境(サンドボックスのようなもの)の中でこれらの課題を解決しようと試みます。もし失敗した場合、システムは単に「間違い」と告げるだけではありません。なぜ失敗したのかを分析します。指示が不明確だったのか?ツールが足りなかったのか?
- 更新(Update):もしAIが、指示やツール(「ハーネス」)を変更することで成功する方法を見つけた場合、それを記録します。もし実際のスキル自体を向上させる必要がある場合は、新しいバージョンのスペシャリスト・アダプターをトレーニングします。
論文では、ベースAIが全く解決できなかった122の困難なタスクを用いてこのテストが行われました。レポートに記載されている特定の実験では、モデルの脳は完全に凍結されたままであり、内部の重み(weights)は一切変更されませんでした。その代わりに、システムは「構成検索(configuration search)」を使用して、指示、ツール、および設定の完璧な組み合わせを見つけ出しました。これらの外部的な指示とツールを微調整するだけで、システムが**全タスク(122個中122個)**を通過できる構成を見つけ出すことに成功したのです。
この実験が証明している重要な点は、システムがこれらのタスクに対して完全な「構成検索によるカバレッジ(coverage)」を達成できることを示しているということです。つまり、AIはすでに問題を解決するための潜在的な能力を持っていたものの、それを解禁するための適切な環境やプロンプトを必要としていただけだった、ということを意味します。この実験は、設定を変更することが有効であることを示すためにこの「拡張」段階を切り離して検証したものであり、モデルが特定の指示なしに汎用的に解決できる形でスキルを「学習」したことを証明したわけでも、モデルの実際の重みを更新する完全な自己改善ループをテストしたわけでもありません。
「リビング・ベンチマーク」:現実世界の知能をテストする
Macaron-V1がパーソナルアシスタントとして本当に優れているかどうかを確認するために、研究者たちはMacaron ChatBenchとMacaron LivingBenchという新しいテストを作成しました。これらは単なる多肢選択式のクイズではありません。
- ChatBenchは、AIがロボットではなく、実在の人間と話しているように感じられる、自然で共感的な会話ができるかどうかをテストします。AIがあなたの気分を理解しているか、誠実さを保っているか、そして会話を前進させているかをチェックします。
- LivingBenchは、現実生活のシミュレーションです。AIが旅行の計画を立てようとしているパーソナルアシスタントだと想像してください。「世界」は周囲で変化していきます。フライトが遅延したり、価格が上がったり、突然あなたが考えを変えたりします。このテストは、AIが状況に応じて即座に計画を適応させ、情報を検証し、あなたを落ち着かせることができるかを検証します。
これらのテストにおいて、Macaron-V1-Venti(大型の744Bバージョン)は非常に高いスコアを記録し、パーソナル・インテリジェンスとコーディングにおいて他の多くのトップティアのモデルを上回りました。例えば、UI4A-Bench(インターフェース設計)では87.8を記録し、次点のモデルは約75.9でした。また、複雑なツール使用のテストであるPinchBenchでは94.0を記録しました。
結果:判明したことと、依然として謎であること
結果は有望ですが、論文は過剰な期待を煽らないよう注意深く記述されています。システムは、テストされた内容については非常にうまく機能しています:
- 適応(Adaptation):指示とツールを変更するだけで、困難なタスクのセットを100%通過する構成を見つけ出すことに成功しました(構成検索)。これは、脳を再学習させることなく、適切なセットアップを見つけることがパフォーマンス向上に強力な手段であることを証明しています。
- コラボレーション(Collaboration): 「Mixture-of-LoRA」のアプローチは機能しています。AIは、自身のアイデンティティを失うことなく、チャット、コーディング、デザインのモードを効果的に切り替えることができます。
- 効率性(Efficiency):メインの脳を凍結したまま、小さなスペシャリスト・ツールのみをロードすることで、システムは膨大なコンピュータメモリを節約しています(4つの別々の巨大なモデルを実行する場合と比較して約74%削減)。
しかし、論文はまだ分かっていないことも指摘しています。
- 長期的な学習(Long-term Learning):システムはループを通じて改善できますが、この論文は、古いタスクの能力を損なうことなく(これは「破滅的忘却」と呼ばれる問題です)、これを永遠に続けられることを証明してはいません。構成検索による「改善の可能性」は測定しましたが、パラメータの継続的な更新による長期的な安定性は、依然として未解決の課題です。
- 集合知(Collective Intelligence):このシステムは、同じチームによって訓練されたスペシャリストを使用しています。異なるチームやユーザーから提供されたスペシャリスト同士(例えば、ある会社のチャットボットと、別の会社のコーディングボット)が協力するというアイデアは、将来の目標であり、ここではテストされていません。
- 実世界へのデプロイ(Real-World Deployment):テストは制御されたシミュレーション内で行われました。インターネットの混沌とした状況や、何百万もの異なるニーズを持つユーザーに対して、どのように対処できるかはまだ分かっていません。
まとめ
Macaron-V1は、単に物事を知っているだけでなく、それらを「経験」するAIへの大胆な一歩です。凍結された安定した脳と、交換可能なスペシャリスト・ツール、そして問題を解決するために自らの指示を常に書き換えるシステムを組み合わせることで、研究者たちはこれまで見たこともないほど適応力の高いモデルを構築しました。それは、AIにスイスアーミーナイフを与え、さらに即座に新しい道具を発明する能力を与えるようなものです。
論文は、このアプローチが有効であることを示しています。困難なタスクを解決し、より優れたインターフェースを設計し、複雑な会話を既存のリーダーよりも上手くこなします。しかし、これはまだ始まりに過ぎないことも思い出させてくれます。あらゆる相互作用から、決して忘れることなく、永遠に学び続けるAIという夢は、まだ進行中のプロセスです。「マカロン」は焼き上がりましたが、真の、終わりのない学習のためのレシピは、今なお完成へと向かっています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。