← 最新の論文
🤖 AI

AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups

本論文は、研究グループが暗黙知を捉えることを支援すると同時に、オープンウェイトモデルの使用を通じて透明性、再現性、およびプライバシーに関する科学的な懸念に対処するように設計された、オープンソースでモジュール式のRAG-LLMフレームワークであるAquiLLMの、アーキテクチャ上の強化および機能拡張について提示するものである。

原著者: Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan Do

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

研究室で協力して働く科学者たちのグループを、ガレージでジャムセッションをするバンドのように想像してみてください。彼らには楽譜(公開論文)があり、楽器(データ)もありますが、本当の魔法は、記録に残らない、ぐちゃぐちゃとした瞬間に起こります。それは、内輪のジョークや、「あのノブには触るな」という警告、そしてその場で編み出された巧妙なショートカットのようなものです。これは**暗黙知(tacit knowledge)**と呼ばれます。それは、本で読んだから知っていることではなく、実際にやってきたからこそ知っていることです。通常、バンドのメンバーが去るとき、その秘密の知識も一緒に外へ持ち出されてしまいます。

これを解決するために、科学者たちはAI(人工知能)を、グループのための「超記憶」として活用しようとしています。AIを、図書館にあるすべての本を一瞬で読むことができる、非常に速くて賢い司書だと考えてみてください。しかし、こうした「司書」のほとんどは大企業によって所有されています。ここに問題が生じます。もしあなたが企業の司書に質問をした場合、彼らは次の司書を訓練するためにあなたの質問のコピーを保持したり、答えを見つけるためにどのように辿り着いたのかを正確に示さなかったりするかもしれません。科学者にとって、自分の仕事を検証でき、かつデータをプライバシーとして守る必要がある場合、これは受け入れがたいことです。彼らは、自分で構築でき、自分の家の地下室に置いておくことができ、完全に信頼できる司書を必要としているのです。

ここでAquiLLMが登場します。これは、研究グループがその「ぐちゃぐちゃとした、言葉にならない知識」を捉えるために設計された、新しいオープンソースのツールです。論文では、AquiLLMを、グループ自身のコンピュータ上で動く、役立つローカルな研究助手のようにアップグレードする方法が説明されています。データをクラウドに送る代わりに、**RAG(検索拡張生成)**を使用しています。RAGを、AIが自分の脳から答えを推測するのではなく、まず特定の書棚へ走り、必要なページを正確に掴み取り、それを音読して質問に答えるシステムだと想像してください。これにより、AIは作り話をするのではなく、そのグループが実際に持っている事実に忠実であることを保証します。

この論文の著者たちは、単に基本的なバージョンを作ったのではありません。彼らは、実際の科学者(天体物理学者など)が本当に必要としているものに基づいて、大幅な模様替えを行いました。彼らは、AIがテキストを読むだけでなく、画像やチャートを「見る」ことができる機能を追加し、さらに、プロジェクトを混同することなく、あなたが誰であり、以前何を話したかを覚えている「記憶」を与えました。また、システムをモジュール式にしたことで、ロボット全体を作り直すことなく、脳や目といったパーツを交換できるようになりました。

論文は、これらのアップグレードにより、システムが現実の科学が持つ複雑で視覚的、かつ協調的な性質を扱う上で非常に優れていることを示唆しています。しかし、著者たちは、システムが文書内の事実を見つけることは得意である一方、多くの異なる情報源をまたいで情報を比較したり、「記憶」がいっぱいになったりした場合には、まだ少し苦戦することを注意深く述べています。彼らはこれが完璧であると証明したわけではありません。単に、プライバシーを尊重し、チームの集合知を守るための有望な一歩であることを示したのです。

大規模なアップグレード:不器用なロボットからスマートなラボ・パートナーへ

では、チームは具体的にAquiLLMに何をしたのでしょうか?元のシステムを、役に立つけれど少し不器用なロボットだと考えてみてください。それは話すことはできましたが、動作は遅く、画像を見ることができず、5分前に言ったことを忘れてしまうこともありました。新しいバージョンは、そのロボットに脳移植を行い、新しい目とパーソナルなノートを与えたようなものです。

1. 「ローカルな脳」と「ローカルな図書館」
最大の変更点は、すべてがグループ自身のコンピュータ上で完結することです。チームは、高価で外部の商用サービスを利用する必要性を、オープンウェイト・モデルに置き換えました。問題を解決するために有名な高価なコンサルタントを呼ぶ代わりに、自宅に住む優秀な家庭教師がいる状況を想像してください。このチューター(AIモデル)は無料で利用でき、彼らが取るメモはすべてあなたが所有します。チームは具体的に、チャット用にQwen3.6-27B、画像を見るためにQwen3-VLのようなモデルを選択しました。また、外部の検索ツールをローカルなものに置き換えたため、「検索エンジン」の部分もクラウドではなく、グループの地下室に存在することになります。これにより、未発表の研究やプライベートなメモといった機密データが、インターネット上に完全に隔離されます。

2. AIに「目」を与える(マルチモーダル機能)
科学は言葉だけではありません。グラフ、星の写真、図解などが重要です。旧システムはこれらに苦戦していました。新しいAquiLLMは、今や「見る」ことができます。マルチモーダル・モデルを使用することで、グラフの画像を見て、その線の意味を理解し、人間と同じようにそれについて語ることができます。これは、メニューを読めるだけのロボットから、皿の上の料理を見てその味を教えられるロボットへのアップグレードのようなものです。これは、論文の図を、ピクセルの一つひとつをテキストで説明することなく議論したい研究者にとって、極めて重要です。

3. 「個人の記憶」対「共有ノート」
最も素晴らしい新機能の一つは、**メモリ・レイヤー(記憶層)**です。友人と会話をしている場面を想像してください。挨拶をするたびに、自分の人生の物語を最初から説明し直したくはないはずです。新しいシステムには、2種類の記憶があります。

  • 安定した事実(Stable Facts): これは永久的なIDカードのようなものです。あなたの名前、お気に入りの研究テーマ、そしてあなたの口調を覚えています。
  • エピソード記憶(Episodic Memory): これは最近のチャットのダイアリー(日記)のようなものです。もし昨日、特定の星団について質問していたなら、AIは今日、その文脈を覚えています。
    決定的なのは、この記憶はユーザーとプロジェクトに対してプライベートであることです。他の誰かのデータと混ざることはありません。論文では、この記憶はオプションであり、オンにする必要があると記されています。なぜなら、保存しすぎると煩雑になるからです。もし記憶が失敗しても、システムは単にドキュメントへとフォールバック(退避)するため、会話全体が壊れることはありません。

4. 「スキル」と「スキルパック」
これは、特定のチームがどのように動いているかをAIに教えるための巧妙な方法です。新しいインターンがラボに加わった場面を想像してください。彼らは特定のルールを知る必要があります。「常にデータを青色でプロットすること」や「実験を実行する前にこのチェックリストを確認すること」などです。新しいシステムでは、これらのルールは**スキル(Skills)**としてまとめられています。研究者が特定のプロジェクトに関するチャットを開始すると、AIは自動的にそのプロジェクトの「スキルパック」をロードします。これは、AIがどのチームと話しているかに応じて、異なる帽子を被るようなものです。分光チームには一つの指示セットが、光度測定チームには別の指示セットが与えられ、AIが混乱することはありません。

5. 「スマートな司書」(コンテキスト・パッキング)
AIには、一度に読める情報の限界(「コンテキスト・ウィンドウ」)があります。図書館丸ごとを与えると、圧倒されてしまうかもしれません。チームは、**サリエンス認識型コンテキスト・パッキング(salience-aware context packing)**システムを追加しました。これは、あなたが尋ねている質問に対して、本のどのページが最も重要かを正確に知っている、非常に効率的な司書のようなものです。本をランダムに途中で切り捨てるのではなく、システムは情報をランク付けします。「この文章は極めて重要である」「この画像は関連している」「この古いチャットメッセージは要約可能である」。そして、LLMLingua-2というツールを使用して、意味を失うことなくテキストを圧縮し、AIがクラッシュすることなく、より多くの重要な情報を「脳」の中に収められるようにします。

現実的な検証:何がまだ難しいのか?

著者たちは、このシステムがまだ「できないこと」についても非常に正直です。彼らは、これが魔法の杖であるとは主張していません。

  • ハイブリッド構造: システムは依然として、古いコードと新しいコードの混合物です。一部のパーツはローカルコンピュータ上で完璧に動作しますが、他の部分はまだクラウド向けに設定されています。これにより、どの「モード」にいるかによって挙動が変わるなどの、奇妙な不具合が生じることがあります。
  • メモリのラグ: メモリの更新は(チャットの速度を維持するために)バックグラウンドで行われるため、わずかな遅延が生じます。何か新しいことを伝えた直後に質問した場合、AIがまだそれを「聞いて」いない可能性があります。
  • 「暗黙知」のテスト: チームは、天文学の論文のようなフォーマルな文書を用いてシステムをテストし、良好な結果を得ました。しかし、Slackのメッセージ、会議の議事録、あるいはコードのコメントといった、より「ぐちゃぐちゃとした」ものについては、まだ十分にテストできていないと認めています。このようなインフォーマルな「暗黙的」知識を捉えることこそが、次の大きな課題であると彼らは示唆しています。
  • 速度 vs 知能: システムは高速ですが、時には速度と正確性の間で選択を迫られます。コンピュータのメモリ(VRAM)が不足すると、速度を落とすか、情報を切り捨てる必要があります。

まとめ

AquiLLMは、科学研究における重要な一歩です。それは、AIは企業が所有するブラックボックスでなければならないという考えから脱却し、研究者の手に取り戻すものです。システムをローカル、マルチモーダル、そしてメモリ認識型にすることで、科学のプライバシーとワークフローを尊重しています。論文は、これが完璧な解決策ではないものの、研究グループの集合的な脳を、メンバーの入れ替わりに関わらず維持するための強力なプロトタイプであることを示唆しています。これは解決済みの問題ではなく、協調的な科学の未来に向けた、非常に有望な試みです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →