← 最新の論文
🧬 biology

MoleCode unlocks structural intelligence in large language models

MoleCode は、SMILES などの暗黙的な線形表現を明示的な構造関係に置き換えるトレーニング不要のグラフ明示的分子言語を導入し、大規模言語モデルが複雑な化学タスクにおける性能向上のために分子トポロジーを直接推論・操作できるようにする。

原著者: Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Zhiyuan Yan, Chen Liu, Boxuan Zhao, Kaiqing Lin, Jixiang Zhao, Yimi Wang, Liuzhenghao Lv, Hao Li, Shanzhuo Zhang, Li Yuan, Fanyang Mo

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

この論文を、平易な言葉と創造的な比喩を用いて解説します。

問題:分子の「謎の箱」

あなたが建築家だと想像してください。しかし、明確な壁、ドア、窓が描かれた設計図の代わりに、家について記述した単一の長い文章を渡されます。

「レンガから始めて、左へ進み、右に曲がり、ここに窓を置き、次にドアを置き、そしてスタート地点に戻るレンガのループを……」

これが、現在の AI モデル(大規模言語モデル、LLM)が分子を通常どのように捉えているかです。分子を表す標準的な方法はSMILESと呼ばれます。これは、分子の実際の 3 次元の形状や結合を、コードの一行の中に隠した、コンパクトなテキストの文字列です。

AI が SMILES で書かれた分子を理解しようとするとき、それは多くの精神的なアクロバットを強いられます。文章を読み、一時停止し、「待て、屋根が安全かどうか、あるいは新しい部屋を追加できるかどうかを判断する前に、頭の中で家全体を再構築しよう」と言う必要があります。この「再構築」のステップは遅く、エラーを起こしやすく、家(分子)が巨大な場合や、AI がその特定のデザインを一度も見たことがない場合、はるかに困難になります。

解決策:MoleCode(「レゴの設計図」)

研究者たちは、MoleCodeという新しい言語を導入しました。MoleCode を文章ではなく、デジタルのレゴ説明書スプレッドシートだと考えてください。

長く混乱を招く文章の代わりに、MoleCode はすべての部品(原子)とすべての結合(結合)を明示的にリストアップします。

  • 原子 1は炭素です。
  • 原子 2は酸素です。
  • 結合: 原子 1 は原子 2 とつながっています。

この形式では、「設計図」が AI の目の前にそのままあります。AI は形状を推測したり再構築したりする必要はありません。形状はすでに視認可能で編集可能です。

試した結果はどうだったか?

チームは、最先端の AI モデルを用いて、この新しい言語をいくつかのタスクでテストしました。彼らが発見したことを、簡単な比較を用いて示します。

1. パズルを解く(推論)

  • 旧来の方法: 複雑で未知の家にある窓の数を尋ねられたとき、SMILES を使用する AI は長い文章に行き詰まり、誤った答えを出すことがよくありました。
  • MoleCode の方法: MoleCode を使えば、AI は部品リストを見て瞬時に数を数えることができました。複雑な分子や未知の分子において、化学反応の予測や原子の数のカウントなどのタスクで、AI の性能は劇的に向上しました。

2. 家の改築(最適化)

  • 旧来の方法: 「この家をよりエネルギー効率よくして」と AI に頼むと、それは構造全体を解体して全く異なるものを建てたり、家を壊すような変更を加えたりすることがありました。
  • MoleCode の方法: AI がどの「レンガ」(原子)がどこにあるかを正確に把握できたため、構造を壊すことなく家を改善する、小さく精密な変更(例えば、窓をより良いものに取り替えるなど)を行うことができました。より賢く、安全な編集が可能になりました。

3. 速く考える(効率性)

  • 旧来の方法: AI は「考える時間」のほとんどを、分子がどのような形をしているか理解しようとするのに費やしていました。まるで、数学の問題を解く前に 10 分間地図を描くことに費やす学生のようなものです。
  • MoleCode の方法: 地図は最初からあるため、AI は地図を描くのに時間を費やさなくなりました。MoleCode の「指示」は読むのに時間がかかるものの、AI は考える時間を減らし、結果としてより迅速かつ正確なプロセス全体を実現しました。

4. 高層ビルを建てる(高分子)

  • 旧来の方法: 高分子は、繰り返されるリンクの巨大な鎖のようなものです。これらを文章(SMILES)で書き出すと、巨大で読み解けないテキストのブロックが生まれます。AI は混乱して失敗しました。
  • MoleCode の方法: MoleCode は、これらの鎖を「このブロックを 100 回繰り返せ」という指示として扱います。AI はこれらの巨大で反復的な構造を完璧に処理できましたが、旧来の方法は長いテキストの重みによって崩壊しました。

5. 複雑な文書を読む

  • 研究者たちはまた、MoleCode が単一の分子だけでなく、より広範な用途でも機能することを示しました。これは、テキストと図を混ぜた科学論文や特許を読み、それらを単一の組織化されたグラフに変換できます。さらに、「マルクシュ構造」(「ここに任意の果物を入れてください」のように可変部分を持つ化学式)も処理できます。これは、標準的なテキスト形式では記述するのが非常に困難です。

大きな教訓

この論文の主な教訓は、科学について AI とどのように対話するかという点にあります。

現在、私たちは AI に科学の形状をテキストに変換させ、その後、そのテキストを頭の中で再び形状に変換させています。この論文は、私たちが研究している対象が(分子のような)構造であるならば、AI には作業するための構造的な言語を与えるべきだと主張しています。

「謎の文章」(SMILES)から「明示的な設計図」(MoleCode)へと切り替えることで、AI は分子がどのような形をしているか推測することにエネルギーを浪費するのをやめ、実際に化学の問題を解決するために脳を使うようになります。

限界に関する注記: この論文は、MoleCode が AI に元々持っていなかった化学知識を魔法のように与えるわけではないと明確にしています。AI が化学を知らないなら、それでも化学を知らないままです。しかし、MoleCode は、AI がすでに持っている知識を、はるかに効果的に活用することを可能にします。また、新しい言語は古いものよりも入力に時間がかかりますが、AI が考える時間を減らし、より多くの成果を上げるというトレードオフは価値があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →