From Traditional Scientists to Agentic AI Research: Unequivocal Diagram-as-Code in Scientific Publications
本論文は、解釈上の曖昧さを排除するために科学出版における「Diagrams-as-Code(コードとしての図表)」の採用を提唱し、それによって将来の科学的発見に向けた科学者、大規模言語モデル、および自律型AIエージェント間の信頼性の高い情報の受け渡しを可能にすることを主張するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
科学は常に、その発見を共有するために、言葉と図という二つの言語に依存してきました。研究者は、複雑な生物学的プロセスをパラグラフの文章で記述したり、細胞の異なる部分がどのように相互作用するかを示す図解を用いて説明したりします。数十年にわたり、これらの手法は人間の読者にとって有用であり、科学者が互いの研究成果の上に積み重ねていくことを可能にしてきました。しかし、言語と画像には、どちらにも隠れた欠陥があります。それは「解釈の余地」があることです。文章は読者の背景によってわずかに異なる読み方をされることがあり、図解は、見る人が形や矢印をどう解釈するかによって理解の仕方が変わることがあります。この曖昧さは人間にとっては管理可能なものですが、科学文献を読み、自律的に発見を行うよう設計された新しい世代の人工知能システムにとっては、重大な問題となります。これらのシステム、すなわち「AIエージェント」は、推測の余地を残さない、精密で一義的な情報を必要とします。もしAIが図解や記述を誤解すれば、その誤りが仕事全体に波及し、誤った結論を導き出すことになります。
最近の研究において、セルビアのノヴィ・サド大学のミラ・グラヴスキ(Mila Glavaški)とラザル・ヴェリチキ(Lazar Velicki)は、この問題に対する解決策を提案しました。彼らは、科学論文に「ダイアグラム・アズ・コード(Diagrams-as-code:コードとしての図解)」を含めるべきだと主張しています。単に静的な画像ファイルをアップロードするのではなく、著者がその画像を生成するために使用した実際のコンピュータコードを提供するのです。このコードは、あらゆる線、形、接続をコンピュータに正確に描画させるための、厳格な数学的指示セットとして機能します。コードは芸術ではなく論理の言語であるため、推測の余地を排除します。コンピュータがコードを読み取るとき、著者が意図した通りの構造を、意味の変容なしに正確に把握することができます。研究者たちは、心不全に関する3つの一般的な科学的内容(原因に関するテキストによる記述、生物学的メカニズムの説明、および患者ケアのための臨床経路)を取り上げ、これらをこのコード形式に変換することで、このアイデアを検証しました。その結果、このアプローチは有効であり、人間の科学者とAIエージェントの両方が、完全な明晰さをもって科学的プロセスを理解できる架け橋を構築できることが分かりました。
研究者たちはまず、科学的情報が現在どのように共有されているかを検討することから始めました。自然言語は表現に無限の多様性を許容する一方で、解釈にも無限の多様性を許容してしまうことに注目しました。ある科学者は心疾患の原因を「高血圧」と書き、別の科学者は「弁の損傷」の結果であると記述するかもしれません。どちらも正しいのですが、具体的な言い回しによって、AIが両者の間のつながりを見落としてしまう可能性があります。同様に、視覚的な図解はシステム内の異なる部分を結ぶ矢印を示しているかもしれませんが、厳密な定義がなければ、AIはその矢印が「原因」を表しているのか、「副作用」なのか、あるいは単なる「関連性」なのかを判断できません。現代のAI開発の目標は、何千もの論文を読み、新しい知識を合成できる自律的な研究者として機能する、自律的な発見システムを創出することです。これを行うために、これらのAIエージェントは、完璧な正確さを持って情報を互いに受け渡す必要があります。もし一つのエージェントが、誤解された図解に基づいて別のエージェントにタスクを引き継いだ場合、研究の連鎖全体が崩壊してしまうのです。
このアイデアをテストするため、グラヴスキとヴェリチキは循環器学(心臓の研究)の分野から3つの明確な例を選択しました。最初の例は、虚血性損傷、圧力負荷、代謝性疾患などの原因を列挙した、心不全の発症に関する様々な方法を説明するパラグラフです。2番目の例は、心不全を臨床的な症候群として定義し、心臓の構造的な問題がいかにして症状につながるかを詳述したものです。3番目は、医師が心不全が疑われる患者を評価するためのステップバイステップのガイドであり、病歴聴取から身体診察までを網羅しています。これらのテキストとともに、それらと同じ概念を視覚的に表現した3つの対応する図解を使用しました。これらの入力が、実験の原材料となりました。
次にチームは、無料版の大型言語モデル(一種のAIチャットボット)を使用して、これらの入力をコードに変換しました。彼らは、テキスト指示を視覚的なチャートに変換するプログラムであるMermaidとD2という2つの異なる図解ツール用のコードを生成するようAIに指示しました。テキスト記述に対するプロンプトはシンプルに「これに対してMermaid図のコードを作成してください」というものでした。既存の画像に対するプロンプトは、より具体的で「この図に対してMermaid図のコードを作成してください。自分自身で何も付け加えないでください」というものでした。研究者たちは、AIがパラグラフのテキストや静止画を見て、別のコンピュータが読み取れる論理的な指示セットへと翻訳できるかどうかを確認したかったのです。
結果は、このアプローチが実現可能であることを示しました。テストされたすべてのテキスト記述と画像に対して、AIはコードの生成に成功し、そのコードを標準的なエディタで実行すると、元の意味と一致する図が出力されました。心不全の共通メカニズムに関するテキストについては、異なる経路がいかにして同じ結果に至るかを示すフローチャートを作成しました。疾患を定義するテキストについては、様々な原因を疾患に結びつける図を作成しました。臨床経路については、初診から身体診察に至るまで、医師が取るべきステップをマッピングしました。また、研究者たちは、AIに図に基づいたコードを生成させるプロンプトを用いることで、元の静止画像をコードに変換しました。AIは、分子メカニズム、病態生理学的カスケード、および臨床経路の視覚的構造を再現するコード指示を生成することに成功しました。
コードが生成された後、研究者たちはそれを盲目的に受け入れることはしませんでした。彼らはMermaidとD2のオンラインエディタで出力を手動でチェックしました。その結果、AIは一般的な構造は捉えているものの、時として微調整が必要になることが分かりました。例えば、矢印の向きを反転させる必要があったり、2つのブロック間の接続を、科学的に正確に反映させるために別の場所に移動させる必要があったりする場合がありました。これらの小さな編集は、コードが意図された表現を完全に反映させるために必要でした。しかし、コアとなる構造を自動的に生成できるという事実こそが、重要な発見でした。コードは情報の不変かつ精密な記録として機能し、視覚的な図解は、コードが正しいことを人間が確認するための手段に過ぎないのです。
研究者たちは、この手法が人間の監視の必要性を代替するものではないことを強調しています。もしAIが「ハルシネーション(AIが捏造する偽の事実)」に基づいてコードを生成した場合、結果として得られる図は誤ったものになります。しかし、彼らが提案するシステムには、組み込まれたチェック機能があります。コードは人間が読める形式であり、即座にレンダリング(描画)できるため、科学者は生成された図を見て、それがテキストや元の画像と一致しているかどうかを即座に判断できます。もし一致していなければ、コードを修正することができます。このプロセスにより、最終的な表現の正確さが保証されます。研究は、将来的に科学論文にこれらのコードスニペットを従来のテキストや画像と共に含めることができると示唆しています。これにより、AIエージェントは、視覚的またはテキスト的な手がかりを誤解することなく、研究の正確なロジックを抽出できるようになります。
この研究の意義は、心不全だけに留まりません。研究者たちは、このアプローチが、プロセスが記述されるあらゆる科学分野に適用できると主張しています。ラボ内での化学物質の流れであれ、医療処置のステップであれ、あるいは生態系のつながりであれ、これらのプロセスをコードとして表現することは、それらを普遍的に理解可能なものにします。これにより、人間の科学者がAIエージェントにプロジェクトを引き継ぎ、そのエージェントが別のAIに引き継ぐ際、各段階で作業の意味が変わらないという保証が得られます。コードはユニバーサルな翻訳機として機能し、自然言語の曖昧さと静的な画像の主観性を取り除きます。
議論の中で、著者らはこの手法の限界についても認めています。それは、すでに知られていることしか表現できません。もし科学的プロセスに、まだ発見されていない未知の要素や関係性が含まれている場合、それらの空白をコードで埋めることはできません。さらに、コードの質は、それを生成するAIの質に依存します。より複雑なプロンプトを使用すればより良い結果が得られる可能性がありますが、研究者たちは、シンプルな指示であっても、システムが十分に有用なレベルで機能することを示しました。また、彼らはMermaidとD2を使用しましたが、PlantUMLやGraphvizといった他のツールも同様の目的で使用できることも指摘しました。特定のツールを使うこと自体よりも、コードベースの表現を持つというコンセプトの方が重要です。
研究は、AIの時代において、科学的情報の共有方法を標準化すべき時期が来ていると結論づけています。ダイアグラム・アズ・コードを採用することで、科学コミュニティは、自らが作り出す知識が人間にとって読みやすいだけでなく、機械にとっても実行可能であることを保証できます。この転換は、科学文献を、静的な文書の集合体から、動的で機械可読なリソースへと変貌させるでしょう。それは、人間の研究者と人工知能との間のシームレスな知識の移転を可能にし、AIエージェントが科学者と協力して、これまで不可能だったレベルの精密さで複雑な問題を解決できる未来への道を切り開きます。研究者たちは、これが単なる理論的なアイデアではなく、既存のツールを用いて今日からでも実装可能な実用的な現実であることを証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。