← 最新の論文
🤖 machine learning

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

本論文は、ChatInventエージェンティック創薬システムのための、人間と整合したLLM-as-a-Judge評価フレームワークを提示するものであり、これは特定の品質次元を定義し、高い整合性を達成するために専門家によるアノテーションを通じてジャッジモデルを検証および最適化し、非公式な言い回しが性能を妨げないことを明らかにしている。

原著者: Emma Granqvist, Rocío Mercado, Samuel Genheden

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Emma Granqvist, Rocío Mercado, Samuel Genheden

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

創薬という極めて重要な世界において、科学者たちは疾患を治療できる分子を設計し、ラボで構築し、それが機能するかどうかをテストするために、何年もの歳月を費やします。このプロセスは遅く、コストがかかり、複雑な意思決定に満ちています。最近、新しい種類の人工知能が登場しました。それは単に質問に答えるだけでなく、行動を起こすシステムです。これらは「エージェンティック・システム(agentic systems)」と呼ばれます。単にテキストを生成するだけの標準的なチャットボットとは異なり、エージェントは多段階の実験を計画し、化学的特性を計算するための専門的なソフトウェアを呼び出し、膨大な科学データベースからデータを取得することができます。それは、単にそれについて語るだけでなく、実際に作業を行うデジタル研究アシスタントのように振る舞います。しかし、これらのデジタルアシスタントがより有能になるにつれ、重大な問題が生じています。それは、彼らがうまく仕事をしているかどうかを、どうやって判断するかという点です。正解となる言葉との一致に依存することが多い従来のコンピュータの回答評価法は、タスクがオープンエンドで創造的な場合には通用しません。さらに、人間の専門家にすべての出力を採点させることは、これらの新しい機械のスピードに追いつくにはあまりにも時間がかかりすぎます。科学界は、高速かつ信頼できる、これらのエージェントを評価する方法を必要としていました。

アストラゼネカとヨーテボリ大学の研究チームは、一つの人工知能が別の人工知能の「審判」を務めるシステムを構築することで、この課題に取り組みました。彼らは、科学者が創薬の各段階を進むのを支援するために設計された「ChatInvent」と呼ばれる特定のエージェント・アシスタントに焦点を当てました。研究者たちは、単にAIに自分自身を採点させることは、モデルに偏りや不整合が生じる可能性があるため、リスクが高いことを知っていました。これを解決するために、彼らは「審判」となるAIが人間の専門家と一致するように、厳格なテストフレームワークを設計しました。彼らは、優れた回答が備えるべき4つの具体的な性質を定義しました。それは、回答が完全であるか、情報が質問に関連しているか、テキストが明快で整理されているか、そしてエージェントが割り当てられた役割の範囲内に留まり、本来すべきでないことをしようとしていないか、という点です。また、エージェントが業務を遂行するために正しいコンピュータ・ツールを使用しているかどうかを確認する厳格なチェックも組み込みました。

最適な審判を見つけ出すために、チームは主要なテクノロジー企業やオープンソース・プロジェクトの選択肢を含む、4つの異なる強力なAIモデルをテストしました。彼らは、化学と人工知能の5人の専門家に、35個の質問と回答のセットを採点させました。これらの専門家には、AI審判と同じ指示と情報が与えられました。研究者たちは、人間のスコアと、各AIモデルによるスコアを比較しました。その結果、人間の専門家同士は必ずしも完璧に一致するわけではありませんでしたが、AIモデルは驚くほど一貫していることがわかりました。特に一つのモデルは、人間の多数派の意見と非常によく一致していました。研究者たちは、この最も優れた性能を示したAI審判を微調整するために、人間の専門家によって注釈が付与された小さな事例セットを使用しました。「最適化」として知られるこのプロセスにより、審判の思考への一致能力が向上し、一致スコアは80%から86%へと上昇しました。

信頼できる審判が整ったことで、チームはChatInventシステムがこれまで見たことのない70個の新しい質問を評価しました。その結果は、エージェントのパフォーマンスにおける強みと弱みの両方を明らかにしました。システムは、トピックから逸れないこと、回答を明確に整理すること、そして情報を収集するために適切なツールを使用することにおいて非常に優れていました。しかし、完全性については苦戦していました。約40%のケースにおいて、エージェントは部分的な回答しか提供しておらず、生成されたファイルの場所や要求された化学的特性などの具体的な詳細を含めるのを忘れることがよくありました。研究者たちは、これがエージェントが質問を誤解したためではなく、ワークフローの最終ステップの実行に失敗したために起こることを発見しました。興味深いことに、質問の仕方も影響を与えました。チームは、非常にフォーマルなものから非常にカジュアルなものまで、幅広い質問をテストしました。その結果、過度にフォーマルな言い回しはエージェントのパフォーマンスを向上させる助けにはならず、むしろ、少しインフォーマルまたは中立的な言い回しの方が、より良い結果をもたらすことがあることがわかりました。これは、エージェントが作業を開始する前に、ユーザーの硬い、あるいは複雑なプロンプトを、より明確なバージョンへと書き換える独自の内部システムを持つことが有益である可能性を示唆しています。

本研究は、これらのエージェンティック・システムは大きな期待を集めているものの、まだ完璧ではないと結論付けています。研究者たちは、審判が専門家の意見と注意深く整合されていれば、人間の判断を模倣する堅牢で自動化された評価システムを構築することが可能であることを実証しました。このアプローチにより、開発者は、人間による採点チームをすべてのテストのために雇うことなく、エージェントがどこで失敗しているのか(例えば、ファイルパスの欠落やデータの不完全さなど)を迅速に特定することができます。この取り組みは、人工知能が科学において真に有用であるためには、まず、人間が専門家として用いるのと同じ注意深さと精密さをもって、自らの仕事を採点する方法を教えなければならないことを示す、将来への設計図となっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →