← 最新の論文
⚛️ biophysics

BioSecBench-Function: A Verifiable Benchmark for Reasoning about Biological Function from Experimental Data

本論文は、AIエージェントが実験データから生物学的機能を正確に推論する能力を評価するために、7つのバイオセキュリティに関連する質問タイプにわたる111の評価で構成される検証可能なベンチマークであるBioSecBench-Functionを紹介しており、モデル間での大幅な性能のばらつきを明らかにし、コストが精度を予測する信頼できる指標ではないことを強調している。

原著者: Wang, D., Xu, Q., Banerjee, A., Jain, R., Vermani, A., Felix, J., Moreno, G., AlZaben, F., Keul, N., Seeyave, E., Bhasin, H.

公開日 2026-09-08
📖 1 分で読めます☕ さくっと読める

原著者: Wang, D., Xu, Q., Banerjee, A., Jain, R., Vermani, A., Felix, J., Moreno, G., AlZaben, F., Keul, N., Seeyave, E., Bhasin, H.

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

技術要約:BioSecBench-Function

問題提起
実験データから生物学的機能を推論することは、新興病原体の理解や対抗策の開発において極めて重要なボトルネックとなっている。現在、この解釈プロセスは、速度が遅く、人間の専門知識に大きく依存しているという特徴がある。AIエージェントは、配列、構造、生物物理学的データを含む多様な証拠を横断的に推論することで、このワークフローを加速させる可能性を秘めているが、これらのエージェントが現実世界の生物学的データセットからバイオセキュリティに関連する機能を確実に復元できるかどうかを評価するための、標準化された検証可能なフレームワークが不足している。

手法
このギャップに対処するため、著者らは、実験データから生物学的機能を復元するタスクにおけるAIエージェントを評価するために設計された、検証可能なベンチマークであるBioSecBench-Functionを導入する。このベンチマークは公開されたデータセットから構築されており、客観的な評価を確実にするために、正解(グラウンドトゥルース)に対する決定論的な採点を利用している。

評価フレームワークは、主に以下の2つの次元に沿って構成されている:

  1. 脅威軸(Threat Axis): バイオセキュリティに関連する7つの異なる質問タイプで構成される。
  2. 生物学的問い(Biological Question): 解法に必要とされる主要なデータモダリティに基づいてタスクを分類し、具体的には配列データ、構造データ、または生物物理学的アッセイデータへの依存度を区別する。

本ベンチマークは111件の評価で構成されている。本研究では、パフォーマンスの変動性をテストするために、22種類の異なるモデル・ハーネス構成にわたって7,326回の実行を実施した。

主な結果
評価により、以下のパフォーマンス指標と観察結果が得られた:

  • トップパフォーマー: 拒絶(リフューザル)を失敗としてカウントした場合、Opus 5(Claude Codeハーネス下)が**50.3%**という最高のエンドポイント通過率を達成した。Grok 4.6(Grok Buildハーネス下)は、**44.1%**という最高の総合通過率を達成した。
  • パフォーマンスの変動性: モデル・ハーネス構成および特定のタスクカテゴリ間で、パフォーマンスに大幅な差が見られた。
  • 拒絶率: 拒絶率は、AIプロバイダーによって大きく異なった。
  • コストと精度の関係: コストは精度を予測する指標としては不適切であることが判明した。特筆すべき点として、いくつかの構成では低コストで**40%**を超える通過率を達成した。

意義と主張
本論文は、BioSecBench-Functionを、ハイステークスな生物学的文脈におけるAIエージェントの信頼性を測定するための必要な標準として位置づけている。その主な意義は、将来のアウトブレイクにおいて、エージェントが新しい病原体や変異体の機能的影響を解釈することを信頼できるかどうかを判断するメカニズムを提供することにある。実在の生物学的データと正解に基づいた検証可能なベンチマークを確立することで、本研究は、理論的な能力を超えて、バイオセキュリティへの応用における実用的かつ測定可能な信頼性の実現を目指している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →