AutoScientists: Self-Organizing Agent Teams for Long-Running Scientific Experimentation
本文介绍了 AutoScientists,这是一个去中心化的 AI 智能体团队,它们通过迭代式假设生成与批判进行自我组织,自主开展长期科学实验,在生物医学机器学习、语言模型优化和蛋白质适应性预测任务中显著优于现有的单智能体和集中式方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解开一个巨大且极其复杂的谜题。在过去,你可能会聘请一位非常聪明的侦探来独自解决它。这位侦探会观察一块拼图,猜测它的位置,尝试放置,如果放不进去,就再试一次。他们会独自、一步一步地完成这个过程。
这篇论文介绍了AutoScientists,它彻底改变了游戏规则。你不再聘请一位侦探,而是雇佣一个由9 个 AI 智能体组成的团队,他们像一个动态的研究实验室那样协同工作。
以下是其工作原理,使用简单的类比来说明:
1. “自组织”团队
大多数 AI 系统的工作方式如同严格的军事指挥链:一位将军(中央规划者)精确地告诉士兵该做什么。如果将军制定了糟糕的计划,整个团队就会失败。
AutoScientists更像是一群在咖啡馆里的天才科学家。他们没有老板告诉他们该做什么。相反:
- 他们都查看一块共享白板(即“共享状态”),上面列出了当前的最佳解决方案、失败的尝试以及新想法。
- 他们会围绕最有前景的想法自发组成团队。
- 如果一个团队陷入死胡同(就像试图把方形的钉子塞进圆形的孔里),他们不会继续死磕。他们会与团队交流,承认该想法已穷尽,并重新组织以尝试完全不同的方法。
2. “花钱前先评审”规则
在许多 AI 实验中,计算机会尝试一个新想法,运行模拟,然后才意识到这是浪费时间。这就像买了一张音乐会的门票,到了场馆才发现演出取消了。
AutoScientists 设有一个评审委员会。在任何昂贵的计算机时间被用于运行实验之前:
- 一个智能体将提案发布到“研究论坛”。
- 其他智能体充当同行评审员。他们会说:“等等,那个想法看起来很弱”,或者“我们上周试过类似的东西,结果失败了”。
- 这会在计算机开始工作之前就过滤掉糟糕的想法,从而节省时间和能源。
3. “死胡同登记册”
想象一支正在绘制洞穴地图的探险队。如果一名探险者掉进了坑里,他们不会就此忘记。他们会在地图上标记该地点,以防其他人再掉进去。
AutoScientists 维护着一份死胡同登记册。它记录了每一次失败的实验以及失败的原因。这防止了团队浪费时间重复同样的错误。它还有助于他们意识到何时陷入了“局部最优”(一座看起来像山的小山丘),并鼓励他们跳到地图的不同部分去寻找更高的山峰。
4. 结果:击败单人侦探
作者将这支团队与“最佳单人侦探”(一个名为Autoresearch的系统)以及其他 AI 智能体在三个主要领域进行了测试:
- 生物医学机器学习(BioML-Bench): 这就像一场包含 24 个不同医学谜题(例如预测药物有效性或分析细胞图像)的大型考试。
- 结果: AutoScientists 团队的平均得分高于任何其他 AI。他们在药物发现方面表现尤为出色,找到了比单智能体系统更好的解决方案。
- 训练 AI 模型(GPT 优化): 这就像通过调整设置来让语言模型变得更聪明。
- 结果: 该团队达到高水平性能的速度比单人侦探快 1.9 倍。更令人印象深刻的是,当单人侦探陷入困境、无法找到任何改进时,AutoScientists 团队仍在不断发现新的、更好的调整方案。
- 蛋白质工程(ProteinGym): 这涉及预测改变蛋白质结构如何影响其功能。
- 结果: 从现有的最佳方法(Kermut)开始,该团队发现了一种新的数据组合方式,在特定测试中将预测准确率提高了12.5%,在整个基准测试中提高了6.5%。
核心结论
该论文声称,AutoScientists在长期科学发现方面表现更佳,因为它模仿了人类研究团队的实际工作方式:他们进行辩论、分享失败、在陷入僵局时转向,并且不依赖单一老板来告诉他们下一步该做什么。
重要提示: 该论文明确指出,该系统旨在加速发现的过程(寻找更好的模型和假设)。它并未声称这些 AI 智能体可以取代人类科学家进行临床决策,也未声称他们发现的模型可以在未经人类审查的情况下直接作为药物或疗法在医院使用。“影响声明”警告称,这些输出必须在用于现实世界的生物学或医学之前,由专家进行验证。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。