A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline
本文通过一项实证研究,评估了通用人工智能编程智能体在复杂的神经科学“数据到发现”流水线上的表现,结果表明,尽管这些智能体能够实现单个阶段的自动化,但目前在端到端执行、缺乏预设标准下的自我评估以及对新数据的泛化能力方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:科学家们不仅要进行实验,还要花费数月时间编写用于分析结果的复杂计算机代码。在神经科学领域,研究人员经常通过研究像果蝇这样微小的生物来理解大脑如何控制行为。为了实现这一目标,他们会记录数小时的视频,但原始素材只是移动圆点的模糊影像。要将这种模糊影像转化为科学发现,他们需要一个“流水线”——一个由软件步骤组成的漫长且曲折的装配线。首先,计算机必须在视频中找到果蝇;然后,它必须追踪它们的每一个动作,测量它们的身体部位,判断它们是在行走还是在原地不动;最后,运行统计测试以观察特定的实验是否改变了它们的行为。传统上,构建这样的装配线是一项庞大且乏味的工作,需要人类专家花费数周甚至数月的时间进行编码。
最近,一种被称为“AI智能体”(AI agent)的新型人工智能出现了。可以将这些智能体想象成超级聪明、不知疲倦的数字实习生,它们可以阅读指令并为你编写代码。大家心中最大的疑问是:这些AI实习生能否接管科研中那些枯燥、耗时的部分?它们能否亲手构建出这条装配线,还是说需要人类在每一步都手把手地引导?这正是研究团队试图解决的谜团。他们想看看这些AI智能体能否应对神经科学中那些杂乱、真实的挑战,还是会在细节中迷失方向。
研究人员决定让这些AI实习生接受一项非常具体且高难度的挑战:一个“果蝇光遗传学数据到发现的流水线”。请将这个流水线想象成一个七阶段的障碍赛,旨在将果蝇的原始视频转化为科学结论。这条赛道始于果蝇身体追踪(Fly Body Tracking),AI必须在视频中找到并跟随多只果蝇,即使它们互相碰撞也要保持身份识别清晰。接下来是配准(Registration),AI必须清理数据,并将像素坐标转换为毫米等现实世界的测量单位。随后,AI必须进行关键点追踪(Keypoint Tracking),这就像是在每只果蝇身上画出一副骨架,以极高的精度定位21个特定的身体部位。
课程继续进行到特征计算(Feature Computation),AI需要计算果蝇移动或转向的速度。接着是行走行为分类(Walking Behavior Classification),要求AI判断果蝇是在行走还是仅仅在原地站立。第六阶段是步态分割(Gait Segmentation),这是一个棘手的步骤,AI必须确定特定的腿是在空中(摆动)还是在地面上(推动)。最后,AI到达终点线进行统计比较(Statistical Comparisons),它必须通过计算数据来查看实验是否真的改变了果蝇的行为。研究人员在这一赛道上测试了几种不同的AI模型,既要求它们一次只解决一个阶段的任务,也要求它们从头到尾完成整个七阶段的马拉松。
结果呈现出一种令人惊叹的成功与令人沮丧的失败并存的状态,揭示了AI胜任某些工作但不胜任另一些工作。当AI智能体被赋予一个定义明确、带有清晰“计分卡”的单一任务时(例如,训练一个模型来识别行走行为或追踪特定身体部位),它们的表现出奇地好。在这些“监督学习”任务中,智能体可以进行迭代、检查自己的工作,并不断改进直到达到目标。例如,它们成功学会了识别果蝇身上的21个关键点,准确度达到了人类专家的水平。这表明,对于科学流水线中特定的、基于规则的部分,AI智能体已经具备了处理繁重工作的能力。
然而,当AI智能体被要求在没有详细地图的情况下运行整个端到端的流水线时,情况发生了剧变。当研究人员给出一个宽泛的目标,如“分析这些果蝇”,而不将其分解为具体步骤时,智能体很难保持专注。它们经常忘记之前的步骤,将复杂的阶段合并为简单的捷径,或者犯下导致整个链条断裂的基础格式错误。最显著的失败发生在第一个阶段:果蝇身体追踪。这项任务要求AI运用其“科学判断力”,在没有预写规则手册或明确评分标准的情况下,找出追踪果蝇的方法。智能体试图通过观察视频来检查自己的工作,但在理解视觉信息方面基本失败了。它们会发现错误,误解视觉线索,然后重复同样的错误,甚至使情况变得更糟。
论文指出,主要的瓶颈不在于AI不会写代码,而在于它们难以应对“长线任务”。如果规则明确,它们擅长解决单个谜题,但当它们需要将一系列复杂的步骤串联起来、管理计算机资源或利用视觉检查来修复自身错误时,就会迷失方向。研究人员发现,虽然AI可以自动化科学发现的特定阶段,但实现一个能够从原始数据直接运行到得出结论的完全自主“AI科学家”的梦想,目前仍难以企及。在它们能够被信任去独立掌控全局之前,这些智能体还需要更好的引导、更清晰的目标,以及一种能够真正“看到”并理解它们所处理的数据的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。