AI Research Agents Narrow Scientific Exploration
本研究发现,尽管当前的人工智能研究代理能够生成科学构想,但其产出的研究往往比人类撰写的研究更为集中、创新性更低,且更依赖于对现有方法的重组,这表明它们更适合用于局部深化,而非拓展科学探索的广度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位刚开了一家巨型烹饪图书馆的大厨。你雇佣了一支由 AI“副厨”组成的团队,并给它们下达了一项具体指令:“看看这五本流行的食谱,然后发明一道前所未有的、令人兴奋的全新菜肴。”
你可能会期待这些 AI 大厨能创造出突破烹饪界限的狂野、未来的融合料理。然而,这篇论文对这种期待进行了检验。研究人员设计了一项大规模实验,要求四种不同类型的 AI“副厨”(使用了六种不同的脑模型)基于人工智能和机器学习等领域的现有论文,生成超过 37,000 个新的科学研究想法。
以下是他们发现的结论,用通俗易懂的语言表述:
1. “回声室”效应
发现: AI 生成的想法彼此之间非常相似。
类比: 想象你让一百个人画一幅“猫”的画。你会得到巨大的多样性:一只毛茸茸的波斯猫、一只瘦骨嶙峋的流浪猫、一只卡通猫、一只太空猫等等。但是,当你让 AI 大厨基于同样的五本食谱发明新菜肴时,它们几乎都做出了完全相同的东西。它们都在制作“意大利培根蛋面”的略微不同的版本。
论文所述: 与人类撰写的论文相比,AI 生成的想法在“想法空间”中更加集中在一个狭小的区域。即使使用不同的 AI 模型或不同的框架,它们似乎都在同一条狭窄的轨道上思考。
2. 停留在“舒适区”
发现: AI 的想法与它们收到的原始书籍非常接近。
类比: 如果你给一个人一个基础蛋糕的食谱,并让他们想象未来的甜点,他们可能会想到漂浮的蛋糕或光做的蛋糕。然而,AI 只是对原始食谱进行了微调。也许它们多加了一点糖,或者改变了糖霜的颜色,但它显然仍然是原始蛋糕的变体。
论文所述: 与后续跟进这些相同论文的实际人类研究人员相比,AI 的想法更接近“种子文献”(起始论文)。AI 没有走远,它只是打磨了它所在房间里的家具。
3. “无聊街区”问题
发现: AI 想法落地的领域往往不太“著名”或缺乏影响力。
类比: 想象一张城市地图。有些街区是熙熙攘攘的枢纽,人人都会去(高影响力),而另一些则是安静、沉睡的街道。人类研究人员倾向于探索熙熙攘攘的枢纽和狂野的未charted森林。然而,AI 却一直在建造那些没人常去的安静、沉睡街区里的房子。
论文所述: 当研究人员查看与 AI 想法相似的人类论文时,这些人类论文获得的引用(关注度)低于该领域的平均水平。AI 擅长制造“安全”的想法,但不一定是“开创性”的想法。
4. 混音与重塑
发现: AI 很少提出新问题;它只是重新排列旧工具。
类比: 将科学研究想象成用乐高积木搭建。
- 新问题: “如果我们造一辆飞行汽车会怎样?”(提出新问题)。
- 新方法: “让我们用一种新型塑料做轮子。”(发明新工具)。
- 重组: “让我们把红色汽车的轮子和蓝色汽车的引擎结合起来。”(混合现有工具)。
论文发现,AI 几乎从不问“如果我们造一辆飞行汽车会怎样?”它几乎总是坚持人类已经问过的那些老问题。相反,它只是拿起现有的乐高积木(技术方法),以略微不同的方式将它们拼接在一起。
论文所述: 在 85% 的情况下,AI 没有引入新的研究问题;它只是重用了种子论文中已有的问题。唯一的真正“新意”来自于重组现有的技术方法。
主要结论
该论文得出结论:当前的 AI 研究代理更像是非常高效的本地编辑,而不是富有远见的探索者。
它们非常擅长将我们已知的知识进行打磨,使其看起来连贯且合理。它们可以快速生成大量想法。但它们还不足以打破常规,去寻找那些往往能带来最大科学突破的陌生、不熟悉或 radically 新的方向。它们擅长“局部阐述”(在附近进行小幅改进),但不擅长“拓宽探索”(前往新地方)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。