Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models
该论文将科学可行性评估构建为诊断推理任务,通过多模型实验发现:相较于实验描述,提供实验结果证据更能提升大语言模型的评估准确性,而实验文本在上下文不完整时反而可能因脆弱性导致性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给大语言模型(LLM)做一场"科学侦探考试"。
想象一下,你有一个超级聪明的 AI 助手,它读遍了全世界的书,知识渊博。现在,你给它一个科学猜想(比如:“每天多喝一杯水能降低血压”),问它:“这个说法靠谱吗?(可行)还是瞎扯?(不可行)”。
这篇论文的核心就是研究:当你给这个 AI 助手提供不同的“线索”时,它到底能不能像个真正的科学家一样,做出正确的判断?
🕵️♂️ 核心比喻:侦探破案
为了测试 AI,作者设计了一个像侦探破案一样的实验框架:
**只有猜想 **(Hypothesis-only):
- 场景:侦探只听到一句传闻:“有人每天多喝一杯水能降压。”
- AI 的表现:它只能靠脑子里的“老知识”瞎猜。虽然它猜得还挺像那么回事,但根基不稳。
**提供实验过程 **(Experiments):
- 场景:侦探拿到了一份厚厚的“实验报告”,上面写着:“科学家找了 100 个人,让他们多喝水,测量了各种指标……"(但没告诉结果)。
- AI 的表现:这就好比侦探只看到了案发现场的脚印和工具,却没人告诉他凶手是谁。结果发现,AI 反而更糊涂了!因为它容易盯着那些复杂的实验步骤看,却抓不住重点,甚至因为信息太多而判断失误。
**提供实验结果 **(Outcomes):
- 场景:侦探直接拿到了“结案陈词”:“实验结果显示,多喝水确实让血压降了(或者没降)。”(但没告诉具体怎么做的)。
- AI 的表现:这是最让 AI 清醒的时刻!只要看到最终结果,AI 的判断准确率就蹭蹭往上涨。因为它不需要去理解复杂的实验过程,直接看“结局”就能做决定。
**全知全能 **(Experiments + Outcomes):
- 场景:侦探既看到了过程,也看到了结果。
- AI 的表现:理论上应该最好,但作者发现,有时候给得太多反而不好。如果过程描述和结果有点小矛盾,AI 就会“死机”或者强行解释,导致判断不如只看结果时准确。
📉 最惊人的发现:少即是多,多即是乱
这篇论文最有趣的发现可以用一个比喻来解释:
想象你在做一道复杂的数学题。
- 只看题目(只有猜想):你大概能蒙对个大概。
- 给你看解题步骤,但没给答案(只有实验):你看着那些步骤晕头转向,反而算错了,甚至不如蒙的。
- 直接告诉你答案(只有结果):你立刻就能判断对错,非常准。
- 既给步骤又给答案(全给):如果步骤里有个小笔误,你反而会被带偏,觉得“既然步骤这么写,那答案肯定不对”,结果判断错了。
论文结论:
- 结果比过程重要:对于现在的 AI 来说,直接告诉它“实验结果是什么”,比让它去读“实验是怎么做的”更有用。
- 信息不全很危险:如果你只给 AI 一半的实验过程(比如只给了一半的实验数据),它不会说“我不确定”,而是会强行脑补,并且经常得出一个比完全不知道还要糟糕的错误结论。
- AI 很“肤浅”:AI 往往只看表面字眼。如果实验描述里的词和猜想里的词很像,它就觉得“靠谱”,哪怕逻辑完全不通。
🎯 这对我们意味着什么?
这就好比我们在用 AI 辅助科学研究或医疗诊断时:
- 不要指望 AI 能完美理解复杂的实验设计。如果你把一堆原始实验数据扔给它,它可能会“一本正经地胡说八道”。
- 直接给结论更有效。如果你希望 AI 评估一个科学观点,直接给它相关的实验结论(比如“这项研究证实了 X"),比给它长篇大论的实验过程要靠谱得多。
- 警惕“半吊子”信息。如果信息是残缺的(比如只有一半的实验报告),AI 可能会比没有信息时更自信地犯错。这时候,人类专家必须介入,不能盲目相信 AI。
总结
这篇论文就像是在给 AI 泼了一盆冷水,提醒我们:AI 虽然读的书多,但在处理科学证据时,它更像是一个“只看结局的剧透党”,而不是一个“严谨的逻辑推理家”。
如果我们想让它真正帮上忙,就得学会怎么给它喂信息——少给它看复杂的“过程”,多给它看清晰的“结果”,并且要警惕那些不完整的信息会把它带进沟里。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。