In Context Learning and Reasoning for Symbolic Regression with Large Language Models
该论文提出了一种结合思维链提示、外部工具优化及科学背景知识的框架,利用大语言模型(如 GPT-4 和 GPT-4o)通过自然语言交互与迭代推理,成功实现了从数据中自动发现并优化物理吸附及流体力学等领域的符号回归方程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个非常有趣的故事:我们如何让像 GPT-4 这样的人工智能(AI),从一堆枯燥的数据中,自己“悟”出背后的科学公式。
想象一下,你是一位侦探,面前有一堆犯罪现场的线索(数据),你的任务是找出罪犯作案的规律(公式)。传统的做法是请一位精通数学的专家,让他拿着计算器一步步推导;而这篇论文的做法是,请一位博学但有点“爱做梦”的 AI 助手来帮你破案。
以下是用通俗语言和比喻对这篇论文的解读:
1. 核心任务:让 AI 当“公式侦探”
什么是符号回归?
想象你在玩一个拼图游戏。你手里有一堆散落的数字(数据),你的目标不是画出一张图,而是找到一句简短的“咒语”(数学公式),只要把数字填进去,就能完美解释这些数字是怎么来的。
- 传统方法:像是一个只会死记硬背的机器,通过无数次的随机尝试(像猴子打字)来拼凑公式,效率低且容易迷路。
- 新方法(本文):利用大语言模型(LLM,如 GPT-4)。这些 AI 读过很多书,懂很多科学道理,它们能像人类科学家一样,先“思考”数据的规律,再提出公式。
2. 遇到的大麻烦:AI 的“幻觉”
在实验初期,研究人员发现 AI 有个坏毛病:它太自信了,甚至会“胡说八道”(幻觉)。
- 比喻:你让 AI 算出 ,它可能会看着数据说:“我觉得是 。”然后它还会给你写一段完美的 Python 代码来验证。
- 真相:代码是真的,但 AI 自己“编”出来的数字是错的。它就像是一个只会写剧本但不会算账的编剧。
3. 解决方案:打造“人机协作”流水线
为了解决这个问题,研究人员设计了一个**“双轨制”工作流程**,把 AI 和传统数学工具分开了:
- AI 的角色(创意总监):
- 负责**“想点子”。它看数据,结合科学背景(比如“这是关于气体吸附的”),提出公式的结构**(比如:应该是分式?还是对数?)。
- 它不负责算具体的数字,只负责搭架子。
- Python 工具的角色(精算师):
- 负责**“算细节”**。一旦 AI 搭好了架子,Python 代码就立刻接手,用超级计算器把公式里的数字(系数)算得精准无比。
- 算完后,把结果(误差多少、公式多复杂)反馈给 AI。
循环过程:
AI 提出方案 -> 精算师算数 -> 告诉 AI“这个方案误差有点大,或者太复杂了” -> AI 根据反馈改进方案 -> 再次循环。
4. 关键技巧:给 AI 装上“草稿纸”和“背景书”
为了让 AI 表现更好,研究人员用了两个绝招:
A. 草稿纸(Scratchpad):让 AI 先“自言自语”
以前,AI 直接扔给你一个答案,经常出错。
- 新做法:研究人员要求 AI 在给出答案前,先在“草稿纸”上写一段思考过程。
- 比喻:就像考试时,老师不让你直接写答案,而是让你先写:“我看这组数据,随着 X 变大,Y 变小,好像成反比……"
- 效果:一旦 AI 开始“自言自语”分析数据,它的逻辑就清晰了,提出的公式质量突飞猛进。
B. 背景书(Context):给 AI 科普
如果只给数据,AI 可能会瞎猜。
- 新做法:研究人员告诉 AI:“这是关于氮气在云母片上吸附的数据,压力越大,吸附量会怎样……"
- 效果:AI 就像拿到了“作弊小抄”(其实是科学常识),它不再乱猜,而是结合物理规律去猜。比如,它知道吸附量不可能变成负数,所以不会提出那种荒谬的公式。
5. 实验成果:AI 真的学会了吗?
研究人员用三个著名的科学数据集来测试:
朗缪尔吸附模型(Langmuir):
- 这是一个经典的物理化学公式。
- 结果:AI 成功“重新发现”了这个公式。特别是当它有了“草稿纸”和“背景知识”时,它猜得又快又准。
双位点朗缪尔模型(Dual-site Langmuir):
- 这个更复杂,像是一个公式里套了两个公式。
- 结果:AI 表现很棒,它甚至能分析出数据中隐藏的“饱和”特征,从而推导出正确的复杂结构。
尼库拉德斯管道摩擦数据(Nikuradse):
- 这是一个没有标准答案的难题(就像面对一个全新的谜题)。
- 结果:虽然 AI 找到的公式不如某些超级专业的数学软件(如 BMS)那么精准,但它只用了很少的数据和很少的尝试就找到了很不错的解。
- 比喻:专业软件像是一个雇佣了 1000 个工人、花了 100 天去挖掘的矿队;而 AI 像是一个聪明的探险家,只带了 3 个人,花了一天就找到了金矿的入口。虽然金矿可能没挖得那么深,但性价比极高。
6. 总结与启示
这篇论文告诉我们:
- AI 不是万能的计算器,它不擅长算数,但擅长理解逻辑和模式。
- 最好的方法是“人机结合”:让 AI 负责“灵光一闪”的创意和逻辑推理,让传统工具负责“死磕”的数值计算。
- 自然语言是强大的接口:以前科学家要写复杂的代码来限制 AI 的搜索范围,现在只需要用人话告诉 AI:“请考虑科学常识,不要算出负数”,AI 就能听懂并照做。
一句话总结:
这就好比给 AI 配了一位懂科学的导师(背景知识)和一张草稿纸(思考过程),让它从“只会瞎蒙的算命先生”变成了“能提出科学假设的初级研究员”,大大降低了科学发现的门槛。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。