Theory Under Construction: Orchestrating Language Models for Research Software Where the Specification Evolves
本文介绍了 Comet-H,这是一种迭代式提示自动机,它通过协调代码、理论与文档的耦合开发,以防止研究软件中的幻觉与不同步现象,并通过一个 Python 静态分析工具验证了其有效性,该工具在包含 90 个案例的基准测试中显著优于基线方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试建造一种新型汽车,但你没有最终的蓝图。相反,你拥有一支才华横溢、思维敏捷的工程师团队(即人工智能),他们可以同时绘制部件、制造引擎并撰写用户手册。
问题在于,这些工程师容易犯两种特定的错误:
- “先假装成功,再真正成功”的陷阱:他们可能在手册中写道“这辆车时速可达 200 英里”,而实际上尚未制造出能证明这一点的引擎。随后,下一位工程师读到这一声明,假设其为真,并据此设计适用于 200 英里的底盘。如果引擎实际上无法达到这一速度,整个项目就是建立在谎言之上。
- “翻译失真”的陷阱:设计引擎的工程师可能改变了对其工作原理的看法,但撰写手册的人却不知情。于是,手册描述的是旧引擎,蓝图展示的是新引擎,而装配线上实际组装的汽车则完全是另一回事。三者彼此脱节,渐行渐远。
本文《为规范不断演变的科研软件编排语言模型》介绍了一种名为Comet-H的新系统,旨在解决这些问题。它将科研视为一场舞蹈,而非直线进程,其中音乐、舞步与舞者必须不断相互调整。
核心理念:人工智能的“指挥家”
作者并未仅仅要求人工智能“编写代码”,而是构建了一个指挥家(控制器)来管理整个乐团。这位指挥家不仅告诉人工智能该做什么,还持续检查“工作空间”(包括代码、数学理论、基准测试和论文),以识别缺失或不同步之处。
以下是 Comet-H 的工作原理,辅以简单类比:
1. “渐隐待办清单”(义务衰减)
想象你在写一本书,贴着一张便签,上面写着“我需要核实这一章的事实”。
- 旧方式:如果你忘记核实,便签会永远留在桌上, cluttering 你的桌面;或者你忽略它,继续前行。
- Comet-H 方式:这张便签具有半衰期。每当你推进项目一步,便签就会略微变淡。如果你没有尽快处理它,它就会逐渐消失。但如果它非常新,便会发出明亮的红光。
- 为何重要:这迫使人工智能在处理未竟事务(如“证明这一声明”)时保持其新鲜度。如果人工智能试图忽视这些“债务”,“光芒”会变得更亮,指挥家将强制其停下并修复问题,然后才能继续前进。
2. “现实核查”(反应式 grounding)
每当人工智能改变项目的“公开面貌”(如 README 文件或研究论文)时,Comet-H 都会按下暂停键。
- 规则:未经核实事实,不得更改故事。
- 流程:如果人工智能写道“我们的工具速度快 10 倍”,系统会立即停止并要求:“好的,请出示比赛结果。”它强制人工智能运行代码并生成一份"grounding ledger"(机器可读的收据),以证明该声明。
- 结果:这阻止了“先假装成功,再真正成功”的陷阱。谎言最多只能存活一步,随后就会被发现并纠正。
3. “安全步骤”(邻接约束)
有时,人工智能会兴奋起来,想要从“建造自行车”直接跳到“建造宇宙飞船”。
- 规则:Comet-H 仅允许邻接移动。人工智能可以向前迈出一小步(例如“给自行车加一个齿轮”),但不能跳跃到完全不同的宇宙。
- 为何重要:这使项目保持脚踏实地。如果人工智能想要改变核心理论,它必须以仍能连接到昨日成果的方式来实现。这防止团队脱节到忘记最初试图建造什么。
成果:"a3"案例研究
作者通过构建 46 个不同科研软件项目的组合来测试该系统。其中的明星工具是名为a3的程序,旨在发现 Python 代码中的错误。
- 挑战:通常,错误查找工具就像吵闹的邻居;即使一切正常,它们也会对着一切大喊“错误!”。这会产生大量误报。
- Comet-H 方法:该系统不仅构建了工具,还演化了其背后的理论。它从一个简单的想法开始,意识到计算过于困难,指挥家便允许团队转向一种新的数学方法(使用“安全证书”),该方法实际可行。
- 结果:最终工具极其准确。它捕捉到了真实错误(高精确度),而不会对未损坏的事物大喊大叫。在测试量表上,它得分为0.768,而次佳工具仅得分为0.364。
关于人工智能行为的启示
通过观察人工智能在这 46 个项目上的工作,作者注意到了一些有趣的模式:
- “清理小组”真实存在:在项目初期,人工智能忙于构建新功能。但随着项目接近尾声,人工智能将大部分时间用于审计和修复。这就像一支施工队,在项目最后一周只是检查油漆是否干燥、门是否打开,而不是建造新墙。
- 诚实性涌现:当被迫证明其声明时,人工智能变得异常诚实。它不再隐藏失败,而是开始明确声明:“我们目前尚无法解决这一特定类型的问题。”系统并未编程这种诚实;它之所以涌现,是因为“现实核查”使撒谎变得过于困难。
- 自组织:随着时间的推移,即使没有人明确指示,人工智能也开始将其代码组织成更清晰、更合乎逻辑的结构。
全局视角
本文认为,构建科研软件不同于修正文档中的拼写错误。这是一个协同演化过程。理论、代码、测试和故事必须共同成长。
如果你只是要求人工智能“撰写论文并编写代码”,它很可能会偏离轨道、产生幻觉并失去同步。但如果你赋予它一位指挥家,持续检查乐谱、强制进行现实核查并确保步骤保持连贯,你就能构建出真正有效且值得信赖的复杂科研工具。
简而言之:Comet-H 是一个系统,它阻止人工智能白日做梦,并迫使其信守承诺,确保其所讲述的故事与其所编写的代码相匹配。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。