← 最新论文
💻 computer science

Praxist: From Experimental Artifacts to Solution Lineages

Praxist 是一个以谱系为中心的代际系统,它将自主研发从孤立的实验转变为可追溯的证据图谱,使智能体能够继承经过验证的机制,并在复杂的工程任务上实现卓越性能,其成本仅为现有基准的大约十二分之一。

原作者: Jin Li, Ahmed Murtadha, Zhiyu Wang, Qiwen Chen, William Chen, Yifei Wu, Guan Wang, Andy L. Siy, Jiayi Yang, Mengsha Huang, Wenhao Li, Yixuan Liu, Shuailin Pan, Mingli Yuan, Sen Song, Yuhao Sun

发布于 2026-08-27✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Jin Li, Ahmed Murtadha, Zhiyu Wang, Qiwen Chen, William Chen, Yifei Wu, Guan Wang, Andy L. Siy, Jiayi Yang, Mengsha Huang, Wenhao Li, Yixuan Liu, Shuailin Pan, Mingli Yuan, Sen Song, Yuhao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,科学与工程一直依赖于一种简单的、人类特有的节奏:尝试某种方法,观察是否奏效,从错误中学习,然后再次尝试。几十年来,这种循环一直是发现的引擎——研究人员构建原型,对其进行测试,并利用结果来改进下一个版本。但随着计算机变得强大到可以编写自己的代码并运行自己的实验,一个新问题出现了:机器能否像人类一样从自身的失败中学习?挑战不仅在于机器得到了一个结果,而在于它是否理解为什么会得到那个结果。当一台计算机尝试一千种设计变体时,它通常会产生大量的数据,告诉它发生了什么,但并未说明究竟是哪项具体的改变导致了差异。缺乏这种清晰度,机器被迫反复学习同样的教训,在通往无果之路的路径上浪费时间和精力。

这正是 Sapient Intelligence 的研究团队致力于解决的问题。他们构建了一个名为 PRAXIST 的系统,其设计目标不仅是寻找解决方案,更是建立一套关于这些解决方案是如何被发现的、清晰且可审计的历史记录。PRAXIST 不将每一次尝试视为全新的开始,而是将研究视为一场持续的对话。它获取一次实验的结果,将其分解为具体的教训——哪些有效、哪些失败、哪些仅仅是运气好——并将这些教训作为永久记录保存下来。当系统开始下一轮实验时,它不仅仅是寻找过去表现最好的分数,而是观察获得该分数的具体机制。它会询问:“这个部分的改进究竟是导致进步的原因,还是其他因素?”通过回答这个问题,系统可以只继承其历史中有用的部分,从而以比以往更少的努力,构建出更强大且更可靠的解决方案。

研究人员在七十五个不同的机器学习工程挑战(涵盖从识别医学图像中的疾病到预测股市趋势)上测试了这种方法。他们将该系统与一个运行在最先进语言模型上的强大标准 AI 编程助手进行了对比。结果令人震惊。标准助手在约百分之七十三的任务中获得了奖牌,但为此花费了近三万八千美元的计算成本。而 PRAXIST 系统使用了一种不同的底层模型和更智能的工作组织方式,在仅花费约三千美元的情况下,就在百分之八十的任务中获得了奖牌。换句话说,新系统找到更好解决方案的成本仅为前者的约十二分之一。

但真正的创新不仅在于节省成本,更在于其方法论。研究人员观察到,大多数自动化系统将它们的历史视为一份简单的得分列表,仅保留最高分并丢弃其余部分。然而,PRAXIST 将历史视为一棵“家族树”。每当系统构建新的软件或新的控制机制时,它都会记录导致成功或失败的具体设计选择。如果某个火箭着陆算法的特定改动导致了飞行器坠毁,该失败不会被记录为一个死胡同,而是一个宝贵的教训,告诉未来的尝试应当避开什么。如果对交易策略的特定微调提高了利润,该成功会被贴上其生效的确切原因标签,以便系统知道在不同语境下如何使用该微调。这一过程使得系统能够继承“类型化证据”(typed evidence),这意味着它确切地知道哪些部分的解决方案是经过验证有效的,而哪些仍然只是猜测。

为了观察其在现实世界中的运作方式,团队将 PRAXIST 应用于四个复杂的、没有单一标准答案的开放式工程问题。在一个案例中,他们要求系统设计一个用于可回收火箭垂直着陆的控制器。起点是一个成功率仅为百分之四的控制器。一个标准的自动化优化器尝试了数百种变体,并设法将成功率提高到了百分之十七,但它无法让火箭每次都安全着陆。然而,PRAXIST 采取了不同的路径。它不仅仅是进行随机改动,而是构建了一条改进的谱系。它首先添加了一个管理燃料的调节器,然后是一个处理飞行阶段转换的引导器,最后是一个平衡火箭鳍片受力的特定数学工具。在整个任务结束时,该系统生产出了一个在所有测试运行中都能成功着陆火箭的控制器,达到了百分之百的完美得分。至关重要的是,系统记录了整个历程,展示了每一次微小的改进是如何最终导致成功的。

在另一个实验中,该系统应对了自主交易问题。目标是创建一个能够通过买卖股票来最大化长期利润的策略。基准策略(即简单地购买每种可用股票等额份额)实现的年增长率为百分之二十三。PRAXIST 发现了一种更复杂、更具适应性的策略,它能从市场模式中学习,并根据执行成本调整其行为。这种新策略实现了百分之五十三的增长率,是基准的两倍多。系统并非找到了一个幸运的组合,而是将发现过程追溯到了具体的改动,例如策略如何处理风险以及如何管理交易时机。研究人员可以通过查看系统的“谱系”,看到策略学习如何规避曾损害其表现的常见陷 Pal 坑的具体时刻。

该系统在机器人技术和物理领域也证明了其价值。在一项涉及使用摄像头和激光进行导航的机器人测试中,标准系统由于不断使用冗余信息更新地图,浪费了大量的计算能力。PRAXIST 意识到机器人并不需要查看每一帧视频;它只需要在信息真正有用时才进行观察。通过教导机器人跳过不必要的更新,系统在不损失导航精度的情况下,将视觉处理时间缩减了百分之七十二。同样,在控制核聚变反应堆的模拟中,尽管其中的物理过程极难预测,该系统设计的控制器使不稳定等离子体的稳定时间比现有的由人类设计的控制器更长。

这些结果之所以意义重大,是因为它们提供了透明度。在传统的自动化研究中,当一个系统找到解决方案时,它往往是一个“黑盒”。你知道它有效,但你不知道为什么,也无法轻易判断这种成功在略微不同的情况下是否依然成立。PRAXIST 通过为每个结果附加一个详细的故事改变了这一点。它记录了解决方案的“谱系”,这是一条展示了哪些机制经过了测试、哪些得到了验证、以及哪些被舍弃的证据链。这意味着人类科学家可以观察系统的成果,理解其背后的逻辑,甚至提取其中的精华来构建新的事物。它将计算机从一个仅仅产生答案的工具,转变为一个能够记录其推理过程的协作伙伴。

研究人员强调,这种方法并不是要取代人类科学家,而是要为他们提供一种更强大的工具。通过处理测试数千种变体和组织已学教训等繁琐工作,该系统让人们能够专注于宏观层面。跨越实验世代继承知识的能力意味着,当系统面对新问题时,不必从零开始。它可以承袭过去的失败与成功的智慧,构建一个随着每一次尝试而不断增强的可靠知识基础。这种从单纯寻找最高分到深度理解分数背后证据的转变,代表了我们应对复杂工程挑战方式的根本性变化。

归根结底,PRAXIST 的故事关乎机器的记忆力。长期以来,计算机擅长计算,但在以结构化方式从自身历史中学习方面却表现不佳。这个系统表明,当你赋予机器记录不仅是“发生了什么”,还有“为什么发生”的能力时,它可以解决以前无法触及的问题。它之所以能做到这一点,并非因为它在通用意义上变得更聪明,而是因为它对记忆的内容及其使用方式变得更加谨慎。其结果是一个不仅更高效、更具成本效益,而且更值得信赖的系统,因为它提供的每一个解决方案都附带了一份清晰、可检查的实现过程说明。这就是自主研究的未来:不是一个靠猜测寻找答案的机器,而是一个通过一次又一次实验,构建证据遗产的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →