✨ 要点🔬 技术摘要
长期以来,科学一直依赖于试错循环。研究人员提出一个想法,将其置于自然法则或问题的约束条件下进行测试,然后利用结果来完善下一次尝试。几十年来,人工智能也加入了这一循环,但通常只是作为一种预测结果或优化已知变量的专门工具。最近,语言模型开始表现得更像研究人员本身:生成候选方案、编写测试它们的代码,并根据反馈修改其工作。然而,仅仅要求计算机尝试更多的想法并不保证能带来更好的发现。如果一个系统在没有清晰结构的情况下生成数千次尝试,其中许多将会是重复的,或者过程可能会陷入对死胡同的不断完善中。核心挑战不仅在于扩大尝试的数量,而在于如何组织这种规模化,使得每一次测试都能在前一次的基础上进行,从而让进步随时间实现复利增长。
一位研究人员引入了一个名为 SIMPLETES 的新框架来解决这个问题。他们并没有依赖单个庞大的人工智能模型或复杂的定制搜索引擎,而是专注于如何构建搜索过程本身。他们将发现循环视为一个科学共同体:并行运行许多独立的探究线路,让每条线路随着时间的推移不断完善其最佳想法,并仔细选择将哪些失败和成功分享给下一轮尝试。使用单一的开源语言模型,该系统应对了涵盖量子物理学、深空旅行和纯数学等多个不同领域的二十八个开放式问题。在每种情况下,该系统都找到了比人类专家或其他先进人工智能系统已知的最佳结果更好的解决方案,且通常使用的计算能力显著更少。
研究人员证明,搜索组织的方式比运行它的模型规模更为重要。他们在从设计航天器高效燃料轨迹到优化最快计算机芯片上运行的代码等任务中测试了该框架。在太空旅行领域,该系统重新设计了前往木星和其他行星的任务飞行路径,发现的路线与历史记录相比,减少了高达 23% 的燃料成本。在量子计算领域,它发现了排列芯片上数据的新方法,减少了移动信息所需的额外操作近 25%。它还为数十年来未解决的数学问题编写了新的计算机代码,其中包括一个自 1955 年以来一直存在的关于重叠集合的问题。该系统找到了一个改进了已知最佳纪录的解法,并且是在没有任何人工干预或针对这些特定任务进行专门训练的情况下完成的。
最重要的发现之一是,系统可以从自身的搜索过程中学习,从而变得更加出色。研究人员提取了系统发现的成功路径,并利用它们对语言模型进行进一步训练。他们并没有奖励模型在单次尝试中获得高分,而是教会它去重视整个搜索旅程的最终结果。这使得模型能够理解,一个看似糟糕的早期尝试可能是通往后期突破的必要步骤。在测试新的数学问题时,这个经过训练的模型找到了比原始系统更加先进的解法,推向了此前被认为是不可能实现的边界。
这种方法的成功表明,搜索的组织本身就是一种强大的工具。通过构建评估过程来鼓励多样化的探索和迭代优化,研究人员展示了通过结构化的方式,一个相对适度的开源模型就可以超越那些由更大型、专有模型构建的系统。该框架不仅仅是找到了一个好的答案,它还建立了一种适用于极广阔科学领域的通用发现方法。从设计分析大脑活动的更好算法到创建更快的智能软件,该系统证明了结构化的、以评估为驱动的方法可以加速科学进步。结果表明,人工智能驱动发现的未来可能不在于构建更大的“大脑”,而在于设计更聪明的方式,让这些大脑去探索未知。
技术摘要:跨越多样化科学领域的 AI 发现的结构化缩放
问题陈述
科学发现通常需要提出、测试和改进候选解的迭代循环。虽然大语言模型(LLMs)可以参与这些循环,但仅仅通过增加尝试次数(例如,通过更长的推理轨迹或更多的并行采样)并不一定能保证取得进展。并行搜索可能会导致重复劳动,而迭代优化则可能陷入次优方向。作者确定的核心挑战不仅在于如何扩展 AI 驱动的发现,而是在于如何结构化地进行这种缩放 ,使得评估信号能够随时间累积。该论文提出了一个问题:如何以结构化的方式扩展 AI 驱动的发现循环,以加速科学突破?
方法论:SIMPLETES
作者引入了 SIMPLETES (简单测试时评估驱动缩放),这是一个旨在组织评估查询分配和重用已评估历史记录的框架。与依赖复杂智能体协作或多模型集成系统的系统不同,SIMPLETES 隔离了发现循环本身的结构。
核心设计元组 ( C , L , K , Φ ) (C, L, K, \Phi) ( C , L , K , Φ )
SIMPLETES 通过四个关键维度组织搜索过程:
全局宽度 (C C C ): 并行运行 C C C 条独立的轨迹。这防止了“锁定”效应(即早期选择偏向单一深度轨迹),允许多样化的探索路径在互不干扰的情况下成熟。
优化深度 (L L L ): 每条轨迹通过 L L L 个优化步骤推进。反馈在轨迹内部累积,使后期的尝试能够建立在早期尝试的基础之上。
局部样本量 (K K K ): 在每一步中,模型生成 K K K 个候选解。只有得分最高的候选解会被提交到轨迹历史中。这减轻了 LLM 输出中固有的噪声,防止微弱或无法执行的候选解破坏后续的优化过程。
提议构造器 (Φ \Phi Φ ): 一种用于选择并压缩有用的先验解、失败案例及反馈到下一个提示词中的机制。Φ \Phi Φ 使用基于图的 PUCT 规则变体,选择得分较高或产生了强后继节点的历史节点,同时总结重复出现的失败(例如编译错误),以引导模型避开无效率的方向。
评估查询的总预算为 N = C × L × K N = C \times L \times K N = C × L × K 。该框架将分配这一预算视为主要的缩放杠杆,而非增加模型参数或训练数据。
轨迹级后训练
为了解决标准后训练(其奖励即时分数并可能阻碍导致突破性的探索性“失败”)的局限性,作者提出了轨迹级后训练 。
信用分配: 模型不再根据单步的即时得分来奖励步骤,而是根据整个轨迹的最终结果 进行训练。
机制: 最终结果处于前 R % R\% R % 的轨迹被赋予权重 w = 1 w=1 w = 1 ,其余则为 w = 0 w=0 w = 0 。模型通过微调来最大化生成导致这些高分最终结果的推理和解的可能性。
目标: 这训练模型去优化长程突破,而非近视的即时收益,从而有效地学习如何“寻找强力的最终解”。
核心贡献与结果
作者将 SIMPLETES 应用于五个不同科学领域的 28 个开放式发现问题 ,使用的是单一且固定的开源模型 (gpt-oss-120b )。该框架在所有领域都取得了 SOTA(最先进)的结果,通常超越了规模比其大一个数量级的专用模型系统。
1. 量子电路编译
任务: 优化超导和分区中性原子设备的量子比特路由,以最小化开销(SWAP 门)和执行时间。
结果:
超导设备: 与 SABRE 相比,平均减少了 21.7% 的附加 SWAP 开销;与 LightSABRE 相比减少了 14.9% 。在特定基准测试(Q20)上,降幅达到了 24.5% 。
中性原子设备: 与 ZAC 式基准线相比,总执行时间减少了 33.2% (几何平均值)。
2. 天体力学轨道设计
任务: 利用引力助推和深空机动(DSM)设计高燃料效率的深空轨道。
结果: 演化出的优化器在五个历史任务窗口(Mariner 10, Voyager 2, Galileo, Cassini, Rosetta)中,与基于历史遭遇序列构建的参考方案相比,降低了 2.1% 至 23.1% 的推进成本。
发现: 合成了适用于 2028–2030 发射窗口的、无需中间 DSM 的可行地球–金星–地球–地球–木星轨道。
3. 科学算法
Lasso 路径求解器: 发现了一个几何感知求解器,在真实数据集上比专家设计的 glmnet 快 2.17 倍 ,比 sklearn 快 14.08 倍 ,同时保持严格的正确性保证。该求解器根据问题几何形状在 LARS 同伦法和坐标下降法之间动态切换。
全脑神经活动: 为 ZAPBench(斑马鱼神经活动)发现了一个预测器,在 32 步步长下,其平均绝对误差(MAE)比之前的 SOTA(ERA)降低了 8.5% ,超越了由专用模型驱动的结果和体积 U-Net 基准。
单细胞 RNA-seq 去噪: 在留出集 Tabula Muris Senis Lung 数据集上实现了 0.74 的去噪得分,超过了 TTT-Discover (0.73)。
4. AI 基础
GPU 内核优化: 发现了目前报告的最快 TriMul 内核 (AlphaFold3 的核心部分),在 H100 上的延迟为 1.122 ms ,超过了专家编写的 Triton 实现 (1.140 ms) 及 AI 基准。该实现无需重新调优即可在 A100、H100 和 MI300 上通用。
缩放法则发现: 在 SLDBench 上,SIMPLETES 实现了最高的平均外推 R 2 R^2 R 2 (0.674 ),优于使用 GPT-5 的 SLDAgent (0.572)。它特别是在困难的外推任务(如 U 型缩放)上取得了成功,而其他智能体在此类任务中表现失败(R 2 R^2 R 2 为负)。
5. 数学发现
结果: 在四个经典问题上建立了新的 SOTA 界限:
Erdős Minimum-Overlap: 将界限从 0.380871 提高到 0.380868 。
第二自相关不等式: 将界限从 0.961206 提高到 0.962694 。
第三自相关不等式: 将界限从 1.454555 提高到 1.453675 。
Sum–Difference 问题: 将比例从 1.121936 提高到 1.143975 。
后训练影响: 通过轨迹级后训练,模型在留出集 Sum–Difference 问题上达到了新的 SOTA 1.144887 ,这是一个在相同预算下未经训练的搜索无法找到的解。
意义与主张
本文认为,结构化缩放 是推进 AI 科学发现的一种通用机制。作者主张:
结构胜过复杂度: 一个带有结构化评估循环的单一开源模型,可以匹配甚至超越使用更大型专用模型和复杂智能体机制的系统。评估循环本身的组织形式是能力的主要来源。
评估驱动缩放: 进步的关键不仅在于更多的计算量,还在于如何分配评估查询(分布在宽度、深度和局部选择中)以及如何重用反馈。
长程学习: 对轨迹级结果而非即时奖励进行后训练,使模型能够学习发现的“拓扑结构”,使其能够追求导致突破性的非常规路径。
通用性: 同一套固定的程序和配置成功处理了从精确数学验证和物理模拟到经验硬件计时和生物预测等各种问题,展示了该框架的通用性。
作者强调,这些结果是在没有多智能体协作、模型集成或在搜索过程中进行在线参数更新(除了特定的后训练阶段)的情况下实现的,凸显了结构化循环本身的力量。他们承认了关于评估器保真度(奖励作弊/reward hacking)以及对廉价自动化反馈需求的局限性,但认为该框架为存在此类评估器的领域提供了一条可扩展的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。