AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
该论文介绍了 AI4AI-Bench,这是一个由 10 个冻结的研究仓库组成的创新基准测试,用于评估大语言模型智能体设计和重写用于递归自我改进的训练算法的能力,并揭示了即使是最先进的系统,目前也仅实现了现有算法与理论最优值之间不到四分之一的潜在性能增益。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能的梦想通常包含这样一种愿景:一台机器不仅能通过记忆更多事实来变得更聪明,还能通过重写其学习时所使用的规则来实现自我进化。这种被称为“递归自我改进”的概念,暗示了一个循环:一个人工智能系统设计出一个更好的自身版本,而这个版本又会设计出一个更优秀的版本,从而创造出一条快速进化的链条。为了让这个循环奏效,机器必须能够改进训练算法——即那套告诉计算机如何根据经验调整其内部连接的指令集。虽然机器在遵循指令甚至微调这些指令中的细微设置方面已经做得非常出色,但它们是否真的能够重新设计这些指令本身,仍然是一个悬而未决的问题。这就是懂得如何调节收音机音量的驾驶员与懂得如何重建发动机的机械师之间的区别。
一支研究团队构建了一项新测试,旨在观察当前的人工智能系统是否能够进行这种深层的“机械性工作”。他们创建了一个名为 AI4AI-Bench 的挑战赛,向一组先进的人工智能智能体(agents)展示了十个不同的、真实的科研项目。每个项目都涉及特定类型的学习任务,例如教计算机解决数学问题、生成图像或理解人类偏好。研究人员给予每个 AI 智能体四个小时的计算时间,去阅读其中一个项目的代码,并尝试改进其内部使用的学习方法。智能体可以随心所欲地修改代码,但在那四个小时内,它无法看到其修改后的最终结果。相反,它必须依赖一个快速且粗略的估计来猜测自己的想法是否可行。一旦时间结束,智能体修改后的代码会被收回,该项目将从头开始运行长达十二个小时,并使用一套固定的、隐藏的规则来评判最终结果。这种设置模拟了人类科学家的真实经历:科学家可以快速测试一个小想法,但必须等待数日才能看到一种新的训练方法在大规模应用中是否真正奏效。
实验结果具有启发性。在二十九种不同的 AI 系统与努力程度的组合中,平均表现相当低。在一个原始未修改代码得分为 0.1、理论最高分为 1.0 的量程上,平均得分仅为 0.166。即使是最强大的系统,也仅达到了 0.250。这意味着最出色的智能体也仅仅填补了现有方法与最佳结果之间不到五分之一的差距。研究人员发现,造成这一差距的原因并非缺乏努力或计算能力,而是缺乏方向感。当团队分析智能体所做的代码更改时,他们发现绝大多数提交的代码根本没有触及核心学习规则。相反,大多数智能体只是调整了训练运行的时长、保存进度的频率,或是用于调节过程的具体数值。这些是对运行过程的调整,而非对模型学习方式的改变。
只有极少数的智能体(约占做出任何更改的智能体的 46%)实际上深入到了学习算法内部,去改变目标函数、监督信号或更新规则。这些智能体的表现显著更好,平均得分为 0.226,而其他智能体的平均得分仅为 0.126。这表明,实现真正进步的路径在于改变机器学习的基础方式,而这是一个大多数现有系统都不敢轻易尝试的步骤。研究还表明,增加允许智能体使用的推理努力程度并不会让智能体在通用意义上变得更聪明,但确实会让它们变得更“大胆”。当给予智能体更多的思考和规划时间时,敢于改变学习规则的智能体比例从 8% 跳升至 64%。这种对核心算法进行冒险尝试的意愿提升,才是推动进步的动力,而非生成的想法质量发生了突飞猛进的跃迁。
最终,论文得出结论:当今的人工智能智能体仍处于恢复一种“胜任的默认水平”阶段,而非在设计超越该水平的新高度。它们擅长优化学习过程周围的流程,但在重新设计学习过程本身方面却显得力不从心。研究人员发布了他们所有的数据,包括代码更改和评分,以便他人可以在 AI 系统演进的过程中重复进行这项测试。该基准测试作为一个衡量特定进步的标尺:即机器能否审视自身的训练方法,诊断出缺陷,并重写驱动其自我改进的机制。就目前而言,答案是:虽然它们可以尝试,但很少能成功实现真正实现智能复合所需的深度变革。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。