← 最新论文
💬 NLP

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

本文介绍了 HeuriGym,这是一个开源的智能体基准测试,用于评估大语言模型迭代生成并优化组合优化问题启发式算法的能力,并通过一种新颖的质量-收益指数(Quality-Yield Index)指标,揭示了当前模型在工具使用和自适应推理方面的显著局限性。

原作者: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由极其聪明、博学多才的机器人(大语言模型,简称 LLM)组成的团队。它们擅长写论文、回答常识问题,甚至能编写基础的计算机代码。你想知道它们是否真的能够独立解决困难的现实世界谜题,而不仅仅是背诵教科书上的答案。

这篇论文介绍了一个名为 HeuriGym 的新“健身房”来测试这一点。以下是通过简单的类比对它的工作原理进行的解释:

1. 问题所在:“问答竞赛” vs. “真正的职业”

目前的 AI 测试就像是一场多项选择题测验

  • 问题在于: 如果你问 AI 一个它在训练数据中见过的数学题,它能拿 A+。但如果你问它一种新类型的问题,它往往会陷入僵局。这就像一个背下了答案解析、却并不理解数学本质的学生。
  • 旧的方法: 一些测试要求 AI 编写能够通过特定检查的代码。但这些测试通常过于简单,或者只有一个“正确答案”。
  • 新的方法 (HeuriGym): HeuriGym 不仅仅是举办一场考试,它更像是给 AI 一个复杂的建筑工程项目,且没有任何说明书。目标不仅仅是“通过”测试,而是要建造一台高效运转的机器。

2. 挑战:“组合优化”谜题

该论文关注一种特定类型的难题,称为组合优化 (Combinatorial Optimization)

  • 类比: 想象你是一名物流经理,负责调度 1,000 辆货车。你必须为每辆车规划出完美的路线,以便它们使用最少的燃油并准时到达。
  • 难点: 可能的路线数量比宇宙中的原子还要多。你无法检查所有路径。你必须成为一个“启发式 (heuristic)”天才——这意味着你必须发明一种聪明的捷径或“经验法则”,以便快速找到一个足够好的解法,即使它在数学上不是完美的。

3. 设置:“智能体循环 (Agentic Loop)”

HeuriGym 不仅仅是让 AI 写一次代码并评分。它建立了一个反馈循环,就像带有“重生”机制的视频游戏一样。

  1. 提示词 (The Prompt): AI 接收到一个问题描述(例如:“调度这些电子电路以实现最快运行速度”)。
  2. 尝试 (The Attempt): AI 编写一个程序(一种启发式算法)来解决问题。
  3. 现实检查 (The Reality Check): 系统运行该代码。
    • 它崩溃了吗?(语法错误)
    • 它违反规则了吗?(约束违规)
    • 它运行太慢了吗?(超时)
  4. 反馈 (The Feedback): 系统告诉 AI:“你尝试使用了一个不存在的库,”或者“你的方案违反了时间限制。”
  5. 重试 (The Retry): AI 阅读错误信息,从中学习,并尝试重写代码以修复错误。

这个循环不断重复,允许 AI 通过试错来“学习”如何解决问题,就像人类工程师一样。

4. 评分标准:“质量-产出指数 (QYI)”

如何为一个试图发明新方法来解决谜题的机器人评分呢?作者创建了一个新的分数,称为 QYI

  • 产出 (Yield): 机器人是否在没有崩溃的情况下完成了任务?(它是否得到了一个可运行的解?)
  • 质量 (Quality): 与人类专家相比,这个解法有多好?
  • 得分: 得分为 1.0 意味着机器人的表现与人类专家完全一致。得分为 0 意味着它完全失败。

5. 结果:“现实检验”

作者测试了九种目前最智能的 AI 模型(如 GPT-o4-mini 和 Gemini-2.5-Pro)。

  • 结论: 即便是那些“最聪明”的模型,得分也仅在 0.6 左右。
  • 这意味着: 最优秀的 AI 模型在处理这些任务时,其效能仅为人类专家的 60% 左右。它们通常能写出可以运行的代码,但在编写足够高效或足够具有创造性以击败人类设计方案的代码方面,仍感到吃力。
  • 困境: 这些模型经常陷入死循环、产生幻觉(编造不存在的计算机库),或者无法理解复杂的约束条件。它们擅长遵循指令,但在“跳出框架思考”以发明新策略方面表现不佳。

6. 为什么这很重要

论文指出,我们需要停止用简单的问答来测试 AI,而应该开始用真实的工程挑战来测试它们。

  • 目标: 推动 AI 的发展,使其能够真正进行推理、适应并为科学和工程领域发明新的解决方案,而不仅仅是记忆模式。
  • 总结: 我们已经建立了一个强大的工具(HeuriGym)来衡量这种进步。目前,AI 像是一个很有前途的学徒,但在成为解决复杂现实世界优化问题的“大师级匠人”之前,还有很长的路要走。

简而言之: HeuriGym 是一个 AI 机器人尝试通过制造自己的工具来解决不可能完成的谜题的“健身房”。它们正在进步,但仍然会犯很多错误,并且尚未达到人类专家的水平。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →