← 最新论文
💬 NLP

Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models

该论文提出了名为 GenCluster 的可扩展测试时计算框架,通过结合大规模生成、行为聚类、排序及循环提交策略,首次利用 gpt-oss-120b 等开源模型在 2025 年国际信息学奥林匹克竞赛(IOI)中实现了金牌水平表现,显著缩小了开源与闭源系统之间的能力差距。

原作者: Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Mehrzad Samadi, Aleksander Ficek, Sean Narenthiran, Siddhartha Jain, Wasi Uddin Ahmad, Somshubra Majumdar, Vahid Noroozi, Boris Ginsburg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个非常酷的故事:研究人员如何让开源的 AI 模型(大家都能免费使用的模型)通过“疯狂刷题”和“精挑细选”,在世界上最难的编程比赛(IOI,国际信息学奥林匹克竞赛)中拿到了金牌

以前,只有那些闭源的、像“黑箱”一样的超级 AI(比如 OpenAI 的某些模型)才能做到这一点,而且它们具体是怎么做的,大家都不知道。但这篇论文打破了这个局面,用一套公开、透明的方法,让开源模型也做到了。

我们可以把整个过程想象成举办一场超级宏大的“编程选秀大赛”

1. 核心挑战:题目太难,时间太紧

想象一下,IOI 比赛就像是一场极限生存挑战

  • 题目:6 道超级难的数学/逻辑题,每道题又分成很多个小关卡(子任务)。
  • 规则:你只有有限的机会(每道题最多提交 50 次)。如果你提交的代码错了,你就浪费了一次机会。
  • 现状:普通的 AI 就像是一个聪明的学生,但面对这种高难度题目,它可能只能写出几个答案,而且容易犯错。

2. 解决方案:GENCLUSTER(基因聚类法)

研究团队发明了一套名为 GENCLUSTER 的“选秀策略”。这套策略不靠运气,而是靠人海战术 + 智慧筛选。我们可以把它分成四个步骤:

第一步:疯狂生成(人海战术)

  • 比喻:想象你雇佣了5000 个不同的“实习生”(AI 生成的代码),让他们同时去解同一道题。
  • 做法:不管对错,先让他们写出 5000 个不同的解决方案。这就好比在沙滩上撒下 5000 粒沙子,虽然大部分是沙子,但里面肯定藏着几颗珍珠。
  • 结果:我们得到了一大堆候选代码,其中肯定有能解出难题的“天才代码”。

第二步:行为聚类(分组淘汰)

  • 比喻:这 5000 个答案太乱了,我们需要把它们分类
  • 做法:研究人员让 AI 自己生成一些“测试题”(就像给实习生出小测验)。然后看这 5000 个答案在测试题上的表现。
    • 如果两个答案在所有测试题上的表现一模一样(比如都算对了,或者都算错了),就把它们归为同一组
    • 这就像把 5000 个实习生按“解题风格”分成了几十个小组。如果一组里的人表现都很烂,那整个组就可以直接淘汰了。
  • 目的:把 5000 个答案压缩成几十个“精英小组”,大大减少了工作量。

第三步:循环赛排名(擂台比武)

  • 比喻:现在我们有几十个小组了,谁才是最强的?不能靠猜,要打擂台
  • 做法
    • 每个小组派出一位“代表”(通常是那个思考过程最长、最详细的代码)。
    • 让这些代表进行循环赛(就像足球联赛,大家互相 PK)。
    • 让另一个 AI 当“裁判”,看谁的答案更好,谁就赢。
    • 最后,赢的次数最多的小组,排名就最高。
  • 目的:通过比赛,把最有希望拿金牌的小组排在最前面。

第四步:轮流出战(提交策略)

  • 比喻:比赛规则限制你只能提交 50 次。怎么提交最划算?
  • 做法
    • 不要一次性把最好的 50 个都交上去(万一前 10 个都错了呢?)。
    • 采用"轮盘赌"策略:从排名第一的小组拿一个,再从排名第二的小组拿一个,再拿第三名的……像发牌一样轮流提交。
    • 一旦某个小关卡被解开了(拿到了满分),就立刻停止提交该关卡,转战下一个难题。
  • 结果:这种策略确保了在有限的 50 次机会里,尽可能覆盖到所有可能正确的答案,最大化得分。

3. 实验结果:开源模型也能拿金牌

  • 主角:他们选用了 gpt-oss-120b 这个开源模型作为“实习生”队长。
  • 战绩:通过这套“疯狂生成 + 精挑细选”的方法,这个开源模型在 IOI 2025 的模拟测试中,成功拿到了金牌(Gold Medal)。
  • 意义
    • 这是第一次有人用完全公开、透明的方法,让开源模型在顶级编程竞赛中拿到金牌。
    • 证明了:只要给足算力(让 AI 多思考、多尝试),开源模型也能追上甚至超越那些昂贵的闭源模型。

4. 总结与启示

这就好比以前大家觉得,只有花大价钱请“特级厨师”(闭源模型)才能做出满汉全席。但这篇论文告诉我们:只要给“普通厨师”(开源模型)足够多的食材(算力),并给他们一套科学的“试菜、筛选、上菜”流程(GENCLUSTER),他们也能做出金牌大餐!

当然,也有代价
这套方法非常“烧钱”(需要巨大的计算资源),就像为了做一道菜,你可能需要试做 5000 次。虽然结果很完美,但在普通人的电脑上可能跑不动。但这为未来的 AI 发展指明了一个方向:算力 + 聪明的策略 = 超级智能

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →