Scaling Test-Time Compute to Achieve IOI Gold Medal with Open-Weight Models
该论文提出了名为 GenCluster 的可扩展测试时计算框架,通过结合大规模生成、行为聚类、排序及循环提交策略,首次利用 gpt-oss-120b 等开源模型在 2025 年国际信息学奥林匹克竞赛(IOI)中实现了金牌水平表现,显著缩小了开源与闭源系统之间的能力差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个非常酷的故事:研究人员如何让开源的 AI 模型(大家都能免费使用的模型)通过“疯狂刷题”和“精挑细选”,在世界上最难的编程比赛(IOI,国际信息学奥林匹克竞赛)中拿到了金牌。
以前,只有那些闭源的、像“黑箱”一样的超级 AI(比如 OpenAI 的某些模型)才能做到这一点,而且它们具体是怎么做的,大家都不知道。但这篇论文打破了这个局面,用一套公开、透明的方法,让开源模型也做到了。
我们可以把整个过程想象成举办一场超级宏大的“编程选秀大赛”。
1. 核心挑战:题目太难,时间太紧
想象一下,IOI 比赛就像是一场极限生存挑战。
- 题目:6 道超级难的数学/逻辑题,每道题又分成很多个小关卡(子任务)。
- 规则:你只有有限的机会(每道题最多提交 50 次)。如果你提交的代码错了,你就浪费了一次机会。
- 现状:普通的 AI 就像是一个聪明的学生,但面对这种高难度题目,它可能只能写出几个答案,而且容易犯错。
2. 解决方案:GENCLUSTER(基因聚类法)
研究团队发明了一套名为 GENCLUSTER 的“选秀策略”。这套策略不靠运气,而是靠人海战术 + 智慧筛选。我们可以把它分成四个步骤:
第一步:疯狂生成(人海战术)
- 比喻:想象你雇佣了5000 个不同的“实习生”(AI 生成的代码),让他们同时去解同一道题。
- 做法:不管对错,先让他们写出 5000 个不同的解决方案。这就好比在沙滩上撒下 5000 粒沙子,虽然大部分是沙子,但里面肯定藏着几颗珍珠。
- 结果:我们得到了一大堆候选代码,其中肯定有能解出难题的“天才代码”。
第二步:行为聚类(分组淘汰)
- 比喻:这 5000 个答案太乱了,我们需要把它们分类。
- 做法:研究人员让 AI 自己生成一些“测试题”(就像给实习生出小测验)。然后看这 5000 个答案在测试题上的表现。
- 如果两个答案在所有测试题上的表现一模一样(比如都算对了,或者都算错了),就把它们归为同一组。
- 这就像把 5000 个实习生按“解题风格”分成了几十个小组。如果一组里的人表现都很烂,那整个组就可以直接淘汰了。
- 目的:把 5000 个答案压缩成几十个“精英小组”,大大减少了工作量。
第三步:循环赛排名(擂台比武)
- 比喻:现在我们有几十个小组了,谁才是最强的?不能靠猜,要打擂台。
- 做法:
- 每个小组派出一位“代表”(通常是那个思考过程最长、最详细的代码)。
- 让这些代表进行循环赛(就像足球联赛,大家互相 PK)。
- 让另一个 AI 当“裁判”,看谁的答案更好,谁就赢。
- 最后,赢的次数最多的小组,排名就最高。
- 目的:通过比赛,把最有希望拿金牌的小组排在最前面。
第四步:轮流出战(提交策略)
- 比喻:比赛规则限制你只能提交 50 次。怎么提交最划算?
- 做法:
- 不要一次性把最好的 50 个都交上去(万一前 10 个都错了呢?)。
- 采用"轮盘赌"策略:从排名第一的小组拿一个,再从排名第二的小组拿一个,再拿第三名的……像发牌一样轮流提交。
- 一旦某个小关卡被解开了(拿到了满分),就立刻停止提交该关卡,转战下一个难题。
- 结果:这种策略确保了在有限的 50 次机会里,尽可能覆盖到所有可能正确的答案,最大化得分。
3. 实验结果:开源模型也能拿金牌
- 主角:他们选用了 gpt-oss-120b 这个开源模型作为“实习生”队长。
- 战绩:通过这套“疯狂生成 + 精挑细选”的方法,这个开源模型在 IOI 2025 的模拟测试中,成功拿到了金牌(Gold Medal)。
- 意义:
- 这是第一次有人用完全公开、透明的方法,让开源模型在顶级编程竞赛中拿到金牌。
- 证明了:只要给足算力(让 AI 多思考、多尝试),开源模型也能追上甚至超越那些昂贵的闭源模型。
4. 总结与启示
这就好比以前大家觉得,只有花大价钱请“特级厨师”(闭源模型)才能做出满汉全席。但这篇论文告诉我们:只要给“普通厨师”(开源模型)足够多的食材(算力),并给他们一套科学的“试菜、筛选、上菜”流程(GENCLUSTER),他们也能做出金牌大餐!
当然,也有代价:
这套方法非常“烧钱”(需要巨大的计算资源),就像为了做一道菜,你可能需要试做 5000 次。虽然结果很完美,但在普通人的电脑上可能跑不动。但这为未来的 AI 发展指明了一个方向:算力 + 聪明的策略 = 超级智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。