← 最新论文
💻 computer science

From Programs to Predictions: A Scalable, Multilingual Platform for Automated Evaluation of Machine-Learning Olympiads

本文介绍了 MLCompete,这是一个可扩展、多语言的 Web 平台,旨在通过异步、与指标无关的流水线以及安全的两层执行环境来评估机器学习奥林匹克竞赛,并通过在罗马尼亚国家人工智能奥林匹克竞赛中的成功部署及国际参与,证明了其鲁棒性和可靠性。

原作者: Robert-Mihai Colca, Rusu Dinu-Stefan, Mihai Nan

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Robert-Mihai Colca, Rusu Dinu-Stefan, Mihai Nan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正身处一场规模宏大、高风险的烹饪大赛中,但参赛者递交给你的不是一道完成的菜肴,而是一张写着预测风味的秘密食谱卡。在过去,计算机竞赛就像是严格的味觉测试:你提交一个程序,裁判运行它,如果输出结果与答案键不完全一致,你就失败了。但在如今这个“机器学习奥林匹克”的新世界里,规则已经改变了。评委们并不关心代码是否完美运行,他们关心的是你的预测是否足够接近真相,而且使用的评分规则极其古怪且定制化,每个题目都各不相同。

欢迎来到 MLCompete,这是一个专为处理这种混乱、高速的“风味挑战”而构建的数字平台。它是罗马尼亚国家人工智能奥林匹克的官方裁判,它正在实现其他系统无法做到的事情:它能让成千上万的学生参与竞争,提交他们的“风味预测”,并根据那些像雪花一样独特的评分规则进行即时评分。

重大转变:从运行代码到评判猜测

论文指出,你不能仅仅通过微调一个旧式的计算机评判系统来应对这种情况。这就像试图用秒表来测量汤的味道一样。旧系统会等待程序运行结束并吐出答案。然而,MLCompete 意识到,在 AI 竞赛中,繁重的任务发生在提交之前。学生在其他地方(或在平台上)训练他们的模型,然后上传一个充满预测结果的文件。平台的工作是获取该文件,将其与隐藏的“答案键”(地面真值)进行对比,并使用可能针对该特定问题的指标来计算得分。

作者明确排除了这仅仅是标准编程竞赛“放大版”的想法。他们表示,基础设施需要从根本上进行改变,因为交付物不是一个程序,而是一组预测,且评分不是“对或错”,而是一个关于猜测好坏的连续尺度。

运作机制:流水线

把 MLCompete 想象成一条超高效、自动化的工厂流水线。

  1. 投递: 当学生上传他们的预测文件时,系统不会让他们等待。这就像一个智能收发室,能立即盖上“已收到”的印章并说:“我们会尽快处理。”这就是**异步(asynchronous)**的部分。学生可以去玩游戏,而真正的任务在后台进行。
  2. 队列: 提交的内容会被投入到一个数字等待队列(消息队列)中。这是成功的秘诀。这意味着如果 1,000 名学生在同一秒钟提交,系统不会崩溃;它只会把他们排好队。
  3. 评分团队: 一组隐形的工人(称为“评估器”)会从队伍中取出下一个文件,运行特定的评分脚本(这可能是一个标准的数学公式,也可能是由题目作者编写的自定义脚本),并计算得分。
  4. 结果: 一旦得分准备就绪,系统就会在近乎实时的情况下将结果推送到学生的屏幕上。

论文显示,这种设置非常快速。在 15 天的时间窗口内,系统处理了超过 810 万次请求。后端(操作的大脑)速度极快,95% 的情况下,其响应时间不到 255 毫秒。这比眨眼还要快。

“两阶段”排行榜

这里有一个论文中解释的巧妙技巧,用于防止作弊。想象一个排行榜,它向你展示你当前的表现,但这仅基于一小部分公开的测试题。这能保持学生的参与度。但真正的最终排名是基于一组没人见过的秘密、私有的问题集。

平台会同时计算这两个分数。它能防止学生通过提交数千次来观察哪一次会意外撞上秘密答案,从而“钻系统的空子”。为了获胜,学生必须在截止日期前明确挑选出自己的两个最佳提交。系统随后会在秘密排行榜上取这两者中的较优值。这迫使学生信任自己的最佳成果,而不是在系统中进行垃圾信息轰炸。

代码的“安全室”

有时,学生需要直接在平台的超级计算机上运行自己的代码,以生成预测。这是危险的,因为你不希望学生有 Bug 的代码窃取数据或导致整个系统崩溃。

论文描述了一种“深度防御”的安全模型。对于最高级的阶段(国家队选拔营),学生可以获得强大的 NVIDIA H200 GPU。但神奇之处在于:平台使用了一种称为 MIG(多实例 GPU) 的技术,将一个巨大的 GPU 切割成五个较小的、隔离的部分。每个学生都有自己的一小块内存和计算能力。这就像在巨大的图书馆里给每位参赛者提供了一个私人的、隔音的隔间。即使某个学生的代码失控,它也无法触及任何人的数据或计算机的其他部分。

为了确保他们不会通过在网上查找答案来作弊,平台使用了一个“白名单代理”。它就像一位严厉的图书管理员,只允许你阅读一份预先批准的清单上的书。在比赛期间,学生只能与平台、他们的身份提供商以及 Jupyter 编码环境进行通信。互联网、公共模型中心和随机网站都是被完全屏蔽的。

数据统计:效果如何?

作者不仅建造了它,还通过一场真实的国家级竞赛对其进行了实战检验。

  • 可靠性: 系统几乎完美地运行着。“服务器错误”率极低,仅为 0.007%。这意味着每 10,000 次请求中,大约只有 7 次失败。
  • 成本: 他们在处理日常稳定流量时,仅使用了一台普通的计算机服务器(一个“商品化 K3s 节点”)。这就像是用一个单一的售票窗口来运营一个大型主题公园,并在人群变大时才多开几个窗口。
  • 峰值: 在国家队选拔营期间,流量比平时增加了 3 到 6 倍。得益于其在线路变长时自动增加更多“工人”的能力,系统吸收了这次激增而没有减速或崩溃。
  • 可扩展性: 作者运行了模拟(计算机模型,而非实测)来观察如果数百名学生同时提交会发生什么。他们发现,只要拥有 10 个工作者的资源池,系统就能处理高达 每秒 5 次提交 的量,且几乎零等待。如果队伍变长,系统会自动增加更多的“工人”。

它并非解决所有问题

论文谨慎地说明了它尚未证明的内容。作者承认,他们的实时数据仅涵盖了 15 天的窗口期,其中包含了“适度的”竞赛激增,但错过了数百名学生竞争的“春季”阶段。因此,虽然系统完美处理了队选营的激增,但作者只是建议(而非证明)该系统可以进一步扩展到更大的活动。他们还指出,尽管他们拥有强大的安全性,但仍在致力于开发更严苛的“内核级”沙箱,以使代码执行对最顽固的黑客来说也绝对无懈可击。

总结

MLCompete 证明了,通过将预测视为邮件、将评分视为工厂流水线,你可以为 AI 竞赛构建一个大规模、多语言、安全且廉价的平台。它不是解决所有 AI 问题的魔杖,但它是一个坚实的、行之有效的蓝图,让学生能够专注于学习和竞争,而不是担心计算机是否会崩溃。正如论文所总结的,这种架构是行之有效的,数据也证实了这一点,为运行 AI 教育的未来提供了一种新的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →