← 最新论文
💬 NLP

OpenCompass: A Universal Evaluation Platform for Large Language Models

本文介绍了 OpenCompass,这是一个开源、可扩展且支持高并发的评估平台,旨在通过提供一个模块化、统一的框架,对大语言模型在多个领域进行全面且高效的评估,从而克服传统静态基准测试的局限性。

原作者: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu
发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一个庞大而繁忙的建筑工地。多年来,建筑工人们使用各种小型专用工具,一次只建造一种特定的东西。但最近,他们开始建造“超级大脑”(大型语言模型,或称 LLM),这些大脑几乎无所不能:写诗、解数学题、编写代码,甚至提供医疗建议。

问题在于:你如何知道这些“超级大脑”究竟是真正聪明,还是仅仅靠运气?你不能只是问它们“你厉害吗?”,因为它们可能会撒谎或感到困惑。你需要一个严格的测试。

这就是OpenCompass登场之处。请将 OpenCompass 想象成不仅仅是一次测试,而是一个庞大、自动化的测试工厂

问题:一个混乱的车间

在 OpenCompass 出现之前,测试这些模型就像在一个混乱的教室里批改试卷,每位老师都使用不同的评分标准。

  • 混乱局面:有些老师用红笔,有些用蓝笔;有些检查拼写是否准确,有些则关注答案的“神韵”;有些测试在纸上进行,有些则在计算机上进行。
  • 瓶颈:如果你想在 100 个不同学科(如历史、编程和科学)上测试一个模型,你就必须运行 100 个独立的、缓慢的、手动流程。这种方式既缓慢又碎片化,难以比较结果。

解决方案:OpenCompass 工厂

作者们构建了 OpenCompass,使其成为一个通用的一站式测试中心。他们采用了“乐高”理念来设计它:一切皆模块化。你可以将不同的部分拼接在一起,构建出你需要的确切测试。

以下是该工厂的运作方式,分解为简单步骤:

1. 蓝图(配置系统)

在工厂启动之前,你需要一张蓝图。在 OpenCompass 中,这就是配置系统

  • 它的作用:你告诉系统:“我想用特定风格的问题,在数学数据集上测试模型 A。”
  • 神奇之处:它就像一个通用翻译器。无论你使用的是来自 Hugging Face 的模型、快速 API,还是自建的“大脑”,OpenCompass 都能听懂它们的语言,并设定规则,让它们都遵循统一的标准。

2. 流水线(分区与并行)

在数千道题目上测试一个巨型模型需要很长时间。如果一道一道地做,那将耗时无穷。

  • 策略:OpenCompass 使用**分区器(Partitioner)**将庞大的题目堆切成微小、易消化的碎片。
  • 威力:想象一下,你有一支由 100 名工人(计算机)组成的团队,而不是一个人。运行器(Runner)会同时将这些微小碎片发送给所有 100 名工人。这被称为高并发。它将原本可能需要数天才能完成的任务,缩短至几小时。

3. 工人(任务)

一旦碎片准备就绪,**任务(Tasks)**便开始工作。主要有两类工人:

  • 推理工人:这位工人将问题输入给 AI 模型,并收集答案。
  • 评分工人:这位工人将 AI 的答案与正确答案(或“黄金标准”)进行比较。

4. 评分系统(评估器)

你如何给答案打分?OpenCompass 有三种巧妙的方法,就像一所拥有不同类型老师的学校:

  • 基于规则的“老师”:对于数学题或选择题,这位老师使用严格的规则(就像计算器)。如果答案是"42",那就是对的;如果是"43",那就是错的。这种方法快速且成本低廉。
  • "AI 裁判”老师:对于创意写作或复杂辩论,没有唯一的“正确答案”。因此,OpenCompass 聘请另一个 AI来充当裁判。这位“裁判 AI"阅读答案,并根据其逻辑性、流畅度或有帮助的程度给出分数。
  • 混合“老师”:这是两者的最佳结合。首先,基于规则的“老师”快速检查简单部分。如果答案棘手,则将其转交给 AI 裁判。这既节省了金钱和时间,又保持了高准确度。

5. 成绩单(可视化)

最后,所有分数被汇总到一个可视化仪表板中。

  • 你得到的不是一张杂乱的电子表格,而是一份清晰、色彩丰富的成绩单。它向你精确展示 AI 在哪里是天才(例如,“擅长编程!”),在哪里存在困难(例如,“不擅长长故事”)。

它能测试什么?

OpenCompass 就像一把用于测试的瑞士军刀。它支持超过100 种不同类型的测试,包括:

  • 知识:AI 是否了解历史和科学事实?
  • 推理:它能解决逻辑谜题吗?
  • 数学与代码:它能做微积分或编写软件吗?
  • 语言:它能流利地讲多种语言吗?
  • 长文本:它能读完一整本书并记住细节吗?

核心结论

该论文声称,OpenCompass 解决了“混乱车间”的问题。通过使测试过程模块化、快速且标准化,它为研究人员和公司提供了一种可靠的方法,以确切了解他们的 AI 模型究竟有多好。它不仅告诉你模型是否聪明,还告诉你它在哪些方面聪明,以及在哪些方面需要加强学习。

作者们已将这个“工厂”开源,这意味着任何人都可以下载它,构建自己的测试生产线,并帮助改善人工智能的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →