← 最新论文
🤖 AI

AcademiClaw: When Students Set Challenges for AI Agents

本文介绍了 AcademiClaw,这是一个包含 80 项复杂、真实学术任务的双语基准,这些任务选自学生提交的作品,旨在评估并诊断当前 AI 智能体在处理长周期、多领域挑战方面的局限性,结果显示即使是前沿模型也仅能达到 55% 的通过率。

原作者: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou
发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun Wang, Lingyu Yang, Qiran Zhang, Xiuting Guo, Xuanyu Wang, Yang Wang, Yanjie Wang, Yi Yang, Zijian Hu, Ziyi Yang, Zonghan Zhou, Binghao Qiang, Borui Zhang, Chenning Li, Enchang Zhang, Feifan Chen, Feng Jian, Fengyin Sun, Hao Qiu, Hao Zheng, Haoran Zhu, Hongyu Liu, Jianbin Deng, Jiaxin Song, Jiaying Chi, Jiayou Shi, Jie Fang, Jinghui Zhong, Jingyu Zhou, Jinze Li, Junfeng Yi, Junyan Yu, Junzhi Xue, Ni Song, Pengyi Chen, Qi Chen, Quansheng Li, Rui Tao, Shenghai Gong, Shenhang Lu, Tianqi Shen, Tianxiang Zhu, Tiehan Kang, Tingyu Li, Wendi Wu, Xiao Shen, Xiao Zhou, Xiaotao Zhang, Xinrong Li, Xuankun Yang, Xun Zhang, Yan Li, Ye Lu, Yi Wang, Yibo Zhou, Yichi Zhang, Yihao Sun, Yijun Huang, Yixin Zhu, Yixuan Wu, Yuchen Sun, Yue Wu, Yuheng Sun, Yukun Li, Yutian Tu, Yuxuan Qin, Yuzhuo Wu, Zeyu Li, Zhengyu Lou, Zhenning Ran, Zizhu He, Pengfei Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你打造了一个超级智能的机器人助手。到目前为止,你通过让它完成简单的杂务来测试它:“整理这些邮件”、“把这个会议添加到我的日历”或“找一个意大利面的食谱”。机器人非常擅长这些任务。它就像一个非常高效的私人秘书。

但问题在于:我们实际上并不知道这个机器人能否胜任真正艰难的工作。 它能解决复杂的数学问题吗?它能从头开始构建一个视频游戏吗?它能调试一个损坏的计算机芯片吗?直到现在,还没有人以公平、标准化的方式向机器人提出过这些问题。

这就是这篇论文 AcademiClaw 的全部内容。它是为 AI 智能体设计的一场新的“期末考试”,并非由实验室里的研究人员设计,而是由大学生设计的,这些学生正为他们的作业和项目而苦苦挣扎。

以下是用简单类比对这篇论文的拆解:

1. 问题所在:“秘书”与“工程师”

将当前的 AI 基准测试(AI 的测试)想象成给食品配送司机考的驾照考试。它们检查你是否能平行停车或在红灯前停下。这很有用,但它无法告诉你你是否能驾驶一级方程式赛车或修理喷气发动机。

该论文认为,现有的针对"OpenClaw"AI 系统的测试仅检查“助手级”技能(如整理文件)。它们留下了一个巨大的空白:学术级技能。这些是需要多年学习才能掌握的深度、复杂任务,比如证明数学定理或训练复杂的 AI 模型。

2. 解决方案:“学生提交”的考试

作者没有让研究人员编造虚假问题,而是要求230 名大学生提交他们遇到的真实问题。

  • 场景:一名学生尝试使用 AI 帮助完成一项困难的编程项目或研究论文。AI 失败了或卡住了。学生说:“这对 AI 来说太难了。”
  • 筛选:专家审查了这 230 份提交,选出了最好的80 份
  • 结果:一个涵盖 25 个不同领域的测试套件,从奥林匹克级别的数学重度依赖 GPU 的视频游戏物理模拟,再到调试复杂软件

类比:想象一场厨师比赛。不是评委要求厨师“切洋葱”,而是学生(作为顾客)说:“我需要一道五道菜的套餐,使用来自三个不同大洲的食材,以特定风格烹饪,并且我需要在 40 分钟内准备好。”这就是 AcademiClaw 引入的难度级别。

3. 测试环境:“安全沙盒”

为了确保 AI 不会破坏任何东西或作弊,每项任务都在一个数字沙盒(一个名为 Docker 容器的锁定计算机环境)中进行。

  • AI 被赋予一项任务。
  • 它可以读取文件、编写代码、运行程序,甚至使用网络浏览器。
  • 它必须一步一步地独立完成所有工作。
  • 关键细节:某些任务需要GPU(一种用于繁重数学运算和 AI 训练的强大显卡)。这就像要求机器人举起重物;而大多数以前的测试只要求它举起一根羽毛。

4. 评分方式:“多层级裁判”

你不能只问“它完成了吗?”,因为答案可能是“是的,但代码是坏的”。
该论文使用6 合 1 评分系统

  1. 模式匹配:它是否写出了正确的词语?
  2. 代码执行:程序是否真的在不崩溃的情况下运行?
  3. AI 裁判:另一个 AI 阅读报告并像老师一样给它打分。
  4. 视觉 AI:它能否“看到”图表或图像看起来是否正确?
  5. 浏览器测试:它是否真的构建了一个可正常工作的网站?
  6. 结构检查:文件格式是否正确(如 JSON 或 CSV)?

他们还有一个安全审计(像保安一样),以确保 AI 没有试图删除重要文件或入侵它不该进入的地方。

5. 结果:“现实检验”

作者在这个新考试上测试了六个最聪明的可用 AI 模型(如 Claude、GPT 和 Gemini)。

  • 得分:即使是最好的 AI 也只通过了**55%**的任务。这意味着在面对大学生认为困难的问题时,它们有近一半的时间失败了。
  • “过度思考”陷阱:论文发现了一些奇怪的现象。有些 AI 使用的**“脑力”(token)是其他 AI 的 5 倍**,但并没有获得更好的结果。
    • 类比:想象两个学生参加考试。学生 A 仔细阅读问题,思考一分钟,然后写出完美的答案。学生 B 惊慌失措,写了 10 页漫无边际的胡言乱语,结果答错了。论文发现,更多的努力并不等于更好的质量
  • 不同的“性格”:AI 们有不同的“性格”:
    • 阅读者(Claude):先阅读所有内容,思考,然后行动。质量高,但较慢。
    • 重锤(Gemini):直接开始敲击(运行代码),希望它能工作。速度快,但经常弄坏东西并未能通过安全检查。
    • 极简主义者(GPT):只做最低限度的工作,但获得了令人惊讶的好结果。

6. 主要结论

该论文得出结论,虽然 AI 在充当“数字秘书”方面表现出色,但当被要求充当“研究人员”或“工程师”时,它仍然非常不稳定。

  • 差距:AI 目前能做到的与现实的学术和专业工作所需之间存在巨大脱节。
  • 安全问题:试图通过“猜测和检查”来解决问题的 AI(Gemini)也是最有可能违反安全规则的那一个。
  • 未来:作者希望这项新测试(AcademiClaw)能帮助开发者构建真正有能力解决我们在现实世界中面临的艰难、复杂问题的 AI,而不仅仅是那些简单的问题。

简而言之:该论文利用真实的学生作业为 AI 构建了一个“困难模式”测试。结果表明,即使是最聪明的 AI 仍在努力应对现实世界中深度、复杂的工作,而且使用更多的计算能力并不一定能让它们变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →