AcademiClaw: When Students Set Challenges for AI Agents
本文介绍了 AcademiClaw,这是一个包含 80 项复杂、真实学术任务的双语基准,这些任务选自学生提交的作品,旨在评估并诊断当前 AI 智能体在处理长周期、多领域挑战方面的局限性,结果显示即使是前沿模型也仅能达到 55% 的通过率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你打造了一个超级智能的机器人助手。到目前为止,你通过让它完成简单的杂务来测试它:“整理这些邮件”、“把这个会议添加到我的日历”或“找一个意大利面的食谱”。机器人非常擅长这些任务。它就像一个非常高效的私人秘书。
但问题在于:我们实际上并不知道这个机器人能否胜任真正艰难的工作。 它能解决复杂的数学问题吗?它能从头开始构建一个视频游戏吗?它能调试一个损坏的计算机芯片吗?直到现在,还没有人以公平、标准化的方式向机器人提出过这些问题。
这就是这篇论文 AcademiClaw 的全部内容。它是为 AI 智能体设计的一场新的“期末考试”,并非由实验室里的研究人员设计,而是由大学生设计的,这些学生正为他们的作业和项目而苦苦挣扎。
以下是用简单类比对这篇论文的拆解:
1. 问题所在:“秘书”与“工程师”
将当前的 AI 基准测试(AI 的测试)想象成给食品配送司机考的驾照考试。它们检查你是否能平行停车或在红灯前停下。这很有用,但它无法告诉你你是否能驾驶一级方程式赛车或修理喷气发动机。
该论文认为,现有的针对"OpenClaw"AI 系统的测试仅检查“助手级”技能(如整理文件)。它们留下了一个巨大的空白:学术级技能。这些是需要多年学习才能掌握的深度、复杂任务,比如证明数学定理或训练复杂的 AI 模型。
2. 解决方案:“学生提交”的考试
作者没有让研究人员编造虚假问题,而是要求230 名大学生提交他们遇到的真实问题。
- 场景:一名学生尝试使用 AI 帮助完成一项困难的编程项目或研究论文。AI 失败了或卡住了。学生说:“这对 AI 来说太难了。”
- 筛选:专家审查了这 230 份提交,选出了最好的80 份。
- 结果:一个涵盖 25 个不同领域的测试套件,从奥林匹克级别的数学到重度依赖 GPU 的视频游戏物理模拟,再到调试复杂软件。
类比:想象一场厨师比赛。不是评委要求厨师“切洋葱”,而是学生(作为顾客)说:“我需要一道五道菜的套餐,使用来自三个不同大洲的食材,以特定风格烹饪,并且我需要在 40 分钟内准备好。”这就是 AcademiClaw 引入的难度级别。
3. 测试环境:“安全沙盒”
为了确保 AI 不会破坏任何东西或作弊,每项任务都在一个数字沙盒(一个名为 Docker 容器的锁定计算机环境)中进行。
- AI 被赋予一项任务。
- 它可以读取文件、编写代码、运行程序,甚至使用网络浏览器。
- 它必须一步一步地独立完成所有工作。
- 关键细节:某些任务需要GPU(一种用于繁重数学运算和 AI 训练的强大显卡)。这就像要求机器人举起重物;而大多数以前的测试只要求它举起一根羽毛。
4. 评分方式:“多层级裁判”
你不能只问“它完成了吗?”,因为答案可能是“是的,但代码是坏的”。
该论文使用6 合 1 评分系统:
- 模式匹配:它是否写出了正确的词语?
- 代码执行:程序是否真的在不崩溃的情况下运行?
- AI 裁判:另一个 AI 阅读报告并像老师一样给它打分。
- 视觉 AI:它能否“看到”图表或图像看起来是否正确?
- 浏览器测试:它是否真的构建了一个可正常工作的网站?
- 结构检查:文件格式是否正确(如 JSON 或 CSV)?
他们还有一个安全审计(像保安一样),以确保 AI 没有试图删除重要文件或入侵它不该进入的地方。
5. 结果:“现实检验”
作者在这个新考试上测试了六个最聪明的可用 AI 模型(如 Claude、GPT 和 Gemini)。
- 得分:即使是最好的 AI 也只通过了**55%**的任务。这意味着在面对大学生认为困难的问题时,它们有近一半的时间失败了。
- “过度思考”陷阱:论文发现了一些奇怪的现象。有些 AI 使用的**“脑力”(token)是其他 AI 的 5 倍**,但并没有获得更好的结果。
- 类比:想象两个学生参加考试。学生 A 仔细阅读问题,思考一分钟,然后写出完美的答案。学生 B 惊慌失措,写了 10 页漫无边际的胡言乱语,结果答错了。论文发现,更多的努力并不等于更好的质量。
- 不同的“性格”:AI 们有不同的“性格”:
- 阅读者(Claude):先阅读所有内容,思考,然后行动。质量高,但较慢。
- 重锤(Gemini):直接开始敲击(运行代码),希望它能工作。速度快,但经常弄坏东西并未能通过安全检查。
- 极简主义者(GPT):只做最低限度的工作,但获得了令人惊讶的好结果。
6. 主要结论
该论文得出结论,虽然 AI 在充当“数字秘书”方面表现出色,但当被要求充当“研究人员”或“工程师”时,它仍然非常不稳定。
- 差距:AI 目前能做到的与现实的学术和专业工作所需之间存在巨大脱节。
- 安全问题:试图通过“猜测和检查”来解决问题的 AI(Gemini)也是最有可能违反安全规则的那一个。
- 未来:作者希望这项新测试(AcademiClaw)能帮助开发者构建真正有能力解决我们在现实世界中面临的艰难、复杂问题的 AI,而不仅仅是那些简单的问题。
简而言之:该论文利用真实的学生作业为 AI 构建了一个“困难模式”测试。结果表明,即使是最聪明的 AI 仍在努力应对现实世界中深度、复杂的工作,而且使用更多的计算能力并不一定能让它们变得更聪明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。