Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps
本文引入了一项严格基准,用于利用包含认知陷阱的中小企业专家撰写的提示词评估深度研究代理在专家咨询任务上的表现,揭示出当前前沿模型(Claude、o3 和 Gemini)因幻觉、算术错误和推理不一致等截然不同的失败模式而普遍接受率低下。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一支超级聪明的研究助理团队来完成一项复杂的工作:他们需要阅读一堆杂乱无章的文件,找出特定的数字,进行一些数学计算,并为首席执行官撰写一份专业报告。如果他们哪怕弄错了一个数字,首席执行官就可能犯下价值十亿美元的错误。
这篇论文就像是对当今三种最先进的 AI 研究助理(Claude、o3 和 Gemini)进行的一场严格的求职面试。作者来自德干人工智能研究所(Deccan AI Research),他们想看看这些 AI 是否真的能够完成人类管理顾问所从事的那种细致入微、高风险的工作,还是说它们仅仅擅长回答简单的常识性问题。
以下是他们实验的分解,使用了简单的类比:
1. 测试:一个“布满陷阱”的障碍赛
大多数针对 AI 的过往测试就像问:“法国的首都是哪里?”(事实回忆)。这次测试则不同。作者基于真实的咨询工作,创建了42 个复杂场景。
可以将这些场景视为一个旨在迷惑 AI 的生存课程。提供给 AI 的文件中包含“认知陷阱”,例如:
- “红鲱鱼”陷阱:一份长达 100 页的文件,但答案却隐藏在第 98 页的一个微小脚注中。
- “矛盾”陷阱:一份文件说价格是 50 美元,但脚注却写着:“除非是星期二,否则价格为 60 美元。”
- “数学陷阱”:要求计算平均值,但正确的方法需要加权平均(就像根据你的每项考试所占权重来计算你的总评成绩)。
如果 AI 只是浅尝辄止或胡乱猜测,它就会失败。
2. 评判者:两层评分体系
这篇论文并没有让 AI 来给 AI 打分。他们采用了一个双层评分系统:
- 第一层:机器人检查员(验证器):这些是严格的自动化检查。AI 是否生成了文件?是否使用了正确的数字?是否引用了正确的来源?如果 AI 在任何一个数学步骤上出错,这一层就会将其标记为失败。
- 第二层:人类专家(领域专家 SME):一位拥有 15 年以上经验的人类顾问阅读了 AI 的报告。他们从五个方面进行评分:
- 数据完整性:你是否编造了事实?
- 分析严谨性:你的逻辑是否严密?
- 相关性:你是否回答了问题,还是只是在胡言乱语?
- 执行力:你的数学计算是否正确?
- 格式:报告是否专业且可用?
最终得分结合了这两层。要通过测试,AI 必须同时通过机器人检查员并给人类专家留下深刻印象。
3. 结果:“通过率”低得惊人
在总共 126 次尝试中(42 个任务 × 3 个 AI),几乎没有人通过。
- Gemini 的通过率约为 21%。
- Claude 和 o3 的通过率仅为 9.5%。
换句话说,如果你雇佣其中任何一个 AI 来执行价值百万美元的咨询项目,它们有 79% 到 90% 的几率无法交付一份可用且准确的报告。
4. 每个 AI 是如何失败的(失败的“个性”)
论文发现,每个 AI 都以自己独特的方式失败,就像三个不同的学生参加一场艰难的考试:
Claude(自信的伪造者):
- 优势:它在实际创建最终文件(如 Word 文档或 Excel 表格)方面表现最好。它很少忘记提交作业。
- 劣势:它最有可能撒谎。当它在文件中找不到答案时,它会自信地编造一个数字或来源来填补空白。这就像一个学生写了一篇优美的文章,但所有事实都是编造的。
o3(谨慎但笨拙的数学家):
- 优势:当它进行推理时,其逻辑往往最清晰。
- 劣势:它经常遗漏报告所需的章节,或者出现连锁数学错误。如果它在第一步出错,后续的数学计算就会全部错误。它有时还会忽略创建文件的指令,而只给出文本答案。
Gemini(过山车):
- 优势:当它表现正常时,往往是最出色的。它获得的“完美”分数数量最多。
- 劣势:它不可靠。它获得的“零分”数量最多。有时它会崩溃、拒绝回答,或者生成一个包含损坏代码的文件。这就像一个学生要么考满分,要么考得如此糟糕以至于根本没来参加考试。
5. 核心启示
论文得出结论,虽然这些 AI 代理令人印象深刻,但它们尚未准备好承担高风险的、决策级别的工作。
如果人类顾问犯错,通常只是小失误。但如果这些 AI 犯错,往往会导致灾难性的失败:它们可能会编造虚假来源、导致软件崩溃,或者遗漏一个改变整个商业决策的关键脚注。
作者目前正在准备该测试的第二个、更大规模的版本,但目前信息明确:暂时不要将这些 AI 用于你公司价值十亿美元的决策。 它们仍在学习如何成为可靠的研究人员。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。