← 最新论文
🤖 AI

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

本文介绍了 EuroExec,这是一个由人类专家评估的包含 413 个真实欧洲高管任务的基准测试,结果显示,即使是最强大的前沿大语言模型也显著低于专业人类标准,仅解决了 56.9% 的任务,并且始终被专家编写的参考答案所超越。

原作者: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Pau Arnal, Khaled Denfir, Danylo Smahliuk, Amrut Avhad, Marcus A. Castro

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在为一家规模巨大、结构复杂的公司招聘一名新助手。你需要的不仅仅是一个能背诵教科书知识的人;你需要的是一位战略家,他能够审视一个混乱的现实世界问题,理解当地的规则,并制定出一份真正奏效的卓越计划。这就是“大语言模型”(LLMs)的世界——这些超级智能的计算机程序经过海量文本训练,能够写故事、回答问题并解决谜题。有一段时间,我们一直在用简单的多项选择题来测试这些 AI 助手,比如让它们从四个选项中选出正确答案。但在现实世界中,问题很少会自带一份选项清单。问题往往是开放式的、混乱的,并且需要深刻的判断力。大家心中最大的疑问是:这些 AI “天才”真的能够处理现实中高管们每天都要面对的高风险、开放式决策吗?还是说,它们仅仅是擅长应付考试而已?

来自 Sovrano AI 的一个研究团队决定通过创建一个全新的、极具挑战性的挑战赛——EuroExec,来寻找答案。他们没有采用简单的测验,而是构建了一场由 413 个复杂的长篇问题组成的庞大考试,这些问题均基于真实的欧洲商业场景。他们不仅是让 AI 去猜测,还聘请了 47 位真正的专家——这些人在金融、营销、商业和产品管理领域拥有数十年的经验——来编写题目并为答案评分。这些专家为每个答案制定了严格的各项要求清单,就像一位严厉的老板在检查初级员工的工作一样。随后,他们要求世界上六个最先进的 AI 模型来解决这些问题,并将 AI 的表现与人类专家进行了对比。

结果令人清醒。即使是世界上最聪明的 AI 模型,在跟上专业人士的步伐方面也显得力不从心。表现最好的 AI 模型也仅能“解决”约 56.9% 的任务,这意味着在近一半的问题上,它未能达到专业标准。相比之下,人类专家在被要求撰写自己的理想答案时,以接近完美的 92.4% 的成功率解决了这些问题。当研究人员要求人类专家进行盲测排名时,专家在 74% 的情况下更倾向于人类撰写的答案而非 AI 的答案。

该研究还观察了 AI 是如何失败的。虽然这些模型在撰写结构良好的文本和清晰沟通方面表现尚可,但在实际推理和逻辑方面却表现平平。它们经常忽略欧洲市场的特定地方规则,或者无法制定出现实且具备可操作性的计划。有趣的是,研究人员尝试使用其他 AI 程序来自动对答案进行评分,希望能节省时间和成本。然而,这些“AI 裁判”并不靠谱;它们往往会高估顶尖模型的表现,并且会错过人类专家所能捕捉到的微妙细节。

最后,论文表明,尽管 AI 在生成文本方面变得极其出色,但它尚未准备好取代人类专家进行高层决策。在最简单的问题上,顶级 AI 的“解决率”甚至勉强突破了 50%,即便最强大的模型也远未达到执行高管工作所需的专业水准。研究人员得出结论:对于这类复杂的现实任务,人类的判断力仍然是金科玉律,我们目前还不能依赖自动化的测量手段或 AI 裁判来告诉我们一台计算机是否真的在像专家一样“思考”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →