技术摘要:EuroExec —— 前沿语言模型在欧洲高管决策任务上的表现不及专家判断
1. 问题陈述
生成式人工智能的评估传统上依赖于具有确定性指标的闭口式任务(例如,多项选择题、代码执行或带有金标准参考的翻译)。然而,这些基准测试无法捕捉现实世界应用中的本质,即大语言模型(LLMs)正日益投入使用的开放式、长文本生成任务,例如高管决策。在这些场景中,不存在单一的“正确”答案,而是存在一种人类专家能够识别出的专业标准。
目前的评估方法面临两个主要挑战:
- 数据污染: 模型可能已经在带有确定答案的公开基准测试上进行了训练,通过复读而非真正的推理来虚增性能指标。
- 评估保真度: 自动指标(如 BLEU、ROUGE)和 AI 评委(用 LLM 评估 LLM)往往无法复制人类专家的细微差别、主观性和一致性,尤其是在复杂的领域特定任务中。
本文通过引入 EuroExec 来解决这一差距,该基准旨在评估前沿 LLM 在开放式欧洲高管决策任务上的表现,并严格比较了人类专家评估与自动指标。
2. 方法论
2.1 EuroExec 基准
作者构建了一个包含 413 个开放式、长文本问题 的数据集,这些问题由 47 位具有欧洲认证专业经验的资深领域专家 编写。问题分为四个领域:
- 金融(74 个问题)
- 营销(85 个问题)
- 商业(113 个问题)
- 产品(141 个问题)
问题构建:
每个条目都是一个自包含、目标导向的情景(约 200 字),描述了一个真实的业务状况,并带有特定的摩擦点(例如,监管约束、劳动力成本、市场碎片化)。至关重要的是,每个问题都配有一个 清单(checklist),包含 5-10 项具体的标准(即地面真值),高质量的回答必须满足这些标准。
验证流程:
为了确保问题能够挑战当前的模型,且不会被自动化系统轻易解决,研究采用了两阶段验证流程:
- 自动化 QA: 使用一个 LLM(Claude Sonnet 4.6)根据提示泄露、清单相关性和安全性等标准剔除不合格条目。
- 难度门槛: 使用两个不同的 LLM(Claude Haiku 4.5 作为求解器,Gemini Flash 3.5 作为评分器)尝试根据清单解决问题。问题经过迭代重写,直到自动完成率降至 60% 以下,从而确保任务需要真正的推理而非模式匹配。
2.2 模型选择与响应生成
通过其提供商 API 对六个前沿 LLM 进行了评估,使用默认的解码设置,不添加额外的上下文或工具:
- Fable 5 (Anthropic)
- Claude Opus 4.8 (Anthropic)
- GPT-5.5 (OpenAI)
- Gemini 3.1 Pro (Google)
- GLM-5.2 (Zhipu AI)
- Mistral Large (Mistral AI)
2.3 人类评估协议
本研究的核心是一项大规模的人类评估工作,涉及 超过 4,000 小时的专家工时。每个问题的响应由两名独立的领域特定专家进行评估,使用三种工具:
- 评分量表(Rubric Score): 针对五个属性采用 5 点李克特量表:领域(事实准确性)、本土化(欧洲市场背景)、推理(逻辑)、沟通(面向高管的结构)和可操作性(具体计划)。
- 清单达成度(Checklist Fulfillment): 对响应是否满足问题清单中定义的特定标准进行二元或部分评估。
- 偏好排序(Preference Ranking): 对给定的六个模型响应进行显式排序。
综合指标: 作者引入了 “解决率”(Solve Rate, SR)。如果一个响应实现了平均评分 ≥ 3.0 且清单达成率 ≥ 60%,则被视为“解决”。
2.4 对比分析
研究还评估了:
- 人类基准: 对于 33 个问题的子集,专家编写了理想答案,并将其作为第七个“模型”进行盲测评估。
- 自动指标: 计算了相对于专家编写答案的 ROUGE-Lsum 和 BLEU 分数。
- AI 评委: 使用一个独立的 LLM(DeepSeek v4-Pro)使用相同的三种工具对完整数据集进行评估,以测试“LLM 作为评委”的可靠性。
3. 关键结果
3.1 性能差距
结果表明,前沿模型与人类专家之间存在显著的性能差距:
- 人类专家: 实现了 92.4% 的解决率 和 94.9% 的清单达成率。
- 最佳前沿模型 (Fable 5): 仅实现了 56.9% 的解决率 和 61.9% 的清单达成率。
- 偏好排序: 在盲测偏好排序中,人类编写的答案在 74.24% 的案例中优于所有模型的响应。
即使是最强的模型在最简单的子集问题上也仅勉强超过 50% 的解决率,这表明它们距离高管决策所需的专业标准还很遥远。
3.2 维度分析
- 推理 vs. 沟通: 模型在 沟通 和 本土化(文本结构和当地习俗)方面表现较好,但在 推理 方面的表现最弱。
- 领域相关性: 性能在各领域之间高度相关,唯独在金融领域,GPT-5.5 相对于其在其他领域的表现有所下滑,这表明其在数值推理方面存在局限。
- 统计显著性: 成对 t 检验确认,仅需 100 个样本即可实现模型的排名具有统计学意义(p<0.01),而在完整的 413 个项目中,其显著性极高(p≈1.26×10−6)。
3.3 评估一致性
- 人类一致性: 评分者间的一致性很高,尤其是在清单条目方面。虽然主观指标(评分量表、偏好)彼此之间相关性良好,但清单提供了一个更客观且在不同评估者之间保持一致的信号。
- AI 评委 vs. 人类: 虽然 AI 评委(DeepSeek v4-Pro)与人类排名显示出强相关性,但它未能复制人类评估的 多样性 和 细微差别。AI 评委倾向于高估顶尖模型并低估较弱的模型,其生成的评估结果过于“干脆”,缺乏人类意见的异质性。
- 自动指标: 传统的指标(BLEU、ROUGE)与人类评分量表的相关性较弱,且无法准确预测模型排名。
4. 核心贡献
- EuroExec 基准: 一个全新的、由人类编写的包含 413 个复杂、开放式欧洲高管任务的基准,旨在测试专业判断力而非知识检索。
- 严谨的人类评估: 一项利用超过 4,000 小时专家工时的大规模研究,从多个维度评估模型,为开放式生成建立了新标准。
- 局限性的实证证据: 定量证明了即使是最强大的前沿 LLM 在高管决策方面的表现也难以达到专业标准,其解决的任务比例不足 60%,而人类则超过 90%。
- 评估方法论批判: 论证了在具有主观地面真值的任务中,自动指标和 AI 评委无法替代人类评估,因为它们无法捕捉到专家判断中必要的细微差别和多样性。
5. 意义与主张
本文主张,对于开放式、专业级任务,人类评估仍然是目前自动方法无法企及的。作者认为,该领域必须超越容易受到数据污染影响的闭口式基准测试,依靠严谨的、以人为中心的评估,来真正评估生成式模型在现实场景中的能力。
研究结论指出,尽管前沿模型正在进步,但它们尚未准备好取代高风险决策领域的人类专家。此外,依赖 AI 评委或确定性指标来评估此类任务会导致对模型能力的误导性结论。作者强调,源自人类判断的“解决率”指标,为该领域的进展提供了一个更诚实、更可靠的衡量标准。
承认的局限性:
- 研究属于资源密集型,限制了理想答案(专家编写)的数量(仅 33 个,而非 413 个)。
- 由于人类评估所需的成本和协调难度,复现性具有挑战性。
- 分析侧重于自包含的事实性情景,尚未涉及涉及低质量或不确定数据(如医疗保健)的任务。
- 仅测试了一个 LLM 作为 AI 评委,尽管作者认为其发现具有该类 AI 评委的代表性。