← 最新论文
📊 statistics

Benchmarking AI Performance on End-to-End Data Science Projects

该研究通过构建包含 40 个端到端数据科学项目的基准测试及自动化评分流程,发现生成式 AI 模型虽能胜任结构化任务,但在涉及判断力的任务上表现差异显著,表明其目前仅能作为需人工验证的初级数据科学家辅助工具。

原作者: Evelyn Hughes, Rohan Alexander

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Evelyn Hughes, Rohan Alexander

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一次**“AI 厨师大比拼”,但这次比的不是谁做的菜最好吃,而是看谁能独立开一家完整的餐厅**。

想象一下,数据科学(Data Science)不仅仅是写几行代码(就像切菜),它更像是一个完整的流程:从决定今天卖什么菜(提出问题),去菜市场买菜(收集数据),洗菜切菜(清洗数据),炒菜摆盘(分析和可视化),最后还要写一份诱人的菜单和宣传册(写报告)。

过去,我们测试 AI 时,通常只让它做其中一小步,比如“切菜”或者“写个菜谱”。但这篇论文的作者们想看看:现在的 AI 能不能像人类实习生一样,从头到尾独立完成整个餐厅的运营?

以下是这篇论文的“大白话”解读:

1. 比赛规则:40 道“满汉全席”

作者们收集了 40 个由多伦多大学本科生完成的真实项目作为“考题”。

  • 考题内容:学生需要从多伦多公开数据中挑一个主题,写代码处理数据,画图表,最后写一份像模像样的学术报告。
  • 评分标准:有两位人类“美食评委”拿着详细的评分表(Rubric),从 17 个方面给这些项目打分,满分 45 分。
    • 及格线:80 分(相当于本科生里的优等生水平)。
    • 评分项:包括代码能不能复现、报告写得通不通顺、图表好不好看、引用对不对等等。

2. 裁判:AI 判官

因为要测试 7 种不同的 AI 模型,每种模型还要做 5 个项目,总共 35 份作业,人类评委累死也评不过来。

  • 于是,作者们训练了一个**"AI 裁判”**(用 LLM 充当法官)。
  • 这个裁判非常严格,它会像人类一样,根据评分表给每一份作业打分。为了确保公平,他们还用人类评委的成绩校准了这个 AI 裁判,确保它不会“偏心”。

3. 比赛结果:有人是“天才”,有人是“新手”

比赛结果出来了,7 种 AI 模型的表现天差地别

  • 🏆 冠军(Claude Opus 4.6):得了 85 分
    • 它已经能媲美优秀的大学高年级学生了!它能独立完成大部分工作,代码写得不错,报告也写得像模像样。
  • 🥈 亚军(GPT-5.2 和 Gemini 3 Flash):分别得了 82 分78 分
    • 表现也很棒,基本达到了“准专业人士”的水平。
  • 🥉 中游选手(Grok-4, Gemini 3 Pro, Llama 4):分数在 51 分 到 70 分 之间。
    • 它们能干活,但经常出错,或者写得不够深入。
  • 📉 垫底选手(GPT-4o,旧款):只得了 32 分
    • 这就像是一个刚入行的实习生,连基本的流程都跑不通,很多地方直接交了白卷。

4. 发现:AI 擅长“填空”,不擅长“思考”

这是论文最有趣的地方。作者发现 AI 的表现有明显的“偏科”:

  • ✅ 擅长的事(像机器人)
    • 按模板填空:比如起个标题、写个作者名、生成测试代码。只要规则明确,AI 做得完美无缺。
    • 执行指令:如果告诉它“不要用什么词”,它就能做到。
  • ❌ 不擅长的事(像缺乏常识的人)
    • 需要“判断力”的地方:比如解释“为什么选这个数据”、“这个数据在现实中代表什么”(这叫“测量”)。AI 经常在这里卡壳,因为它不懂数据背后的真实世界逻辑。
    • 写摘要和讨论:AI 写的摘要虽然语法正确,但读起来像“正确的废话”,缺乏真正的洞察力和深度。
    • 引用文献:AI 经常编造假的参考文献,或者格式乱套,就像学生为了凑字数瞎编书目。

5. 结论:AI 是“超级实习生”,但不是“老板”

这篇论文告诉我们:

  • 好消息:最新的 AI 模型(如 Claude Opus 4.6)已经非常强大,它们可以像优秀的大学毕业生一样,处理日常的数据分析工作。如果你给它们一个明确的任务,它们能很快产出 80 分水平的成果。
  • 坏消息:它们不能完全替代人类。
    • 它们缺乏真正的“判断力”。如果你让 AI 去决定“这个数据能不能用”,它可能会自信地胡说八道。
    • 它们容易在细节上“翻车”(比如引用错误、逻辑不通)。
    • 人类的作用:人类现在不再是“写代码的工人”,而应该变成**“主编”或“质检员”**。你需要检查 AI 的工作,确保它的逻辑是对的,引用是真的,结论是靠谱的。

一句话总结
现在的 AI 就像是一个记忆力超群、手速极快,但缺乏生活经验的“超级实习生”。它能帮你把 80% 的脏活累活干得漂漂亮亮,但剩下的 20% 需要人类老板(你)来把关,确保方向没错,逻辑通顺。如果你完全不管它,直接让它“放手干”,它可能会给你端上来一盘看起来像样、但吃起来有问题的菜。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →