← 最新论文
💬 NLP

BenCSSmark: Making the Social Sciences Count in LLM Research

本立场论文认为,当前大语言模型基准测试中社会科学任务的代表性不足,既阻碍了人工智能的进步,也制约了社会科学探究,为此提出引入“BenCSSmark"——一个由计算社会科学家标注数据集构成的新基准——以构建更加稳健、透明且与社会需求相关的智能系统。

原作者: Arnault Chatelain, Étienne Ollion, Qianwen Guan, Diandra Fabre, Lorraine Goeuriot, Emile Chapuis, Abdelkrim Beloued, Marie Candito, Nicolas Hervé, Didier Schwab

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnault Chatelain, Étienne Ollion, Qianwen Guan, Diandra Fabre, Lorraine Goeuriot, Emile Chapuis, Abdelkrim Beloued, Marie Candito, Nicolas Hervé, Didier Schwab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将人工智能(AI)的世界想象成一个规模宏大、 stakes 极高的体育联盟。在这个联盟中,大语言模型(LLMs)是运动员,而基准测试(benchmarks)则是用于评判谁最出色的标准化考试和记分牌。

目前,这个联盟痴迷于一套非常特定的赛事:数学问题、编程挑战和语言翻译。运动员们为这些特定训练项目进行无休止的练习,因为只有这样他们才能登上排行榜并成名。

问题:缺失的“社会科学”赛事
本文作者认为,该联盟缺失了一个巨大且重要的赛事类别:社会科学

将社会科学(如社会学、历史学、政治学和经济学的研究)视为对人类如何实际生活、争论和相互理解的探索。这些领域充满了混乱、复杂且微妙的数据。

  • 问题所在:尽管社会科学家已经创建了数千个高质量、由专家标注的数据集(就像教练准备详细的战术手册一样),但这些数据集对 AI 联盟而言却是隐形的。它们散落在不同的图书馆中,缺乏标准化,且很少被用于测试 AI。
  • 后果:由于 AI 模型未在这些“社会”任务上接受测试,它们在这些任务上表现极差。它们可能擅长解决数学方程,却在理解“批判性”政治评论与“仇恨性”评论之间的区别,或在新闻文章中识别微妙的文化偏见时彻底失败。

解决方案:BenCSSmark
为了解决这一问题,作者创建了 BenCSSmark。你可以将其视为专门为“社会科学”赛事设计的全新、专门的训练场和竞技场。

以下是 BenCSSmark 的独特之处,通过简单的类比来说明:

  1. 它是 AI 的“压力测试”
    标准测试问的是:“你能解决这个问题吗?”BenCSSmark 问的是:“你能理解语境吗?”

    • 类比:标准测试可能会问:“这个句子语法正确吗?”BenCSSmark 则问:“这个句子是否存在政治偏见,说话者是谁、在何时说,这些是否重要?”它迫使 AI 应对模糊性、文化差异和相互冲突的观点——这些对人类来说很容易,但对机器人来说却很难。
  2. 它尊重人类观点的“混乱性”
    在许多 AI 测试中,只有一个“正确”答案(金标准)。但在社会科学中,人们往往意见不一。

    • 类比:想象一个评委小组。在标准测试中,他们必须就一个分数达成一致。而在 BenCSSmark 中,系统会记录每位评委的评分。如果一位专家认为某条推文是“批判性”的,而另一位认为是“仇恨性”的,系统会保留这两种观点。这教会了 AI:人类语言往往是主观的,并不总是存在唯一的“真理”。
  3. 它是连接两个世界的桥梁
    该项目将计算机科学家(AI 构建者)与社会科学家(人类专家)聚集在一起。

    • 类比:这就像邀请“人类行为”队的教练进入“机器人训练”设施。计算机科学家得以接触他们此前不知存在的丰富现实世界数据,而社会科学家则获得了真正理解其特定研究问题的 AI 工具。

盒子里有什么?
本文介绍了一组包含 27 个不同“任务”(数据集)的合集,目前均为法语。这些不仅仅是通用文本,而是针对具体研究问题的,例如:

  • 检测政治家是否在做出“改革承诺”。
  • 判断一篇音乐评论是“规定性”的(告诉你该想什么)还是仅仅具有描述性。
  • 在报纸中识别“未注明出处的引语”。
  • 在学术摘要中识别“性别”或“社会阶层”概念。

警告(“不要做”的事项)
作者谨慎地警告,如果我们不够小心,基准测试可能会带来危险。

  • 陷阱:如果我们使基准测试过于僵化,AI 模型可能会通过死记硬背测试答案来“作弊”,而不是真正学习理解人类。
  • 对策:作者建议我们需要保持测试的多样性并不断更新,这样 AI 就无法仅仅死记硬背战术手册。他们也承认,目前数据主要是法语且基于文本,因此这只是一个更大项目的“第一步”。

核心结论
本文主张,为了构建真正智能的 AI,我们必须停止忽视社会科学。通过将这些复杂、以人为核心的任务整合到 AI 的标准测试中,我们可以构建出不仅擅长数学和代码,而且具备稳健性、公平性,并能理解人类社会混乱而美丽的复杂性的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →