← 最新论文
💬 NLP

SocietyBench: Forecasting Counterfactual Social-World Evolution

本文介绍了 SocietyBench,这是一个通过将真实世界事件时间线匿名化为结构化预测任务,来评估大语言模型预测反事实社会世界演变能力的创新基准测试,研究揭示了即使是前沿模型在不同事件中的概率校准和时间准确性方面也存在困难。

原作者: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何理解这个世界。长期以来,科学家们通过给这些机器人布置家务来测试它们:“修复这段损坏的代码”、“浏览这个网站”或“解决这个数学问题”。这就像是一场驾驶考试,机器人只需要保持在车道内并到达目的地即可。但人类存在的一个巨大维度是这些测试所遗漏的:现实生活中那些混乱、不可预测的戏剧性冲突。机器人如何应对突发的丑闻、变化的政治传闻或市场崩盘?它能否通过观察今天的报纸,来猜测明天的头条新闻会是什么?这就是“社会预测”(social forecasting)的领域。这不仅仅是遵循地图,而是要预测人类行为的天气——在那里,风向会随着流言蜚语、愤怒和惊奇而改变。

于是有了 SocietyBench,一个全新的“期末考试”,旨在测试人工智能是否真的能够预测现实世界社会事件的未来,而不仅仅是背诵它从训练数据中记忆的事实。这项研究背后的研究人员意识到,如果你问一个 AI 关于已经发生的著名事件,它可能只是在“依赖记忆数据”,即从它庞大的过去互联网文本库中检索答案。为了阻止这种情况,他们设计了一个巧妙的技巧:他们提取真实的报纸新闻,将所有的名字进行替换(比如把“埃隆·马斯克”变成“人物 X”,把“特斯拉”变成“公司 Y”),并改变日期。这把一个真实的故事变成了一个“反事实”(counterfactual)世界——一个看起来和感觉起来都与现实世界完全一致,但 AI 从未见过其剧本的平行宇宙。AI 必须运用它的“大脑”去推导故事如何展开,而不是依靠记忆。

实验结果给 AI 界带来了一次现实的警示。研究人员在五种不同类型的事件(从金融市场崩盘到地缘政治冲突)上,测试了目前最先进的六个 AI 模型。即使是得分最高的那个最聪明的模型,也只拿到了 75.0 分(满分 100)。这听起来可能不错,但请记住,“平凡锚点”(trivial anchor,即如果你只是随机猜测或对所有事情都说“50% 的可能性”所能得到的得分)是 50。所以,最优秀的 AI 也仅仅处于随机猜测与完美预测的中点位置。

关键在于:这些 AI 模型在一致性方面表现得很糟糕。有些模型擅长猜测某事发生的“概率”(比如说“有 70% 的概率下雨”),但在猜测“何时”发生时却表现很差。另一些则恰恰相反。这就像是一个天气预报员,总是能准确预报是否会下雨,但在预报是周二还是周五下雨时却总是出错。研究发现,针对单一事件,表现最好和最差的模型之间的差距可能高达 21.4 分。这证明了你不能只用一个故事来测试 AI 就了事;你必须在许多不同的故事上进行测试,才能得到真实的图景。

或许最令人惊讶的发现是关于“AI 智能体”(AI Agents)的。这些是更高级的设置,其中多个 AI 机器人互相交谈、辩论或共同规划,希望能得到更聪明的答案。研究人员尝试了三种让这些团队协作的方法,但没有一种能提高结果。事实上,这些机器人团队的表现往往比它们所基于的单个、孤独的 AI 机器人还要差。事实证明,对于预测社会混乱而言,在房间里增加更多的声音并不会让对话变得更聪明;它只会让对话变得更加嘈杂。

最后,SocietyBench 向我们展示了,虽然我们的 AI 模型在遵循指令和修复漏洞方面变得非常出色,但它们在理解人类社会复杂且变幻莫测的动态方面仍然步履维艰。它们不能仅仅通过记忆未来,它们必须真正通过逻辑推理来理解未来。而目前,即使是最优秀的 AI,距离成为真正的预言家还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →