Building Social World Models with Large Language Models
本文介绍了社会世界模型(Social World Model, SWM),这是一个利用大语言模型在无需显式标注的情况下预测社会信念随事件演化的框架,并在一个源自 Kalshi 和 Polymarket 等真实世界预测市场的新基准测试上展示了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图预测一群人会对一条突发新闻做出怎样的反应。他们会变得兴奋、恐惧,还是漠不关心?通常情况下,这极难预测,因为人类的信念是混乱、感性的,其变化的原因往往并不直观。
这篇论文介绍了一种名为社会世界模型(Social World Model, SWM)的新工具。你可以把它想象成一个由人工智能(具体来说是大型语言模型,即 LLM)驱动的“公众舆论水晶球”。
以下是论文通过简单的类比对该工具进行的解释:
1. 问题所在:“黑箱”中的公众舆论
作者认为,追踪社会思维方式就像是在没有温度计的情况下预测天气。
- 数据鸿沟: 通常,我们无法获得关于人们信仰什么的清晰数字。调查问卷反应迟缓,而社交媒体则充斥着噪音(机器人、喷子和信息茧房)。
- 谜团: 即使我们看到了信念的变化(例如,“人们突然认为某种新的加密货币会涨”),我们也往往不知道是哪一个具体的的新闻故事导致了这种变化。是政客的演讲?科学发现?还是仅仅是一个谣言?
- 挑战: 传统的计算机模型擅长数学(比如根据过去的数据预测股价),但不擅长理解数字背后的“故事”。它们无法“阅读”新闻并理解一条特定的标题是如何改变一个人的想法的。
2. 解决方案:“社会世界模型”
作者构建了一个将公众信念视为可以被推动或拉动的物理对象的系统。
- “状态”(信念): 想象一个测量人们对某事相信程度的温度计(例如,“特朗普会赢得选举吗?”)。温度计上的数字就是“状态”。
- “事件”(推力): 一条新闻故事就像一只手在推那个温度计。
- 目标: 该模型试图学习这条规则:如果我们拥有当前的信念(状态 A)并且发生了这个特定的新闻故事(事件),那么明天的信念会是什么(状态 B)?
3. 他们如何训练 AI(“后见之明”技巧)
这是论文中最巧妙的部分。通常,要教导一台计算机,你需要一位老师来告诉你:“这条新闻导致了那个信念的变化。”但作者并没有为每一个事件都配备人类老师。
相反,他们使用了一种**“后见之明”(Hindsight)策略**:
- 设置: 他们使用了来自预测市场(如 Polymarket 和 Kalshi)的数据。这些是人们在上面对结果进行真金白银投注的地方。赌注的价格是衡量人群信念的完美、实时的指标。
- 老师(“后验”): 他们使用了一个超级聪明的 AI(一个冻结的 LLM)在事件发生之后去观察过去。这个 AI 扮演着侦探的角色,它观察信念的变化,并追问:“昨天哪条新闻最能解释这种变化?”
- 学生(“世界模型”): 主模型(“学生”)试图预测未来。它的训练目标是去猜测那位“侦探 AI”会说什么。
- 类比: 想象一个正在考试的学生。他现在还不知道答案。但在考试结束后,一位天才导师告诉他:“你之所以答对这个问题,是因为你记住了这个特定的事实。”随后,学生学会了将该事实与答案联系起来,以便下次能够独立进行预测。
4. 他们的发现
团队使用数千个真实的投注市场测试了他们的模型。
- 超越专家: 他们的模型(SWM)在预测信念变化的方向(上升或下降)方面,表现优于标准的序列时间模型(这类模型仅观察过去的数据),甚至优于目前一些最先进的 AI 模型(如 GPT-5.5)。
- “为什么”很重要: 当模型能够清晰地将新闻故事与信念转变联系起来时,效果最好。
- 成功案例: 当发生一个明确的事件(如和平协议的宣布)时,模型正确预测了信念会上升。
- 失败案例: 当市场因复杂的、隐藏的原因(如算法交易或模糊的传闻)而波动时,模型会感到吃力,因为它无法在新闻中找到清晰的“因果关系”。
5. 两种运行模式
论文描述了使用该工具的两种方式:
- 预报(气象员模式): 模型观察今天所有的新闻,猜出哪一条最重要,并预测明天人群会持有怎样的信念。
- 模拟(“如果……会怎样”机器): 你可以询问模型:“如果这条特定的假新闻是真的,公众舆论会发生什么变化?”模型可以在新闻实际存在之前,模拟其反应。
总结
论文声称,通过将真金白银的投注数据(一种非常诚实的信念衡量标准)与能够阅读并理解新闻的 AI 相结合,他们创建了一个可以预测社会思想如何变化的系统。它不仅仅是在猜测数字;它学习了特定故事如何拨动公众舆论之针的“规则”。
重要提示: 论文明确指出,这是一个用于理解和预测集体信念的工具。它警告说,虽然对于政策制定者预判反应非常有用,但如果被恶意利用,也可能被用来操纵舆论。作者并未声称它能 100% 准确地预测未来,也没有声称它解决了所有的社会科学问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。