Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble
本文介绍了“提示词转代理”(),这是一个具有成本效益的两阶段框架,它通过构建多样化的大语言模型(LLM)智能体池,并利用 L1 正则化回归进行聚合,以匹配目标人群数据,从而在无需微调或敏感人口统计信息的情况下,在社会科学研究中模拟人类偏好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想了解整个国家对某个特定话题的看法,比如“我们是否应该建设更多的公园?”或者“你对科学家的信任程度有多少?”通常情况下,你必须给成千上万个真实的人打电话,这既昂贵、缓慢,而且如果你需要快速测试一个新想法,有时甚至是不可能的。
这篇论文介绍了一种巧妙的方法,利用人工智能(AI)来充当这些真实的人。他们将这种方法称为提示词转代理(Prompts to Proxies,简称 P2P)。
以下是该方法的简单拆解,使用了日常类比:
问题所在:“平均化”的 AI 很乏味
如果你只是问一个标准的 AI 聊天机器人:“美国人对公园怎么看?”,它会给你一个非常保守、中庸的答案。这就像是让一个人代表整个人群发言;他们通常只会给出“平均”意见。但真实的群众是复杂的!有些人热爱公园,有些人讨厌公园,有些人并不在意,还有些人认为公园太贵了。单个 AI 聊天机器人往往会抹平这种多样性,使其成为一个糟糕的替代品。
解决方案:“品酒小组”法
作者并没有试图让一个 AI 变得完美,而是构建了一个系统,通过创建一群多样的 AI 角色并将其答案混合在一起。
把它想象成一个品酒小组。
- 目标: 你想要重现某种特定年份葡萄酒的精确风味特征(即真实人类人口的观点)。
- 错误做法: 试图寻找一颗能完全代表整瓶酒味道的葡萄。(这是其他方法尝试的做法,且通常会失败)。
- P2P 方法: 你收集大量不同种类的葡萄(不同的 AI 角色)。有些甜,有些酸,有些果香,有些带有泥土气息。然后,你按特定比例混合它们,以重现那种完美的年份风味。
P2P 如何运作(两个阶段的过程)
论文将其描述为一个两步走的过程:
第一阶段:构建“多样化团队”(主动禀赋生成)
首先,系统需要创建一个庞大的不同 AI 角色池。
- 诀窍: 系统并没有简单地要求 AI “随机生成”,而是使用了一种聪明的策略,称为基于熵的自适应采样。
- 类比: 想象一位厨师试图创造一份涵盖所有口味的菜单。如果他一直制作那些大家都喜欢的菜肴(比如白面包),他就学不到任何新东西。因此,厨师会观察人们意见不一致的地方(低熵),并专门要求厨房发明新的变化,以填补这些空白。
- 结果: 他们最终得到了 300 个不同的“人格”(例如:来自中西部的退休教师、城市里的年轻科技从业者、担心通货膨胀的农民)。这些不仅仅是随机的,它们经过精心挑选,以覆盖尽可能广泛的观点范围。
第二阶段:“调酒师”(基于回归的聚合)
现在,既然已经拥有了一支庞大且多样的 AI 角色团队,他们需要弄清楚在匹配真实人类数据时,每个角色应该占多少比例。
- 类比: 想象你有一份真实汤品的食谱(实际的人类调查结果)。你的储藏室里有 300 种不同的食材(你的 AI 角色)。你不需要全部 300 种,你只需要找到那份完美的少量食材,当它们混合在一起时,味道能和真实的汤一模一样。
- 数学原理: 系统使用一种数学工具(L1 正则化回归)来充当调酒师。它观察真实调查数据并说:“好吧,为了得到这个结果,我们需要 10% 的‘退休教师’的声音,5% 的‘科技从业者’的声音,以及 0% 的‘农民’的声音。”
- 神奇之处: 它在无需了解真实人物敏感隐私细节(如确切收入或种族)的情况下完成工作。它只是观察人们给出的答案,并找出哪种 AI 声音的组合最能匹配这些答案。
为什么这很重要
- 廉价且快速: 你不需要从头开始训练一个庞大且昂贵的 AI 模型。你只需使用现有的 AI 模型,并支付极低的费用(每次调查约 0.80 美元)来运行模拟。
- 准确: 当他们针对美国的调查(美国趋势小组)和全球范围内的调查(世界价值观调查)进行测试时,他们的“AI 混合物”比直接询问标准 AI 或使用其他常见方法更接近真实的人类观点。
- 对数据量要求低: 即使他们只有极少量的真实人类数据(不到其他方法所需数据的 3%),他们的系统仍然表现出色。
核心结论
这篇论文认为,你不需要一个“超级 AI”来理解人类社会。相反,你需要一个多样的 AI 演员阵容,以及一种聪明的导演方式,让他们共同表演,从而听起来完全像是真实的观众。这使得研究人员能够快速、廉价且准确地模拟公众舆论,而无需采访成千上万的真实人类或访问他们的私人数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。