← 最新论文
💬 NLP

Can LLMs Replace Economic Choice Prediction Labs? The Case of Language-based Persuasion Games

本文表明,大型语言模型可以有效地替代人类受试者,用于在基于语言的劝说博弈中生成经济选择预测的训练数据,其表现往往优于基于真实人类数据训练的模型,并揭示了捕捉依赖历史的决策模式对于准确预测至关重要。

原作者: Eilam Shapira, Omer Madmon, Roi Reichart, Moshe Tennenholtz

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Eilam Shapira, Omer Madmon, Roi Reichart, Moshe Tennenholtz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字经济中,每一次点击和每一次滚动都是一种选择。当旅行者在预订网站上阅读酒店评论时,他们是在将信息与自身的欲望进行权衡,试图决定一个房间是否物有所值。这是一个经典的经济学谜题:面对不完整的信息和被误导的可能性,人们是如何做决定的?几十年来,经济学家通过要求真实的人类参与一种一方试图说服另一方的游戏来研究这些时刻。这些实验很难开展;它们需要招募参与者、构建定制软件并等待人们做出决策,这个过程缓慢、昂贵,且规模往往受限。

最近,出现了一种有望改变我们研究这些决策方式的新工具:大语言模型。这些是经过海量文本训练的人工智能系统,能够以卓越的流畅度理解并生成人类语言。研究人员开始好奇,这些机器是否不仅仅能进行聊天。它们能否作为真实人类在经济实验中的替代品?如果一台计算机能够很好地模仿人类行为,它或许就能生成训练更好预测模型所需的庞大数据量,从而解决人类数据稀缺的问题。问题不仅在于机器能否像人类一样说话,还在于它们能否在高度复杂的局面下像人类一样思考和决策。

以色列理工学院的一个研究小组试图通过将人工智能代理置入一个复杂的说服游戏中来回答这个问题。在他们的设定中,一名扮演“专家”的角色试图说服第二名玩家——“决策者”去访问特定的酒店。专家知道酒店的真实质量,但只能从一系列选项中分享一条书面评论。决策者必须根据该评论以及他们过去与该专家的互动经验,来决定是否前往该酒店。如果酒店确实很好,决策者获胜;如果酒店很差,决策者则失败。然而,只要决策者选择前往,专家无论酒店真实质量如何都始终获胜。这创造了一种策略性的紧张关系:专家可能会通过撒谎来获得更好的结果,而决策者必须学会随着时间的推移识别欺骗。

研究人员首先收集了数百名真实人类玩家在多轮游戏中进行的实验数据。随后,他们用各种大语言模型取代了人类决策者,指示这些机器遵循相同的规则并面对相同的酒店评论。为了使模拟更加逼真,研究人员为每台机器赋予了特定的性格,例如总是看到光明面的乐观旅行者,或是对成本极其敏感的价格敏感型购物者。通过运行数千场模拟游戏,团队创建了一个由机器决策组成的庞大数据集,并利用该数据集训练了一个计算机程序,用以预测人类在相同情境下的行为。

结果令人惊讶。当研究人员仅使用人工智能玩家生成的数据来训练预测模型时,只要机器数据集足够大,该模型在预测人类行为方面甚至比使用实际人类数据训练的模型表现得更好。事实上,在几乎所有测试的情景中,机器生成的数据都优于人类数据。这表明人工智能代理不仅是在模仿人类的语言,而且捕捉到了人类在重复互动中学习和适应的深层策略模式。机器学会了权衡过去的评论历史和随时间建立的信任,而不仅仅是仅仅对屏幕上的即时文字做出反应。

然而,这项研究也揭示了仅依赖机器的一个重大缺陷。虽然基于人工智能数据的模型具有很高的准确性,但它们的校准度却很差。简单来说,这意味着当模型声称对某个预测很有信心时,它出错的频率往往比使用真实人类数据训练的模型更高。机器数据过于丰富,以至于它教会了模型在大多数情况下给出正确答案,但未能教会模型如何衡量自身的确定性。为了解决这个问题,研究人员发现,将少量的真实人类数据与大量的机器数据混合使用,可以创造出完美的平衡。这种混合方法产生了一个既具有高准确性又具有可靠置信水平的模型。

研究人员进一步挖掘,以理解机器为何如此成功。他们发现,预测人类行为的关键不在于评论的情感色彩,而在于互动的历史。当人工智能代理被允许记忆许多过去的轮次时,它们生成的数据与人类决策模式高度吻会。但当它们的记忆被限制在仅最后或前一两轮时,它们模拟人类行为的能力就会崩溃。这一发现强调了,在这种博弈中,人类的决策从根本上说是关于策略和历史,而不仅仅是阅读单条信息的感性基调。机器之所以成功,是因为它们学会了如何进行“长线博弈”,正如人类所做的那样。

为了确保他们的发现不仅限于酒店评论,团队在另一种更抽象的说服游戏中测试了他们的方法,在那个游戏中,玩家可以撰写任何信息,而不是从固定列表中进行选择。即使在这样一个规则较少约束、更自由的环境中,人工智能玩家生成的数据也被证明能有效训练预测人类选择的模型。这表明,机器生成有用训练数据的能力是一种稳健的现象,可以延伸到单一类型的实验之外。

研究结论指出,虽然人工智能目前还不能完美地取代人类行为的细微差别,但它可以作为一个强大的引擎,用于生成理解人类行为所需的数据。通过利用机器来模拟人类互动的策略复杂性,研究人员可以克服传统经济实验的瓶颈。未来的路径在于一种谨慎的伙伴关系:利用人工智能的规模来构建广泛的行为模型,同时利用适量的真实人类数据来确保这些模型保持可靠且贴近现实。这种方法为研究定义了我们经济世界的信任、欺骗与决策之间那场复杂的舞蹈提供了一种新途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →