← 最新论文
💬 NLP

Post-training makes large language models less human-like

本文引入 Psych-201 数据集以证明,旨在优化大语言模型实用性的后训练过程会持续削弱其准确模拟人类行为的能力,这一问题在更新的模型代际中持续存在并日益恶化,且无法通过人格诱导技术加以解决。

原作者: Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julia
发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Robert C. Wilson, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢、性格混乱且极具创造力的学徒,他几乎读遍了图书馆里的每一本书。这位学徒就是一个基础模型(Base Model)。他们原始、未经过滤,说话方式完全像真人:充满怪癖、错误、犹豫以及现实生活那种杂乱无章的逻辑。如果你问他们一个问题,他们可能会结巴、猜测,或者给出一个技术上“错误”但感觉非常像真人的答案。

接着,你决定训练这位学徒成为一名有用的助手。你教导他们遵守严格的规则,给出“正确”的答案,并表现得礼貌且合乎逻辑。这个过程被称为后训练(Post-Training)。

你分享的这篇题为《后训练使大型语言模型更不像人类》的论文,揭示了一个令人惊讶且违反直觉的真相:你越是训练这些模型成为完美的助手,它们听起来就越不像真人。

以下是他们研究发现的简要说明,使用了简单的类比:

1. “完美学生”与“真人”

研究人员建立了一个名为Psych-201的大型测试场。你可以把它想象成一个巨大的图书馆,里面收藏了超过 20 万份真实人类参加心理测试、玩游戏和解决谜题的转录记录。这就像拥有一个人类的“对照组”用于对比。

他们测试了两类人工智能:

  • 基础模型:那位通过阅读书籍学习的原始学徒。
  • 后训练模型:同一位学徒在接受了成为乐于助人、遵守规则的助手训练之后。

结果:每一次测试中,“完美学生”(后训练模型)在预测真人会说什么或做什么方面,表现都比“原始学徒”(基础模型)更差。通过试图让 AI 在成为助手方面变得更“好”,他们意外地剥离了那些使其成为良好人类模拟器的、极具人性化的行为特征。

2. 逻辑的“恐怖谷”

为什么会发生这种情况?

  • 基础模型就像一面人类语言的镜子。它们吸收了我们所有的偏见、捷径、“直觉”以及错误。如果真人因为疲惫或困惑而猜错,基础模型也会猜错。
  • 后训练就像给那面镜子加了一个滤镜。它迫使 AI 变得“规范正确”。它教导 AI 忽略人类的怪癖,专注于“正确”的答案。

论文发现,这种“修正”在以下两个领域造成的损害最大:

  • 心理语言学(我们如何使用语言):人类使用语言是杂乱无章的。而后训练模型使用语言则过于完美。
  • 推理:人类经常犯逻辑错误或使用捷径(启发式方法)。后训练模型被迫在逻辑上完美无缺,这使它们听起来更不像人类的思维过程,而更像一台计算器。

3. “越新越差”的悖论

你可能会认为,随着 AI 变得更聪明,它在模仿人类方面也会变得更好。但论文指出:并非完全如此。

  • 基础模型(原始学徒)随着每一代新产品的推出,在模仿人类方面确实变得更好了。
  • 然而,后训练过程(即“助手”训练)却变得更加激进。“原始学徒”与“完美助手”之间的差距正在扩大。模型越新,一旦开启“助手”功能,它就越显得“机器人化”,越不像人类。

4. “人设”技巧行不通

有一个流行的技巧叫做人设诱导(Persona-Induction)。当你告诉 AI“假装你是一位来自巴西的 35 岁教师”时,就是在使用这个技巧,希望它能表现得更像那个特定的人。

研究人员在大规模范围内测试了这一点。他们向 AI 提供了真实人物的详细档案(年龄、国籍、教育背景),并让它预测这些特定的人会如何回答。
结果:这并没有帮助。了解“人设”并没有让 AI 更好地预测个体的行为。这就像给演员一本同义词词典;这并不能让他们成为更好的即兴表演者。

核心结论

论文得出结论:我们用来让 AI 变得有用的工具(指令微调、推理训练、安全过滤器),恰恰也是使其成为糟糕的人类行为模拟工具的原因。

如果你希望 AI 表现得像一个乐于助人的助手,你应该使用后训练版本。
但如果你希望 AI 表现得像人类(例如,模拟患者在治疗会话中可能如何反应,或学生可能如何学习),你实际上应该使用基础模型(原始、未训练的版本),因为它仍然记得如何变得杂乱、不完美且充满人性。

简而言之:为了让 AI 更实用,我们让它变得更不像人。为了让它再次更像人,我们可能需要停止如此频繁地“修正”它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →