← 最新论文
💬 NLP

Social Meaning in Large Language Models: Structure, Magnitude, and Pragmatic Prompting

该论文通过引入结构保真度与幅度校准指标,并结合语用学理论设计提示策略,发现大型语言模型虽能可靠复现人类社会推理的结构特征,但在推理强度上存在显著偏差,而综合考量说话者知识与动机的提示方法能最有效地改善这种校准偏差。

原作者: Roland Mühlenbernd

发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Roland Mühlenbernd

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM,比如现在的各种 AI 聊天机器人)做一场"社会情商体检"。

作者想搞清楚两个核心问题:

  1. 定性:AI 能不能像人一样,听懂“话里有话”?(比如,别人说“大概 500 块”,你能不能感觉到他可能不太确定?)
  2. 定量:AI 能不能像人一样,精准地把握这种“话里有话”的程度?(比如,这种不确定感是让人稍微有点怀疑,还是让人彻底觉得他不靠谱?)

为了讲清楚,我们用几个生活中的比喻来拆解这篇论文。

1. 核心发现:AI 懂“方向”,但不懂“力度”

想象一下,你让三个不同的 AI(GPT、Claude、Gemini)去扮演一个“社会观察员”,评价一个人说话时的精确度(比如他说“自行车 500 块”vs“自行车大概 500 块”)会给人留下什么印象。

  • 人类的表现

    • 需要精确的场合(比如报保险),如果说“大概 500 块”,大家会觉得这人不太靠谱,扣分很多。
    • 随便聊聊的场合(比如朋友问),如果说“大概 500 块”,大家觉得很自然,甚至觉得这人很随和,扣分很少。
    • 关键点:人类对“不精确”的惩罚,在保险场景下是“重罚”,在聊天场景下是“轻罚”。这个力度的差距(Magnitude)是非常微妙的。
  • AI 的表现

    • 方向对了(结构忠实):所有 AI 都知道“在保险场景说大概,比在聊天场景说大概,评价要低”。它们完全听懂了“话里有话”的逻辑。
    • 力度歪了(校准偏差):但是,AI 在扣分多少上经常跑偏。
      • 有的 AI(如 Gemini)像个夸张的喜剧演员:不管什么场景,只要听到“大概”,它就疯狂扣分,把“稍微不靠谱”夸大成“极度不靠谱”。
      • 有的 AI(如 GPT)像个温和的中间派:扣分比较接近人类,但偶尔也会手抖。

论文的新发现:以前大家只关心 AI 选对答案没有(定性),这篇论文发明了新的尺子(ESR 和 CDS 指标),专门测量 AI 的扣分力度是否和人类一样精准(定量)。结果发现:AI 虽然懂逻辑,但经常用力过猛力度不足

2. 怎么给 AI“开药方”?(提示词策略)

既然 AI 懂逻辑但力度不对,作者尝试用语用学(研究语言如何在实际交流中使用的理论)给 AI 写“提示词”(Prompt),看看能不能治好这个毛病。作者开了三种“药方”:

药方 A:提醒 AI“想想别人会怎么说” (Alternative-Aware)

  • 比喻:就像告诉 AI:“别光听这句话,想想如果说话人想表达更确定的意思,他会不会选别的词?既然他选了‘大概’,说明他可能没把握。”
  • 效果
    • 对某些 AI(如 GPT)有点用。
    • 但对那些本来就容易“用力过猛”的 AI(如 Gemini),这招反而火上浇油。它让 AI 更纠结于“词的选择”,结果把不靠谱的印象夸得更大了

药方 B:提醒 AI“猜猜说话人心里在想什么” (Knowledge-and-Motives-Aware)

  • 比喻:就像告诉 AI:“别急着下结论,先猜猜说话人是不是真的不知道确切数字?还是他故意不想说太细?也许他只是不想显得太较真,而不是不诚实。”
  • 效果
    • 这是最灵的一招!特别是对于那些容易“用力过猛”的 AI,这招能让它们冷静下来,把夸张的扣分拉回到接近人类的水平。
    • 这就像给 AI 戴上了一副“同理心眼镜”,让它理解人类说话时的不确定性动机

药方 C:双管齐下 (Combined)

  • 比喻:既让 AI 想“别人会怎么说”,又让 AI 想“说话人心里想什么”。
  • 效果
    • 这是唯一一个在所有 AI 身上都稳赢的方案。它综合了前两者的优点,让 AI 在保持逻辑正确的同时,把力度调整得更像人。
    • 不过,对于某些特别“夸张”的 AI,这招虽然有效,但还没完全治好(力度还是有点偏差)。

3. 总结与启示

这篇论文就像给 AI 做了一次精细的“情商校准”

  1. AI 已经学会了“社交礼仪”的骨架:它们知道什么时候该严谨,什么时候该随和。
  2. 但 AI 还没学会“社交礼仪”的肌肉记忆:它们往往用力过猛,把“稍微有点不精确”理解成“非常不靠谱”。
  3. 最好的教学方法:不要只教 AI“看选项”(对比不同说法),更要教 AI“读人心”(推测说话人的知识状态和动机)。只有让 AI 真正去模拟人类的思考过程(既看选项又猜动机),它们的表现才会最接近真人。

一句话总结
现在的 AI 就像是一个懂道理但有点死板的实习生,你教它“要灵活”,它可能反而更死板;但如果你教它“去体会说话人的难处和动机”,它就能瞬间变成一个情商在线的职场老手。这篇论文就是教我们如何给 AI 开这剂“情商药方”的说明书。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →