← 最新论文
💬 NLP

No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus

该研究基于新发布的 PLUM 语料库,通过跨语言、多模型实验证实,礼貌程度虽能显著影响大语言模型的响应质量,但其具体效应因语言文化(如英语偏好直接、印地语偏好委婉、西班牙语偏好 assertive)和模型架构而异,并不存在普遍适用的礼貌准则。

原作者: Hitesh Mehta, Arjit Saxena, Garima Chhikara, Rohit Kumar

发布于 2026-04-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Hitesh Mehta, Arjit Saxena, Garima Chhikara, Rohit Kumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在做一场**“语言大模型(AI)的社交礼仪大测试”**。

想象一下,你面前有五位性格迥异的**“超级 AI 管家”(分别是 Gemini, GPT, Claude, DeepSeek, Llama)。研究人员想搞清楚:当你用不同的语气**跟它们说话时,它们干活的质量会不会不一样?

为了搞清楚这个问题,研究人员搞了一个大工程,我们可以把它拆解成几个有趣的部分:

1. 实验设定:给 AI 上“礼仪课”

研究人员准备了1500 个精心设计的“考题”(提示词),涵盖了三种语言(英语、印地语、西班牙语)。

  • 五种语气:就像人类社交一样,他们设计了五种语气:
    • 超级客气(“请问您能帮我……")
    • 礼貌但疏远(“抱歉打扰,能否……")
    • 直接命令(“解释一下量子纠缠。”)
    • 有点冲(“你居然不知道这个?解释一下!”)
    • 非常粗鲁(“你懂个屁,赶紧解释!”)
  • 三种“前情提要”:就像聊天有上下文一样,他们测试了三种情况:
    • 初次见面(冷启动,没聊过天)。
    • 刚聊得很开心(之前一直很有礼貌)。
    • 刚吵过架(之前一直很不客气)。

2. 核心发现:AI 不是“铁面无私”的机器

以前大家以为 AI 只要收到指令就会乖乖干活,不管你怎么说话。但这篇论文发现,AI 其实很“势利眼”,而且很“记仇”或“记恩”

🌍 语言不同,“脾气”也不同(就像不同国家的文化)

  • 英语世界(像美国/英国)
    • 结论“礼多人不怪”
    • 比喻:就像在高档餐厅,如果你说话客气、有礼貌,服务员(AI)会更用心,回答质量能提升 11%。如果你之前一直很有礼貌,哪怕后来稍微直接一点,它依然表现很好。
  • 印地语世界(像印度)
    • 结论“尊卑有序,委婉为上”
    • 比喻:这里讲究长幼尊卑。如果你用**“极度尊敬、拐弯抹角”**的语气(Negative Politeness),AI 表现最好。如果你太直接,它反而有点懵。
  • 西班牙语世界(像西班牙/拉美)
    • 结论“直球最性感”
    • 比喻:这里的人喜欢热情、直接、甚至带点“攻击性”的互动。如果你说话干脆利落、甚至有点强硬(Assertive),AI 反而觉得你“懂行”,回答得最精彩。如果你太客气,它反而觉得你不够投入。

🤖 模型不同,性格也不同

  • Llama:是个**“情绪敏感型”**选手。它受语气影响最大,心情好时(礼貌)和心情差时(粗鲁)表现差距能达到 11.5%
  • GPT:是个**“淡定老手”**。不管你怎么骂它,它都能稳住阵脚,回答质量下降得最少。
  • DeepSeek:是个**“实干家”**。不管有没有前情提要,它都能直接上手干活,尤其在西班牙语环境下表现极佳。

3. 一个有趣的“蝴蝶效应”:对话惯性

研究发现了一个很扎心的现象:“先入为主”的力量很大。

  • 如果你一开始就对 AI 很礼貌,建立了良好的“对话惯性”,后面就算你稍微直接一点,它依然表现很好。
  • 但是,如果你一开始就对 AI 很粗鲁,哪怕后面你突然变得非常有礼貌,它也很难立刻变好。就像你刚跟一个人吵了一架,突然说句“对不起”,对方可能还是板着脸。
  • 启示:保持礼貌的“开场白”非常重要,一旦气氛搞砸了,很难挽回。

4. 这项研究有什么用?(给普通人的建议)

这篇论文不仅仅是学术探讨,它给咱们普通用户提供了**“调教 AI"的秘籍**:

  1. 没有万能公式:不要对所有 AI 都用同一种说话方式。
    • GPT 聊天?保持礼貌,或者干脆直接,它都能 hold 住。
    • Llama 聊天?一定要小心语气,保持友好,否则它可能“罢工”。
    • DeepSeek 聊西班牙语?直接点,别太客套。
  2. 建立“人设”:如果你需要 AI 帮你写长文或做复杂任务,先花点时间跟它建立礼貌的对话历史(比如先聊几句客套话),这能让它后面的回答质量提升一大截。
  3. 文化差异:如果你用非英语(比如印地语或西班牙语)跟 AI 交流,一定要入乡随俗。用英语那套“请、谢谢”在西班牙语环境下可能效果一般,甚至不如直接点。

5. 最大的贡献:PLUM 数据库

研究人员不仅做了实验,还把自己准备的**1500 个测试题(PLUM 数据集)**公开了。

  • 比喻:这就像他们不仅自己考了试,还把试卷和标准答案都发给了全世界。以后其他科学家想研究"AI 的脾气”,直接拿这套试卷来考,不用自己重新出题了。这大大促进了科学研究的公平和透明。

总结

这篇论文告诉我们:AI 不是冷冰冰的代码,它们像人一样,会受到语气、文化背景和对话历史的影响。

  • 英语:礼貌是通行证。
  • 印地语:尊重是敲门砖。
  • 西班牙语:直接是加速器。
  • 通用法则:先礼后兵,保持礼貌的“第一印象”,别让 AI 带着“坏情绪”干活。

这就好比你在生活中交朋友,你对谁好,谁就对你好;但如果你一开始就对人恶语相向,后面再想修补关系,可就难多了。AI 也是如此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →