← 最新论文
💬 NLP

What Makes a Good Query? Measuring the Impact of Human-Confusing Linguistic Features on LLM Performance

该论文通过构建涵盖 22 种语言学特征的查询向量,对近 37 万条真实查询进行大规模分析,揭示了从句嵌套深度和指代不明等特定语言特征会显著增加大语言模型的幻觉风险,而意图明确和可回答性则有助于降低该风险,从而建立了查询特征与幻觉概率之间的实证关联。

原作者: William Watson, Nicole Cho, Sumitra Ganesh, Manuela Veloso

发布于 2026-02-25
📖 1 分钟阅读☕ 轻松阅读

原作者: William Watson, Nicole Cho, Sumitra Ganesh, Manuela Veloso

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一次“体检”,但医生看的不是模型的脑子(算法),而是用户问问题的方式(提问的措辞)

简单来说,研究人员发现:并不是所有的“幻觉”(模型胡说八道)都是模型的错,很多时候是因为用户问得太“模糊”或太“绕”,把模型给带偏了。

为了让你更容易理解,我们可以把大语言模型想象成一个极其博学但有点“死脑筋”的超级实习生

1. 核心发现:提问的“形状”决定了答案的“质量”

想象一下,你让这位实习生去图书馆找一本书。

  • 糟糕的提问(高风险): “帮我找那本关于那个东西的书。”

    • 结果: 实习生会懵圈。因为“那个东西”是什么?“那本”是哪本?为了填补这个空白,实习生可能会瞎编一个书名给你,这就是“幻觉”。
    • 论文发现: 这种缺乏具体细节(Lack of Specificity)指代不明(Anaphora,比如用“它”指代前文没提到的东西)、或者**句子结构太复杂(Clause Complexity,像俄罗斯套娃一样嵌套)**的问题,最容易让模型产生幻觉。
  • 优秀的提问(低风险): “请帮我找 2023 年出版的、关于量子物理的、作者名字是理查德·费曼的那本书。”

    • 结果: 实习生目标明确,直接去书架找,几乎不会出错。
    • 论文发现: 如果问题意图清晰(Intention Grounding),并且有明确的答案范围(Answerability),模型“胡说八道”的概率就会大幅降低。

2. 研究过程:给 37 万个问题“贴标签”

研究人员收集了 369,837 个 真实世界的问题(就像从 37 万个不同的用户那里收集了 37 万个指令)。

他们给这些问题贴上了 17 种“语言标签”,就像给食物分类一样:

  • 模糊类: 比如“告诉我关于特斯拉的事”(是汽车公司?还是发明家?还是股票?)。
  • 复杂类: 比如“如果 A 发生,且 B 没发生,但 C 是 D 的相反面,那么 E 会怎样?”(句子太长太绕)。
  • 否定类: 比如“不要告诉我谁没赢,告诉我谁赢了”(双重否定或否定词容易让人晕)。
  • 清晰类: 比如“请总结这篇文章的三个要点”。

然后,他们让模型回答这些问题,并判断哪些回答是“胡说八道”(幻觉),哪些是“靠谱”的。

3. 关键结论:一张“风险地图”

通过大数据分析,他们画出了一张**“提问风险地图”**:

  • 🔴 红色高危区(容易引发幻觉):

    • 缺乏具体性: 问题太宽泛,像“告诉我一切”。
    • 深层嵌套: 句子像洋葱一样一层包一层,模型容易跟丢。
    • 指代不明: 用“他”、“它”指代不清楚的对象。
    • 场景错位: 比如在一个只能查资料的场景里,问了一个需要凭空想象的问题。
  • 🟢 绿色安全区(不容易引发幻觉):

    • 意图明确: 清楚地说出“我要总结”、“我要对比”、“我要提取”。
    • 可回答性: 问题本身是有标准答案的,不是问“你觉得哪个更好吃”这种主观题。
  • 🟡 意外发现(人类 vs 机器):

    • 有些词人类觉得很难(比如生僻词、复杂的否定句),但对模型来说反而不是大问题
    • 这说明:让人类困惑的,不一定让 AI 困惑;让 AI 困惑的,也不一定让人类困惑。 它们的“翻车”原因不一样。

4. 实用建议:如何避免被 AI“忽悠”?

基于这项研究,论文给出了三个简单的“避坑指南”,就像给实习生写工作指令一样:

  1. 加细节(拒绝模糊): 不要说“写个关于狗的故事”,要说“写一个关于一只名叫巴迪的金毛犬在2024 年夏天海边旅行的故事”。
  2. 说清楚要干嘛(明确意图): 不要只扔一个词“特斯拉”,要说"总结特斯拉 2024 年第四季度的财报”。
  3. 消除歧义(锁定含义): 如果提到"Java",要说明是“编程语言”还是“印尼的爪哇岛”。

总结

这篇论文告诉我们:大语言模型并不是完美的“神”,它们更像是一个听话但需要明确指令的“超级助手”。

如果我们能学会更清晰、更具体、更有逻辑地提问(就像给助手画一张精准的地图),就能大大减少它“瞎编乱造”的情况。这不需要我们换掉模型,只需要我们优化提问的方式,就能让 AI 变得更靠谱、更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →