Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy
本文揭示了大型语言模型在面对保持语义不变的改写时,其回答往往表现出显著的不稳定性,这表明标准的准确率指标可能会掩盖可靠性问题,并且自我改写策略可以有效地恢复潜在知识以提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
完美机器人的幻象
想象一下,你正在和一个非常聪明的机器人朋友聊天,它几乎读过了图书馆里的每一本书。你问它一个简单的问题,它给出了一个精彩且正确的答案。你会感到很放心,对吧?但如果你用稍微不同的措辞再次询问同一个问题,情况会怎样?它还会给出同样的答案吗?这就是来自马里兰大学计算机科学家的一项新研究背后的核心问题。他们正在研究“大语言模型”(LLMs),也就是像聊天机器人这类工具背后的超智能 AI 大脑。这些模型以在测试中表现精准而闻名,但这项研究提出了一个棘手的问题:它们是真的可靠,还是仅仅擅长根据问题的措辞进行猜测?把它想象成一个背诵了练习题准确措辞的学生。如果稍微改变一下问题的说法,这个学生是否仍然知道答案,还是会感到困惑?研究人员想要找出这些 AI 模型是真的理解了这个世界,还是仅仅在玩一场“单词匹配”的游戏。
同样的问题,错误的答案
研究人员决定与 13 种不同的 AI 模型进行一场游戏,这些模型涵盖了从小型开源模型到大型科技公司使用的庞大强大模型。他们提取了关于现实世界事实的问题(例如“1864 年安德森输掉了多少盘国际象棋?”)和数学题,然后用几十种不同的方式重写了这些完全相同的问题。他们确保新的问题意思完全一致,就像说“你好吗?”与“最近怎么样?”或“过得如何?”之间的区别一样。
以下是他们发现的令人惊讶的转折点:AI 模型往往是不一致的。 尽管问题的含义相同,但模型有时第一次回答正确,而在重新表述问题后却回答错误。事实上,对于许多问题,模型会在正确与错误之间发生切换,这取决于措辞的方式。研究发现,不匹配率(即模型对同一个问题给出不同答案的情况)可能达到 23% 以上。这意味着如果你用不同的方式问同一个模型 100 次,即使它一直都知道正确答案,它仍有近四分之一的时间会给你一个不同的(且错误的)答案!
“隐藏知识”的差距
这个故事最引人入胜的部分在于,这反映了 AI 究竟“知道”什么。研究人员发现,模型的内部往往确实隐藏着正确答案。如果你用足够多的不同方式提问,模型最终至少能答对一次。这表明知识确实存在,但模型提取知识的过程并不可靠。
为了直观展示这一点,请想象一个正在考试的学生:
- 标准准确度: 学生在第一次尝试时答对了 80%。
- 可靠能力: 无论你如何措辞,只要你问这个问题,学生每次都能答对 80%。
- 潜在能力: 如果你用 10 种不同的方式提问,学生至少能答对一次。
研究发现,“可靠能力”与“潜在能力”之间存在巨大的差距。模型往往知道答案(潜在),但在展示答案时却无法保持一致(可靠)。在某些情况下,如果你换一种问法,模型可以多答对 30% 的问题,但在标准测试中却未能做到这一点。这意味着我们在排行榜上看到的标准“准确率”得分可能掩盖了大量的稳定性问题。这些模型并不一定是笨,它们只是脆弱。它们依赖于特定的词汇模式,而非深层、稳固的理解。
“翻转”与“修复”
研究人员还观察了一个被称为“翻转率”的现象。这是指模型第一次答对了问题,但在重新表述后却答错了;或者更令人困惑的是,它第一次答错了,但在重新表述后却答对了。这种“反复无常”的行为表明模型的思维是摇摆不定的。这就像一个指南针,当你以一种方式握住它时它指向北,但当你稍微倾斜它时,它就指向了东。
然而,出现了一线希望。研究人员尝试了一种简单的技巧,叫做自我改写(Self-Paraphrasing)。他们不再只是向模型提问,而是先让模型用自己的话重写问题,然后基于这些新的版本进行回答。这就像要求一个学生在回答之前先在脑海中“重读一遍问题”。这一简单的步骤帮助模型弥合了差距,通过帮助它们获取那些隐藏的、潜在的知识,从而提升了表现。
这对未来意味着什么
这篇论文的主要结论是,标准的准确率得分可能是具有误导性的。 仅仅因为一个模型在测试中获得了高分,并不意味着它在现实世界中是真正可靠的。在现实生活中,人们会以各种奇怪的方式提问,如果 AI 无法处理这些情况,那么它就还没准备好投入实际应用。研究表明,我们不应仅仅关注“它答对了多少题”,而应该开始询问“它的连贯性如何?”
作者们建议,要让 AI 真正值得信赖,必须测试它在不同措辞下保持一致性的能力。在此之前,我们可能高估了这些机器人真正的聪明程度。它们可能非常擅长背诵剧本,但在学会如何在不脱离思路的情况下即兴发挥之前,它们仍有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。