Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations
本文综述了针对基于 Transformer 的大语言模型的局部可解释性与机械可解释性方法,展示了将其应用于医疗保健和自动驾驶领域以评估信任影响的实验研究,并概述了生成符合人类对齐且值得信赖的解释所面临的未来挑战与机遇。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大语言模型(LLMs)想象成一群才华横溢但又有些神秘的大厨,他们身处一个巨大的厨房里。他们只需读一下提示词,就能变出一道完美的菜肴、写出一首复杂的诗,或者诊断出一个医疗问题。但问题在于:没人确切知道他们是如何做到的。 他们是“黑盒”。你向他们要一道菜,他们端出了一顿美味佳肴,但你完全不知道他们是真的遵循了食谱,还是仅仅根据厨房里的气味瞎猜出来的,亦或是不小心加进了一种看起来像欧芹其实是有毒的成分(即“幻觉”)。
这篇论文就像是一群美食评论家和厨房检查员,试图弄清楚如何让这些大厨变得值得信赖。他们想知道:我们能否让大厨用一种让我们理解的方式来解释他们的烹饪过程,从而让我们知道这顿饭吃起来是否安全?
以下是他们调查过程的详细拆解,使用了简单的类比:
1. 理解大厨思维的两条途径
论文指出,尝试理解这些 AI 大厨主要有两种方式:
局部可解释性(“为什么要做这道菜?”的方法):
这是要求大厨解释他刚刚做出的某道特定菜肴。- 自然语言: 大厨说:“我加了盐,因为汤的味道有点淡。”(论文警告:有时大厨只是在编造一个听起来很聪明的理由,即便真实的理由并非如此。)
- 思维链(Chain-of-Thought): 大厨讲述他的步骤:“首先我切了洋葱,然后把它炒熟了……”(论文警告:有时大厨只是在假装一步步思考,但实际上他可能瞬间就猜出了答案。)
- 检索(RAG): 大厨翻出一本食谱或参考卡片,以证明他从哪里得到了这个配方。这是最值得信赖的方式,因为它指向了一个真实的来源。
- 特征归因(Feature Attribution): 大厨指着台上的特定食材说:“这三颗洋葱是这锅汤最重要的部分。”
机械可解释性(“厨房是如何运作的?”的方法):
这是观察大厨的大脑内部,看一看里面的齿轮和电线。- 想象大厨的大脑是一个巨大的电路板。研究人员正试图寻找执行特定任务的“电路”(神经元组)。例如,他们发现了一个特定的电路可以帮助大厨识别模式,比如知道在故事中“达斯利先生”通常出现在“达斯利”之前。
- 问题所在: 厨房如此庞大且复杂,以至于电路交织在一起。一条电线可能同时承担着三种不同的工作(就像一把瑞士军刀),这使得准确弄清楚到底发生了什么变得非常困难。
2. “虚假”解释的危险
论文强调了一个主要问题:臆造(Confabulation)。
有时,大厨非常擅长言辞,能让你相信他遵循了逻辑路径,但实际上他只是猜出了答案。
- 类比: 想象一个学生正在参加数学考试。他得到了正确答案(12),但当被要求展示解题过程时,他写下了一个看起来合乎逻辑但实际上是错误的计算过程。答案是对的,但推理过程是谎言。
- 论文表明,在医疗保健(诊断克罗恩病)和自动驾驶(在红灯前停车)等关键领域,这种情况是危险的。如果医生信任来自 AI 的虚假解释,他们可能会做出错误的决策。如果一辆自动驾驶汽车“认为”它看到了停止标志,但实际上是在产生幻觉,它可能会发生碰撞。
3. 用“压力测试”考验大厨
我们如何知道大厨是否在说实话?论文建议我们需要对他们进行压力测试。
- 类比: 与其仅仅问“你为什么要停下来?”(大厨可能会轻松回答这个问题),不如问:“如果灯是绿色的但有行人过马路,你会怎么做?”或者“如果前面的车是蓝色的而不是红色的,你会怎么办?”
- 如果大厨能对这些棘手的“假设性”问题给出一致且逻辑严密的回答,我们就可以更信任他们。如果他们感到困惑或开始编造故事,说明他们还没有准备好应对现实世界。
4. 根据受众定制解释
并不是每个人都需要了解烹饪过程的每一个细节。论文建议了三个层级的解释:
- 面向公众(粗粒度): “我停了下来,因为灯是红色的。”(简单易懂)。
- 面向医生/专家(由粗到细): “我停了下来,因为灯是红色的,具体来说,传感器探测到有行人在 3 米外的过街通道内。”(从简单开始,然后提供具体的证据)。
- 面向工程师(细粒度): “负责‘红灯检测’的神经电路被激活,触发了‘刹车’路径。”(为构建厨房的人提供深层的技术细节)。
5. 值得信赖的大厨必须遵守的 8 条规则
最后,论文提出,要让一个 AI 真正值得信赖,其解释必须遵循 8 条规则(基于一个名为 TrustLLM 的框架):
- 真实性: 不要撒谎或编造事实。
- 安全性: 不要给出危险的建议(如“吃掉这个毒药”)。
- 鲁棒性: 当遇到刁钻的问题时,不要感到困惑。
- 公平性: 不要对某些群体存在偏见。
- 隐私性: 不要无意中泄露秘密信息。
- 机器伦理: 即使在无人监督时,也要做正确的事。
- 透明度: 对自己的工作方式保持公开。
- 问责制: 如果犯错,要能够承担责任。
核心结论
论文总结道,虽然这些 AI 大厨非常了不起,但目前它们过于神秘,尚不足以在生死攸关的情况下被完全信任。我们需要更好的方法来检查他们的工作,确保他们不仅仅是“空谈”,并确保他们的解释是诚实、准确且针对提问者量身定制的。在我们实现这一点之前,对于是否让他们驾驶我们的汽车或诊断我们的病人,我们应当保持谨慎。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。