Barriers to Counterfactual Credit Attribution for Autoregressive Models
本文研究了在自回归生成模型中实施反事实信用归因(CCA)所面临的挑战,论证了 CCA 无法以自回归方式组合,且对现有模型进行改造以满足 CCA 要求会导致查询复杂度随输出长度呈指数级增长。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位刚刚发明了一款美味新汤的厨师。在过去,如果你使用了一位特定农民提供的秘制香料,你自然会说道:“这汤之所以美味,多亏了约翰农民的香料。”你理所当然地给予应得的赞誉。
但现在,想象你拥有一台神奇的“汤机器人”。你向它输入一份食材清单(一个数据库),它便迅速调制出一锅汤。问题在于,这台机器人是一个黑箱。它将所有东西混合得如此彻底,以至于你无法分辨究竟是哪种具体食材决定了汤的味道。如果你无法判断是什么影响了汤的味道,你就无法向农民们致谢。本文主张,我们需要一种方法,迫使这台机器人在某种香料确实对食谱至关重要时,说出:“我使用了约翰农民的香料。”
作者将这种方法称为“反事实归因”(Counterfactual Credit Attribution, CCA)。这是一种花哨的说法,意思是:“如果我们把约翰农民的香料从清单中移除,汤的味道还会一样吗?”如果答案是“不,味道会不同”,那么机器人必须向约翰农民致谢。
本文探讨了构建这种“致谢机器人”的两种自然方法,并发现两者都撞上了一堵巨大的墙。
1. “逐步”方法(自回归模型)
大多数现代人工智能(包括正在撰写此摘要的 AI)的工作方式,就像一个人逐字逐句地写故事。它选一个词,然后选下一个,再选下一个。
设想: 也许我们可以直接教导机器人为它所选择的每一个单独的词进行致谢。如果它选了一个依赖于约翰农民香料的词,它就向他致谢。然后,我们将所有这些词串联起来,组成完整的汤(即完整的文本)。
问题: 本文证明这行不通。
- 类比: 想象你在用积木搭建一座塔。你有一条规则:“每次放置一块积木时,必须检查它是否稳固。”你完美地遵循了这一规则,对每一块积木都如此。但当你退后一步时,整座塔却倒塌了。
- 现实: 作者表明,即使机器人在为生成的每一个单独的词进行致谢方面表现完美,最终的故事(整个序列)仍可能无法正确地进行致谢。“致谢”会随着词语的堆积而丢失或扭曲。这就像试图通过只检查单个砖块的稳定性来建造一座稳固的房子;整体结构仍可能分崩离析。
2. “事后补救”方法(事后添加致谢)
设想: 如果我们已经拥有一台擅长做汤但拙于致谢的机器人,该怎么办?我们能否给它套上一个“外壳”?这个外壳会监视机器人做汤的过程,并在事后决定:“好吧,我要加一条备注,写上‘致谢:约翰农民’。”
问题: 本文证明这在计算上是不可能的(或者至少,其难度之大,等同于不可能)。
- 类比: 想象你有一个保险箱,它能生成一个随机的 100 位数字代码。你想给这个保险箱贴上一个标签,上面写着:“此代码受到了数字 7 的影响。”为了做到这一点,你必须窥视保险箱内部,看看数字 7 是否真的被使用了。
- 现实: 作者表明,为了弄清楚机器人是否真的需要特定数据(如约翰农民的香料)来生成其输出,你必须让机器人生成汤数万亿次(指数级数量的查询)才能确定。这就像试图通过一次挖掘一粒沙子来在沙滩上找到特定的一粒沙子。即使你只想要一个“足够好”的猜测,数学也表明,你仍然几乎要挖遍整个沙滩。
主要结论
本文得出结论,我们目前面临着一个巨大的障碍。
- 我们无法通过让 AI 在每一个微小的步骤(逐字)上都进行致谢,来构建出能致谢的 AI。
- 我们无法在不进行不可能的工作量的情况下,通过事后附加一个致谢层来轻松修复现有的 AI。
作者还指出了一个奇怪的副作用:为了满足这种“致谢系统”的严格规则,机器人可能被迫向那些几乎未改变汤味的食材致谢。这就像被迫感谢一位农民,因为他提供的那一粒盐实际上并未改变味道,仅仅因为数学表明你可能需要它。
简而言之:制造能够可靠且高效地为其来源致谢的 AI,比我们想象的要困难得多,而两个最显而易见的解决方案都行不通。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。