Prompt-Model Interaction Reaches the Fixed Points: A deterministic, task-free structural readout -- and the factorizations of it that failed
本文表明,提示词-模型交互在短窗口内收敛至一种确定性的、无任务相关的定点结构,并揭示了这一现象是由特定的提示词-模型对驱动的,而非由任务性能或诸如前缀长度或注意力汇聚等提出的因素所驱动。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型常被视为通用工具:你提出一个问题,它们便给出一个答案。多年来,研究人员一直知道,你提问的方式,特定的词汇、格式或风格,会极大地改变结果。一个能让某个模型显得才华横溢的提示词,可能会让另一个模型显得愚蠢;甚至对文本进行微小且毫无意义的改动,也会打乱哪些模型更“优秀”的排名。这种被称为“提示词-模型交互”(prompt-model interaction)的现象,在解决数学问题或编写代码的任务中已被广泛记录。然而,一个悬而未决的谜团依然存在:这种敏感性是属于模型执行任务时所使用的复杂机制,还是属于模型处理信息本身的一种基本属性?为了回答这个问题,科学家们需要观察模型在“无所事事”时的状态。他们需要观察机器在一种纯粹的、脱离任务的存在状态下的表现,剥离了指令、目标以及必须正确的压力。
一支独立的研究团队决定通过移除任务本身来对此进行调查。他们没有要求模型解决问题,而是向其输入一段短文本序列,并观察当模型被迫在一个连续循环中预测下一个词、再下一个词时会发生什么。由于模型并非在进行随机采样,而是在遵循一种严格的、确定性的规则来选择概率最大的下一个词,这个过程就像一个球沿着山坡滚动,直到它落入一个山谷并停在那里。在某些情况下,球会滚入一个单一且稳定的山谷并永远停留在那;在另一些情况下,它可能会陷入循环或漫无目的地游荡。研究人员测量了模型的预测落入这种稳定状态的频率,并将此称为“不动点分数”(fixed-point fraction)。随后,他们测试了在序列开始前添加一段简短的前缀文本(仅九个单词或标记)时,这种行为会如何变化。目标很简单:看看微小的额外文本是否能从根本上改变模型的内部轨迹,即便在模型并未试图实现任何目标的时刻。
结果令人震惊,且超出了研究人员的预期。他们发现,提示词与模型之间的相互作用在这一脱离任务的读数中展现出了全力的冲击。仅仅添加九个标记的调节文本,就足以让测量的读数跨越其几乎整个可能的范围。对于某些模型,这微小的添加将混沌、游荡的预测模式转变为完美的稳定模式。对于另一些模型,它却恰恰相反,破坏了原本稳定的模式,使预测陷入循环。这种效应如此强大,以至于它可以完全改变模型行为的结构分类。为了直观理解,研究人员将这种转变与“指令微调”(instruction tuning)进行了对比,指令微调是一个大规模的训练过程,通常能将模型在标准基准测试上的性能提升超过六十个点。虽然这种重度训练显著提升了模型的任务表现,但它对这种特定的结构化读数却完全没有影响。相比之下,仅仅九个单词的前缀就能将模型的行为从一个极端翻转到另一个极端。这证明了提示词-模型交互不仅仅是模型遵循指令时的一个特性,它是模型阅读一段文本时的一种深层的、结构性的事实。
研究人员随后尝试解释为什么会发生这种情况,并提出了几种看似合理的自然理论。他们怀疑增加文本的长度是否是诱因,或者内容本身,无论是平铺直叙的散文还是格式化的代码,是否是驱动力。他们还考虑了这种效应是否具有普遍性,即它是否总是将模型推向相同的方向,或者它是否是某些特定类型模型(如经过指令训练的模型)的特有属性。他们严谨地测试了这些想法,从小组实验开始,随后扩大样本范围,以纳入更多样化的架构和文本类型。他们提出的五种具体分解(候选解释)在扩大样本后均告失败。该效应并非简单地取决于文本长度;事实上,这种关系并不平滑或可预测,有些模型会对增加一个单词产生剧烈反应,而另一些则对其视而不见。文本的内容也无法解释这一模式;对一个模型有效的做法在另一个模型身上往往失效,且变化的趋势会根据特定的文本与模型的配对而发生反转。甚至连“指令训练模型会抵御这些变化”的观点,在他们测试更多样化的文本后也被证明是错误的。
在所有这些解释消解之后,剩下的只有一个简单而顽固的现实:该效应属于特定的“提示词-模型对”,而非其中任何一个单独存在。一个固定的九词前缀可以驱动四种不同的模型走向完全稳定,同时将另外两种模型推向完全混沌。使一个模型的预测锁定在原地的同一段文本,却导致另一个模型的预测崩溃。这种行为在研究人员使用现实世界中的常见文本时依然存在,证明这并非使用奇怪或随机词汇产生的伪影。研究人员还观察了模型的内部机制,特别是模型对序列中第一个标记(token)的注意力程度。一种流行的理论认为,早期的标记充当了“汇点”(sink),吸收了模型的注意力并决定了最终结果。然而,当研究人员测量这一点时,该理论无法预测变化的趋势。在某些模型中,汇点增加,稳定性随之上升;而在另一些模型中,汇点增加,稳定性却骤降。这种机械论解释在处理现实世界文本时是成立的,但在他们用于探测的随机输入中却完全失效,这表明研究人员当时正处于该机械论理论不再适用的范畴内。
这项研究的结论是:这一现象的解释单元是提示词-模型对本身。不存在任何单一的规则(关于文本长度、内容或模型类型)可以预测特定模型对特定提示词的反应。研究人员发现,他们试图寻找普遍规则的尝试往往被一个微妙的错误所误导:即将一个无法变化的量应用了僵化的准则。例如,他们最初认为自己发现了一个所有模型都向同一方向移动的普遍趋势,直到意识到由于样本量过小掩盖了例外情况。通过扩大样本量并拒绝接受无法经受失败的模式,他们确保了研究结果的诚实性。最终的图景是深刻的特异性。模型阅读一段文本片段的方式,既不是模型的通用属性,也不是文本的通用属性。它是一种独特的交互,仅在特定的文本遇到特定的模型时才会涌现。研究人员邀请科学界继续对此进行测试,但在新的因素能够经受住同样的严苛样本扩充测试之前,答案仍然是:这种交互是一个针对特定配对的事件,难以进行简单的归类。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。