Self-Improving In-Context Learning
本文提出了一种用于上下文学习的测试时校准方法,该方法通过最大化源自模型对数概率的自监督置信度代理来优化连续提示嵌入,从而在不进行微调、令牌生成或使用外部数据的情况下提升分类和生成任务的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位才华横溢但略显紧张的学生(即 AI 模型)正坐在考试桌前。在正式问题出现之前,老师会给学生提供几道示例题目及其答案(称为“演示”)。学生需要观察这些示例,找出规律,然后解答新问题。这被称为上下文学习。
问题在于,这位学生极其脆弱。如果你打乱示例的顺序,或者示例的表述略显笨拙,学生可能会感到困惑甚至失败,哪怕他们其实知道答案。
这篇论文提出了一种巧妙的技巧,旨在帮助学生在考试开始前表现得更好,而无需教给他们任何新知识,也无需改变他们的大脑。
核心理念:调校“心理氛围”
通常,当我们想要改进 AI 时,我们会:
- 教它新事实(微调):就像给学生一本全新的教科书。
- 挑选更好的示例(选择):就像找到最完美的练习题。
- 重新排列示例(排序):就像将练习题按最合乎逻辑的顺序排列。
这篇论文的做法则有所不同。它将提示(即示例)视为一种 AI 所感知的连续“氛围”或“感觉”,而非固定的文本。将提示想象成无线电频率。你读到的文字只是刻度盘上的标签,但 AI 实际“听到”的是其下方的静电噪声和信号强度(即数学嵌入)。
作者们意识到,即使在 AI 尝试回答新问题之前,它已经“思考”过这些示例了。它已经为这些示例的答案分配了置信度分数。
“自我提升”的技巧
以下是他们方法的逐步类比:
- 静默检查:AI 查看示例并低语:“如果我要回答这些示例,我会多么确定?”它并不实际写下答案,只是检查其内部的置信度。
- “轻推”:研究人员使用一种数学工具(称为零阶优化)来轻轻“轻推”“无线电刻度盘”(即提示的底层数学)。他们会问:“如果我把刻度盘向左微调一点点,AI 对示例的感觉会变得更确定吗?向右呢?”
- 攀登:他们持续向让 AI 对示例感觉更确定的方向轻推刻度盘。这本质上是在说:“嘿,AI,稍微调整一下你的注意力,让这些示例对你来说更有意义。”
- 结果:一旦 AI 对示例感到最大程度的确定,他们便向它提出真正的问题。由于 AI 现在对模式“调频”得更好,它能更准确地解决新问题。
为何这很特别?
该论文强调了该方法的三大超能力:
- 无需新知识:他们无需重新训练 AI 或向其输入新数据。他们只需微调现有提示的“设置”。
- 适用于任何任务:大多数先前的方法仅适用于多项选择题(例如“这是真还是假?”)。这种方法也适用于自由写作。无论 AI 需要选择一个字母还是写一首诗,这种“调校”都能提供帮助。
- 自我检查:该方法利用 AI 自身的置信度作为指南。这就像学生参加一次模拟测验,意识到自己对某些概念掌握不稳,便在心理上调整注意力,直到模拟测验感觉变得容易。一旦模拟测验感觉轻松,他们便着手应对真正的考试。
结果
研究人员在各种棘手任务上测试了这种方法,从复制模式到解决逻辑谜题。
- 结果:“调校”后的 AI 几乎总是表现得与原始 AI 一样好,甚至更好。
- 证明:他们发现了一个直接联系:每当 AI 对示例的“置信度分数”上升时,其实际测试分数也随之上升。这证明该方法并非仅仅在猜测;它实际上帮助 AI 更好地理解了任务。
简而言之
想象你正在调谐一台旧收音机以接收微弱的电台。你无法改变电台本身,也无法添加新的扬声器。但你可以转动调谐旋钮(即提示嵌入),直到静电噪声消失,音乐(即模式)变得清晰透彻。
这篇论文提供了一种方法,可以自动为 AI 找到那个完美的“转动”,使其在不需重返校园的情况下,变得更擅长遵循指令。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。