Spurious Prompts: Can Irrelevant Prompts Steer Large Language Models?
本文表明,语义无关的“虚假”提示可以系统地引导大语言模型提升任务性能或引发非预期行为,揭示了一种可通过黑盒搜索加以利用的新型提示敏感性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明但略带古怪的机器人助手。通常,要让它解决一道数学题,你会说:“请解这个方程。”要让它写一个故事,你会说:“写一个关于龙的故事。”这就是我们通常与人工智能交流的方式:我们给它清晰、相关的指令。
这篇论文发现了一件奇怪而令人惊讶的事:你实际上并不需要给机器人正确的指令就能让它工作。 事实上,你可以给它与任务完全无关的指令,它甚至可能比收到正常指令时更好地解决问题。
作者将这些称为“虚假提示(Spurious Prompts)”。
魔术技巧:“密码”类比
把人工智能模型想象成一架大钢琴。通常,要演奏一首特定的曲子(任务),你需要按下特定的琴键(任务指令)。
研究人员发现,如果你在钢琴上弹奏一段完全不同的、随机的旋律(关于调校竖琴琴弦或编织挂毯的提示),钢琴可能会意外地开始演奏你想要的正确曲子,有时甚至比你直接尝试演奏那首曲子时表现得更好。
提示语并没有说“解这道数学题”。相反,它可能会说:
“你是织机上六根不同丝线的编织者。设计师指定了一种图案。你必须选择形成该纹理的丝线。不要考虑织物的垂坠感。你的角色纯粹是结构对齐。一旦图案设定好,停止编织并陈述:[字母]。”
即使这段文字是关于编织的,里面没有任何数学词汇,但当你将数学问题与这个提示一起输入给人工智能时,人工智能往往能正确解出数学题。
他们如何发现这些提示
研究人员并非凭空猜测这些提示;他们使用了“黑盒搜索”(就像一场寻宝游戏,你无法看到宝箱内部,只能看到结果)。
- 生成器:他们让一个超级聪明的人工智能编写数百个奇怪、不相关的故事(关于灯塔、钟声或秘密档案)。
- 过滤器:他们丢弃了任何意外提及任务内容的故事(例如包含“数学”、“计算”或“诊断”等词汇)。
- 测试:他们用这些奇怪的故事测试人工智能,看看哪些能让它正确回答真实问题。
- 进化:他们选取最好的奇怪故事,稍加混合,再次尝试,逐渐将它们进化为“完美”的奇怪提示。
他们的发现
- 它有效:这些不相关的提示通常能让人工智能表现得与标准指令(如“一步步思考”或“仔细解答”)一样好,甚至更好。
- 与长度无关:你可能会认为更长、更详细的提示效果更好。但这些“虚假”提示实际上比优化后的提示短得多,却依然胜出。
- 与含义无关:当研究人员检查提示的“含义”时,他们发现这些奇怪的提示与任务的相关性就像随机乱码一样低。人工智能并没有理解故事;它是对文本的结构或氛围做出反应。
- 它可以故意出错(或出错):研究人员还发现,他们可以利用这些提示强迫人工智能做愚蠢的事情,例如:
- 总是选择第一个答案选项(A),即使它是错的。
- 总是给出一个偶数作为答案。
- 故意给出问题的错误答案。
核心结论
这篇论文表明,大型语言模型(LLMs)对我们尚未完全理解的事物非常敏感。它们并不像人类阅读手册那样仅仅遵循我们话语的“含义”。相反,它们内部似乎隐藏着隐藏的“杠杆”。关于“调校竖琴”的提示可能会拉动一根杠杆,使模型更专注,尽管竖琴与数学问题毫无关系。
简而言之:这篇论文证明,你可以使用与任务完全无关的指令来引导强大的人工智能,有时,这些不相关的指令比显而易见的指令效果更好。这就像发现告诉厨师“擦亮银器”会让他们的汤比告诉他们“煮汤”味道更好一样。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。