← 最新论文
💬 NLP

Prompt Stability Scoring for Text Annotation with Large Language Models

本文通过提出一种名为提示稳定性分数(PSS)的通用框架,解决了大语言模型文本标注对提示变异的脆弱性问题,该框架将传统可靠性指标加以适配以诊断稳定性问题,并包含一个用于实际实现的 Python 软件包。

原作者: Christopher Barrie, Elli Palaiologou, Petter Törnberg

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Christopher Barrie, Elli Palaiologou, Petter Törnberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对这篇论文的解读。

核心思想:你的 AI 是否“反复无常”?

想象你雇佣了一位非常聪明但有点神经质的助手,让他把一堆信件分类到“是”和“否”两个信封里。你给了他一条明确的指令:“如果信件提到金钱,就把它放进‘是’的堆里。”

你让他重复这个操作 30 次。

  • 情景 A: 他每次都把相同的信件放入相同的堆中。
  • 情景 B: 第 1 次尝试时,他把一封关于“储蓄”的信放进了“是”的堆里;第 2 次尝试时,他把同一封信放进了“否”的堆里;第 3 次尝试时,他又把它放回了“是”的堆里。

即使这位助手通常都是对的,情景 B 仍然是一个问题。这意味着他的决策是不稳定的。如果你无法信任他在完全相同的指令下保持一致,那么当你稍微改变措辞(例如,“如果信件谈到现金……")时,你更无法信任他。

这篇论文旨在构建一个测试,以便在你让 AI 助手处理任何实际工作之前,先检查它是稳定的(情景 A)还是反复无常的(情景 B)。


问题所在:AI 对“文字沙拉”过于敏感

作者解释说,大型语言模型(AI)不像计算器那样工作。它们不会在书中查找固定的答案。相反,它们像一个人猜测句子中的下一个词那样,逐个预测下一个词。

正因为如此,以下两点会破坏它们的一致性:

  1. “相同提示”问题: 即使你两次输入完全相同的指令,AI 也可能给出略有不同的答案,因为其计算机大脑中存在微小的、不可见的随机因素(就像背景中发生了一次抛硬币)。
  2. “改写”问题: 如果你只是稍微改变指令——比如把“分类这个”改成“整理这个”——AI 可能会感到困惑并给出完全不同的答案。

论文认为,准确率是不够的。即使 AI 在 90% 的情况下给出了正确答案,但如果你每次微调提示词它都会改变答案,那么你的研究结果就是不可靠的。

解决方案:“提示稳定性评分”(PSS)

作者开发了一个工具(一个名为 promptstability 的 Python 包),它充当你 AI 指令的压力测试

把它想象成测试一座桥梁:

  • 提示内稳定性(“重复”测试): 你在相同的数据上对完全相同的指令运行 30 次。该工具会检查:AI 每次给出的答案都一样吗? 如果答案跳来跳去,说明这座桥梁摇摇欲坠。
  • 提示间稳定性(“改写”测试): 你取你的指令,让另一个 AI 用 10 种不同的方式重写它(例如,“整理这些”、“分类这些”、“标记这些”)。然后,你在相同的数据上运行所有 10 个版本。该工具会检查:即使词语发生了变化,AI 是否仍然与自己保持一致?

该工具会给你一个分数(称为Krippendorff's alpha,这只是一个 fancy 的说法,意为“一致性评分”)。

  • 高分(接近 1.0): 太好了!你的指令很稳健。AI 表现一致。
  • 低分(低于 0.8): 警告!你的指令太脆弱了。措辞的微小变化就会破坏系统。

他们的发现(“压力测试”结果)

研究人员在六个不同的真实世界数据集上测试了这一点(例如美国政治推文、英国政党宣言和新闻文章)。以下是他们的发现:

  1. 简单即稳定: 当任务简单且数据清晰时(例如识别推文是来自共和党还是民主党),AI 非常稳定。无论你是否改写提示词,它都会给出相同的答案。
  2. 复杂即脆弱: 当任务困难或数据混乱时(例如判断推文是否使用“民粹主义”语言,或将调查答案归类到 12 个非常相似的类别中),AI 变得不稳定。提示词的微小变化会导致 AI 摇摆不定。
  3. “格式”陷阱: 有时 AI 并非真的困惑,它只是忘记了遵循格式规则(例如写了一段话而不是一个数字)。当研究人员过滤掉这些“潦草”的答案后,稳定性评分提高了。这让他们意识到,有时问题不在于 AI 的大脑,而在于它无法遵循严格的格式规则。
  4. 模型很重要: 他们将一个强大的 AI(GPT-4)与一个较小的开源模型进行了比较。强大的那个要稳定得多。这意味着“反复无常”并不总是你的错;有时你只需要一个更聪明的 AI。

“实战手册”:你应该怎么做?

这篇论文为研究人员提供了一份简单的指南:

  • 第 1 步:运行稳定性测试。 在你花钱或花时间验证结果之前,先运行 promptstability 工具。
  • 第 2 步:检查分数。
    • 如果分数:你可以放心继续。你的流程是稳健的。
    • 如果分数:停下!暂时不要相信你的结果。
  • 第 3 步:解决问题。
    • AI 是否忽略了格式?让提示词更严格。
    • 任务是否太模糊?让指令更清晰。
    • 数据是否太混乱?也许这个特定任务对 AI 来说太难,无法一致地处理。
    • AI 是否太弱?尝试使用更强大的模型。

底线

你不能仅仅因为 AI 给了你一个答案,就假设这个答案是可靠的。这篇论文提供了一份清单,以确保你的 AI 不仅仅是在随机猜测,或者对你的提问方式过于敏感。

稳定性是信任的基石。 如果你的 AI 在你用略微不同的方式提出同一个问题时无法与自己达成一致,那么你就无法信任它为你的研究提供的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →