← 最新论文
💻 computer science

Navigating the Prompt Space: Improving LLM Classification of Social Science Texts Through Prompt Engineering

本文表明,虽然系统地改变提示工程元素(如标签描述、指令引导和少样本示例)可以显著提高大语言模型对社会科学文本的分类准确率,但性能提升在超过最小限度的上下文增加后往往是微乎其微的,有时会随着上下文过多而下降,并且在不同模型和任务之间存在实质性差异,因此需要进行个体验证,而非依赖通用规则。

原作者: Erkan Gunes, Christoffer Florczak, Tevfik Murat Yildirim

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Erkan Gunes, Christoffer Florczak, Tevfik Murat Yildirim

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人图书管理员,它能瞬间阅读数百万本书并将其分类到书架上。这正是**大语言模型(LLMs)**对于社会科学家而言的模样。它们正被用于文本分类——比如将国会法案归类到政策主题中,或者判断一份调查问卷的回答是“情绪化的”还是“中立的”。

有一段时间,研究人员只是在问:“这个机器人能胜任这项工作吗?”答案是一个摇摆不定的“也许”。但现在,问题变成了:“我们如何给这个机器人提供最好的指令,让它能完美地完成工作?”这就是提示工程(prompt engineering)

把“提示词(prompt)”想象成你交给机器人的说明书。本文作者决定玩一场大规模的“如果……会怎样?”的游戏,针对这些说明书进行实验。他们并没有仅仅靠直觉猜测,而是用两个不同的机器人(GPT 4o 和 Gemini 2.0 Flash)以及两个不同的分类任务进行了一场大规模实验:

  1. 政策分类器:将 21 种不同类型的政府法案标题归入正确的政策类别。
  2. 情绪分类器:阅读开放式调查问卷的回答,并判断其是“情绪化的”还是“中立的”。

他们调整了说明书中的三个特定部分,以观察哪种方式效果最好:

  • 标签描述:是只给机器人一个书架名称列表(例如,“卫生”、“教育”),还是同时也写一段小段落来解释每个书架上应该放什么内容?
  • 指令引导:是否在给机器人的笔记中加入一些提醒,比如:“嘿,小心!关于堕胎的法案应该归入‘民权’,而不是‘卫生’!”?
  • 少样本示例(Few-Shot Examples):在要求它处理剩余任务之前,是否先向机器人展示几个已经正确分类好的法案示例?

大惊喜:并非越多越好

这是论文发现的最重要的一点,也带有一点情节反转。你可能会认为,在机器人的说明书中提供更多信息总会让它变得更聪明。论文表明事实并非如此。

事实上,作者发现,极小幅度的上下文增加(仅添加一点解释或示例)带来的性能提升最为显著。但如果你不断增加细节,机器人并不会变得更好。它会遇到一个瓶颈,即增加更多的文本只会带来微乎其微、几乎毫无意义的改进。

甚至更令人担忧的是,论文指出,有时增加更多的上下文反而会让机器人变差 这就像试图通过对着朋友大声喊出每一个线索来帮他解谜一样;最终,他们只会感到困惑并丢掉手中的碎片。

“批处理”技巧

研究人员还测试了机器人应该一次处理多少个项目。他们尝试了每次处理 1 个法案、10 个、100 个、500 个,甚至 1,000 个。

论文表明,每次只处理一个项目通常是最差的策略。这不仅是使用机器人的最昂贵方式,而且表现也不佳。相反,论文指出,批分类(batch classification)(即一次性给机器人一叠 100 或 500 个项目进行分类)通常是更优的选择。

“一刀切”的迷思

或许是最关键的一课是,你不能直接将一个项目的“完美提示词”复制粘贴到另一个项目中。论文表明,在不同模型、不同任务、甚至不同批次大小之间存在着实质性的异质性(一个高级词汇,意为“巨大的差异”)。

对政治法案分类完美的做法,在处理调查问卷情绪时可能会惨败。甚至同一个机器人,也会因为你提问方式的不同而表现得不同。因此,作者认为研究人员不能依赖通用规则。如果你想将这些机器人用于自己的研究,你必须进行针对自己特定任务的专门测试。

“零温度”之谜

最后,论文指出了这些机器人身上一些诡异的现象。即使研究人员将机器人的“温度(temperature)”(一个控制随机性的设置)设置为 ——这本应让机器人表现得像一个严格的、确定性的计算器——结果也并不总是完全一致。论文表明,即使使用完全相同的提示词,机器人的输出仍可能根据模型和提示词细节的不同而产生细微变化。这意味着,即使你试图强迫它保持一致,你也无法始终假设机器人两次给出的答案会完全相同。

核心结论

论文并未声称找到了让 LLM 完美的“魔法咒语”。相反,它建议通往更好结果的路径是细致、具体的测试

  • 不要假设提示词中的文本越多越好。
  • 不要如果可以批处理,就逐一处理项目。
  • 意识到适用于一个任务的做法并不一定适用于另一个任务。
  • 在信任结果之前,测试你自己的特定设置。

这提醒我们,虽然这些 AI 工具功能强大,但它们仍然有点像野马:你不能只是套上马鞍就能骑,你必须学会如何精准地驾驭这一匹特定的马,去完成这一场特定的骑行

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →