← 最新论文
💬 NLP

Researchers waste 80% of LLM annotation costs by classifying one text at a time

该研究证明,通过批量处理和变量堆叠策略,研究人员可在不显著降低编码质量的前提下,将大语言模型文本分类的 API 调用次数和成本减少 80% 以上。

原作者: Christian Pipal, Eva-Maria Vogel, Morgan Wack, Frank Esser

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Christian Pipal, Eva-Maria Vogel, Morgan Wack, Frank Esser

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给研究人员提供一份"省钱又高效的 AI 使用指南"。

想象一下,你是一位社会科学研究者,手里有 10 万条推特(Twitter)帖子,你需要让 AI 帮你给这些帖子打标签(比如:这是关于什么的?是支持还是反对?有没有解决问题?)。

🚫 过去的做法:像“单点外卖”一样浪费钱

以前,大家用大语言模型(LLM)做这件事时,习惯像点单点菜一样:

  • 一条推文发给 AI。
  • 问 AI 一个问题(比如:“这条推文支持 230 条款吗?”)。
  • 等 AI 回答完,再发下一条,再问下一个问题。

这就好比:你饿了,去餐厅点菜。你点一个菜,服务员跑一趟厨房,端上来,你吃完;再点下一个菜,服务员又跑一趟。

  • 后果:如果你要处理 10 万条数据,涉及 4 个不同的问题,你就需要叫服务员跑 40 万次
  • 代价:这不仅慢,而且极其昂贵。论文说,这种传统做法浪费了 80% 的预算。

✅ 新的发现:像“拼单”和“打包”一样聪明

研究人员(Christian Pipal 等人)做了一个大胆的实验,他们问:如果我们一次把很多条推文打包发给 AI,并且一次问它好几个问题,会发生什么

他们把这种做法称为"批量处理"(Batching)和"变量堆叠"(Variable Stacking)。

1. 批量处理(Batching):一次送一大盘菜

  • 做法:不再一次发 1 条推文,而是把 25 条 甚至 100 条 推文打包在一起,一次性发给 AI。
  • 比喻:就像你不再让服务员跑一趟端一个菜,而是直接点了一桌菜(25 个菜),让服务员一次性端上来。
  • 结果
    • 省钱:API 调用次数从 40 万次降到了 4 千次,成本直接砍掉 80% 以上
    • 质量:神奇的是,只要一次发的数量在 100 条以内,AI 的准确率几乎没有下降!就像服务员端来 25 个菜,每个菜的味道和单独端上来时一样好。

2. 变量堆叠(Variable Stacking):一次问所有问题

  • 做法:以前是问完“支持吗?”,再发一条问“是什么话题?”。现在,在同一个请求里,一次性问 AI 这 25 条推文的所有 4 个问题(相关性、立场、话题等)。
  • 比喻:以前是问:“这道菜辣吗?”(等回答)“这道菜贵吗?”(等回答)。现在是直接问服务员:“这桌菜里,哪些辣?哪些贵?哪些是素食?”
  • 结果
    • 只要一次问的问题不超过 10 个,AI 依然能回答得很准确。
    • 关键点:准确率下降不是因为“问题太多”或者“文字太长”,而是因为任务本身太复杂。就像让服务员同时记住 20 个菜的特殊要求确实很难,但如果只是记住 10 个,完全没问题。

🧪 实验细节:他们是怎么测试的?

研究人员找了 8 个 目前最火的 AI 模型(来自 OpenAI、Google、Anthropic 等公司),用 3962 条 已经由人类专家打好标签的推文做测试。

  • 测试范围:他们尝试了一次发 1 条到 1000 条不等的数量,也尝试了一次问 1 个问题到 25 个问题。
  • 发现
    • 大多数模型在“一次发 100 条”时,表现依然完美。
    • 只有少数几个特定的模型(比如 OpenAI 的某些“推理型”小模型)在数量太大时“晕头转向”,准确率暴跌。
    • 结论:只要选对模型,并且控制好在“安全范围”内(一次 25-100 条,一次问 10 个问题),省下的钱比 AI 可能犯的一点点小错误还要多得多

💡 这对普通人意味着什么?

这篇论文告诉我们要打破思维定势

  1. 不要“单线程”工作:在让 AI 处理大量数据时,不要一条一条地发,要打包发送
  2. 不要“单问单答”:不要一个问题一个问题地问,要把问题列个清单一次性问清楚。
  3. 安全区:只要你的批量大小在 100 以内,问题数量在 10 个以内,你就在“安全区”里。在这个范围内,AI 的准确率几乎和人类专家一样稳,但成本却只有原来的 20%

一句话总结
以前用 AI 做研究像是在用金条买面包(一次只买一个,还贵);这篇论文告诉你,其实可以像去超市批发一样(一次买一袋,便宜又高效),而且买回来的面包味道完全一样好

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →