Researchers waste 80% of LLM annotation costs by classifying one text at a time
该研究证明,通过批量处理和变量堆叠策略,研究人员可在不显著降低编码质量的前提下,将大语言模型文本分类的 API 调用次数和成本减少 80% 以上。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给研究人员提供一份"省钱又高效的 AI 使用指南"。
想象一下,你是一位社会科学研究者,手里有 10 万条推特(Twitter)帖子,你需要让 AI 帮你给这些帖子打标签(比如:这是关于什么的?是支持还是反对?有没有解决问题?)。
🚫 过去的做法:像“单点外卖”一样浪费钱
以前,大家用大语言模型(LLM)做这件事时,习惯像点单点菜一样:
- 把一条推文发给 AI。
- 问 AI 一个问题(比如:“这条推文支持 230 条款吗?”)。
- 等 AI 回答完,再发下一条,再问下一个问题。
这就好比:你饿了,去餐厅点菜。你点一个菜,服务员跑一趟厨房,端上来,你吃完;再点下一个菜,服务员又跑一趟。
- 后果:如果你要处理 10 万条数据,涉及 4 个不同的问题,你就需要叫服务员跑 40 万次!
- 代价:这不仅慢,而且极其昂贵。论文说,这种传统做法浪费了 80% 的预算。
✅ 新的发现:像“拼单”和“打包”一样聪明
研究人员(Christian Pipal 等人)做了一个大胆的实验,他们问:如果我们一次把很多条推文打包发给 AI,并且一次问它好几个问题,会发生什么?
他们把这种做法称为"批量处理"(Batching)和"变量堆叠"(Variable Stacking)。
1. 批量处理(Batching):一次送一大盘菜
- 做法:不再一次发 1 条推文,而是把 25 条 甚至 100 条 推文打包在一起,一次性发给 AI。
- 比喻:就像你不再让服务员跑一趟端一个菜,而是直接点了一桌菜(25 个菜),让服务员一次性端上来。
- 结果:
- 省钱:API 调用次数从 40 万次降到了 4 千次,成本直接砍掉 80% 以上。
- 质量:神奇的是,只要一次发的数量在 100 条以内,AI 的准确率几乎没有下降!就像服务员端来 25 个菜,每个菜的味道和单独端上来时一样好。
2. 变量堆叠(Variable Stacking):一次问所有问题
- 做法:以前是问完“支持吗?”,再发一条问“是什么话题?”。现在,在同一个请求里,一次性问 AI 这 25 条推文的所有 4 个问题(相关性、立场、话题等)。
- 比喻:以前是问:“这道菜辣吗?”(等回答)“这道菜贵吗?”(等回答)。现在是直接问服务员:“这桌菜里,哪些辣?哪些贵?哪些是素食?”
- 结果:
- 只要一次问的问题不超过 10 个,AI 依然能回答得很准确。
- 关键点:准确率下降不是因为“问题太多”或者“文字太长”,而是因为任务本身太复杂。就像让服务员同时记住 20 个菜的特殊要求确实很难,但如果只是记住 10 个,完全没问题。
🧪 实验细节:他们是怎么测试的?
研究人员找了 8 个 目前最火的 AI 模型(来自 OpenAI、Google、Anthropic 等公司),用 3962 条 已经由人类专家打好标签的推文做测试。
- 测试范围:他们尝试了一次发 1 条到 1000 条不等的数量,也尝试了一次问 1 个问题到 25 个问题。
- 发现:
- 大多数模型在“一次发 100 条”时,表现依然完美。
- 只有少数几个特定的模型(比如 OpenAI 的某些“推理型”小模型)在数量太大时“晕头转向”,准确率暴跌。
- 结论:只要选对模型,并且控制好在“安全范围”内(一次 25-100 条,一次问 10 个问题),省下的钱比 AI 可能犯的一点点小错误还要多得多。
💡 这对普通人意味着什么?
这篇论文告诉我们要打破思维定势:
- 不要“单线程”工作:在让 AI 处理大量数据时,不要一条一条地发,要打包发送。
- 不要“单问单答”:不要一个问题一个问题地问,要把问题列个清单一次性问清楚。
- 安全区:只要你的批量大小在 100 以内,问题数量在 10 个以内,你就在“安全区”里。在这个范围内,AI 的准确率几乎和人类专家一样稳,但成本却只有原来的 20%。
一句话总结:
以前用 AI 做研究像是在用金条买面包(一次只买一个,还贵);这篇论文告诉你,其实可以像去超市批发一样(一次买一袋,便宜又高效),而且买回来的面包味道完全一样好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。