Comparing Specialised Small and General Large Language Models on Text Classification: 100 Labelled Samples to Achieve Break-Even Performance
这项研究表明,专门的小型语言模型在文本分类任务上,仅需平均 100 个标注样本,即可达到与通用大型语言模型相当甚至更优越的性能,尽管所需的样本量会因任务特征的不同而显著变化,并且在考虑性能方差时会大幅增加。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一台电脑理解人类语言,具体来说,是让它进行文本分类(比如判断一段影评是“好”还是“坏”)。你有两种主要的工具可供选择:
- “全才型”巨头: 一个规模庞大、极其聪明的 AI(比如大语言模型),它几乎读遍了整个互联网。它非常强大,但运行起来需要消耗大量的电力。你只需给它一些例子或一个简单的指令,无需对其进行任何新知识的教学,就能让它完成工作。
- “专家型”小模型: 一个规模较小、成本更低的 AI,专门针对你的单一任务进行训练。它起步时掌握的知识较少,但你可以通过向它展示带有标签的示例来“教导”它。
这个核心问题是:你需要给这个“专家型”模型展示多少个例子,它才能变得比仅仅询问“全才型”模型来完成任务的效果更好?
以下是他们的研究结果,使用了简单的类比:
1. “盈亏平衡点”:100 个例子的法则
把“全才型”想象成一位世界名厨,只要你给他一份食谱,他就能烹饪任何菜肴(即提示词/Prompt)。而“专家型”则是一个当地厨师,需要针对你的特定菜肴进行培训。
研究人员发现,你并不需要雇佣一整支训练师军队。平均而言,你只需要向“专家型”展示大约 100 个例子(带标签的样本),它就能做得像那位世界名厨一样好,甚至更好。
- 注意点: 这个数字会根据“菜肴”(任务)的不同而变化。
- 如果任务很简单(比如将新闻分为 14 个不同的类别),100 个例子就足够了。
- 如果任务很棘手(比如一个简单的“是/否”问题或理解复杂的语法),“专家型”可能需要数千个例子才能赶上“全才型”。
2. “掷骰子”问题(方差)
想象一下,你请那位“全才型”厨师做 10 次饭。他每次做出来的味道都相当一致。现在,想象你用同样的 100 个食谱去训练那位“专家型”厨师。有时他能做出杰作;有时他却会把东西烧焦。这种不一致性被称为方差(Variance)。
研究人员发现,如果你只看平均结果,100 个例子似乎是那个神奇的数字。但如果你想确保“专家型”厨师总是能做好工作(考虑到那些“烧焦吐司”的糟糕情况),你需要更加保守。
- 现实检查: 当你考虑到这种随机性时,你需要的例子数量会增加 100% 到 200%。所以,与其说 100 个例子,你可能需要 200 到 300 个 才能保证“专家型”能够稳定地胜过“全才型”。
- 在某些非常棘手的案例中,“专家型”可能需要多出 3000% 的例子才能达到可靠水平!
3. 并不是越大越好
人们普遍认为“大即是好”。如果你有一个更大的“全才型”厨师(更大的模型),他们应该更聪明、更稳定,对吧?
- 研究发现: 不一定。研究人员发现,更大的模型并不总是表现得更好,或者表现得更稳定。有时,一个中等规模的模型实际上比一个巨大的模型做得更好。
- “量化”技巧: 你可以将这些巨大的模型缩小(就像把高分辨率照片压缩成较小的文件)。研究发现,这种“缩小”(4-bit 量化)几乎不会改变他们的烹饪水平或稳定性。因此,如果你想节省电费,可以放心使用这些“缩小版”而不损失性能。
4. 如何选择你的厨师(建议)
根据他们的实验,以下是实际的建议:
- 如果你符合以下情况,请使用“全才型”(零样本学习/Zero-Shot): 你需要快速原型设计、几乎没有标注数据,或者任务是关于创造新文本(如写故事)而非仅仅是分类。
- 如果你符合以下情况,请使用“专家型”(微调/Fine-Tuning): 你拥有相当数量的数据(大约 100+ 个例子)并且对运行计算机的预算有限。即使是一个小模型,只要你给予足够的训练示例,也能击败那个巨型模型。
- 如果你符合以下情况,请使用“指令微调”(Instruction-Tuning): 你拥有充足的计算能力预算。这是中间地带,你教导“全-才型”如何针对你的特定任务遵循指令。它在性能和数据效率之间提供了最佳的平衡。
总结
你不需要一个海量的数据库来训练一个小型的、专门的 AI 去击败一个巨大的、通用的 AI。通常 100 个例子就足够了。 然而,由于 AI 有时会有些不可预测(就像掷骰子一样),如果你想绝对确保小模型每次都能胜出,你应该计划收集两到三倍于此的量。另外,不要担心使用那些“缩小版”的大模型;它们的效果同样出色,而且能为你节省大量能源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。