← 最新论文
💬 NLP

Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity Recognition

本文表明,将上下文学习扩展到数百个示例能够使大语言模型在命名实体识别任务中达到或超越全监督的 BERT 性能,同时也能作为一个有效的数据标注框架,显著提升低资源命名实体识别模型的性能。

原作者: Qi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard Dragut

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Qi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard Dragut

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:通过展示示例来教机器人阅读

想象你有一个非常聪明的机器人(大语言模型,简称 LLM),它虽然懂得如何阅读,但从未被专门教过如何在句子中寻找人名、地名或组织机构名。通常情况下,为了教会机器人这项技能,你必须雇佣一个由人类教师组成的团队来编写数千个示例,并对它们进行完美的标注,然后花费数周时间在这些示例上进行“训练”。这既昂贵又缓慢。

这篇论文提出了一种不同的方法:与其只说,不如展示(Show, Don't Just Tell)。

研究人员并没有重新训练机器人的大脑,而是简单地在机器人阅读新句子之前,向它展示数百个示例。这被称为上下文学习(In-Context Learning, ICL)。论文提出了一个问题:如果我们不只给机器人看 5 个例子,而是同时展示 100 个、200 个甚至 500 个例子,会发生什么?

主要发现:示例越多 = 机器人越聪明

研究人员发现了一个令人惊讶的趋势:展示给机器人的示例越多,它的表现就越好。

  • 旧方法(少样本学习/Few-Shot): 给机器人看 5 个例子就像是给学生一张快速参考的小抄。这很有帮助,但学生仍然会犯错。
  • 新方法(多样本学习/Many-Shot): 给机器人看 100 多个例子就像是在考试前给学生一整章教科书来学习。机器人不仅仅是“猜”得更准了;它对模式的学习如此透彻,以至于其表现甚至优于那些在数千个由人工标注的示例上训练了数周的机器人。

类比: 把机器人想象成一名新员工。

  • 微调(旧方法): 你雇佣一名培训师,花一个月的时间教员工工作的每一项规则。
  • 多样本上下文学习(新方法): 你让员工坐下来,递给他一叠 100 份填好的表格,并说:“看看这些是怎么做的,然后填写这一份新的。”员工无需经过一个月的培训,就能立刻掌握窍门。

问题所在:机器人运行缓慢且成本高昂

虽然“多样本(Many-Shot)”方法在获取答案方面效果极佳,但它有一个弊端。每当你想要机器人阅读一个新的句子时,你都必须再次把那 100 多个示例喂给它。

  • 类比: 这就像是请一位图书管理员找书。如果你每次问他要找哪本书时,都必须递给他一本 100 页的历史书,那么这不仅耗时,而且成本很高。你无法在处理成千上万份文档时实时这样做。

解决方案:“标注工厂”(ICA)

为了解决速度和成本问题,研究人员构建了一个名为**上下文标注(In-Context Annotation, ICA)**的框架。

他们不是让机器人在实时处理文档时进行阅读,而是将其作为一名离线工厂工人

  1. 准备阶段: 他们给了机器人大约 100 个由人工标注的示例作为“种子”(这个“种子”就像是蓝图)。
  2. 工厂运作: 机器人利用这 100 个种子来阅读数千份未标注的文档,并自行进行标注。
  3. 质量控制: 有时机器人会犯错。研究人员增加了一个“质量控制”步骤,让机器人检查自己的工作、修正错误,并对最佳答案进行投票(就像是一个机器人委员会在互相评审)。
  4. 结果: 现在他们拥有了一大堆高质量的、已标注的数据。
  5. 部署: 他们利用这些新数据来训练一个小型、快速、廉价的机器人(例如 BERT)。

类比:

  • 第一步: 你雇佣一名高薪、动作缓慢的专家(大型 LLM)来标注 2,000 份文档。你给了他们一些示例作为开端。
  • 第二步: 专家完成了工作,反复检查自己的错误,最后交给你一份完美的数据库。
  • 第三步: 你解雇了这位昂贵的专家。你利用这个完美的数据库,教一名快速、廉价的实习生(小型 BERT 模型)如何胜任这份工作。
  • 第四步: 现在,当你需要阅读新文档时,你使用的是那位快速、廉价的实习生。它是即时的,而且几乎不需要成本。

用通俗语言总结的关键发现

  1. 规模化有效: 展示给大机器人的示例越多,它就越聪明。在 100 个示例左右时,它达到了一个“甜点位(Sweet Spot)”,此时它的准确度变得极高。
  2. 人工投入极低: 你只需要大约 100 个人工标注的示例就能让整个系统运转起来。与通常需要的数千个示例相比,这只是极小的工作量。
  3. 超越顶尖水平: 在低资源任务中,利用“工厂制造”的数据训练出的小型机器人,表现比目前最优秀的方法还要高出约 10%
  4. 精炼至关重要: “质量控制”步骤(即机器人修正自身错误的过程)至关重要。具体而言,一种被称为“错误感知精炼(Error-Aware Refinement)”的方法(即教机器人去寻找特定类型的错误,如“缺失名称”或“错误名称”)带来了最大的提升。

总结

这篇论文表明,我们不需要花费数月时间在海量数据集上训练机器人。相反,我们可以将一个强大、聪明的机器人作为一个临时的老师。通过向它展示数百个示例,它可以为一个小巧、快速的机器人生成高质量的训练数据。这个小型的机器人随后成为了我们在现实世界中真正使用的工具,让我们能以极少的人力投入和极低的成本,获得极高的性能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →