Just Pass Twice: Efficient Token Classification with LLMs for Zero-Shot NER
该论文提出了“仅需两次传递”(Just Pass Twice, JPT),这是一种使因果大语言模型能够实现高效、最先进的零样本命名实体识别的方法,它通过将输入文本进行拼接以允许完整的双向上下文,从而在无需改变架构的情况下克服自回归生成的局限性,并实现了超过 20 倍的推理加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言是一个由语境交织而成的网络,其中单个词汇的含义往往完全取决于其后出现的词汇。以“Paris”这个词为例,如果你在句首遇到它,你的大脑还不知道它指的是法国首都,还是指那位发布了新专辑的音乐家。为了消除这种歧义,你必须阅读整个句子。几十年来,计算机一直在努力解决同一个问题。传统的寻找文本中人名、地名和组织机构名称的工具是向后看的,它们逐个分析出现的单词。它们无法预见未来,因此当关键线索出现在句子后半部分时,它们经常会判断错误。与此同时,最新型且最强大的计算机语言模型虽然能理解海量的人类知识,但它们是为生成文本而设计的,而非为了标注文本。它们同样被迫只能向后看,这使得它们在被要求识别一段文本中的特定词汇时,速度缓慢且容易出错。
WitnessAI 的一个研究小组发现了一种方法,可以在不改变底层设计的情况下,赋予这些强大的模型“全局观”的能力。他们将这种方法称为“只需通过两次”(Just Pass Twice)。这个解决方案简单得令人惊讶:与其只向计算机模型输入一次句子,不如连续两次输入相同的句子。第一次,模型正常阅读句子;第二次,它再次阅读完全相同的句子。由于模型的设计初衷是记住它目前所看到的一切,第二次阅读让每一个单词都能“回看”第一次阅读中的全部内容。这意味着,当模型在第二次处理过程中分析“Paris”这个词时,它已经能够看到第一次处理中出现在后面的词汇“new album”(新专辑)。这种技巧有效地让模型能够一次性观察整个句子,从而使其能够对每个词的含义做出精确的决策,同时其运行速度比之前的最佳方法快了二十倍以上。
研究人员在各种任务中测试了这种方法,这些任务要求计算机识别不同领域(如音乐、政治和科学)中的特定信息类型,例如人名、组织机构和地点。他们发现,通过将这种“双重阅读”技术与对每种实体类型的清晰书面定义相结合,模型的准确率变得极高。在测试中,它的表现显著优于现有的最佳方法,平均准确率提升了近八个百分点。对于这项已被研究了几十年的任务来说,这是一个巨大的性能飞跃。该模型不仅仅是猜得更准,它对语境的理解也更深。例如,它可以通过依赖提供的具体定义,而非仅仅依靠记忆一份名单,来区分“人”与“政治家”或“国家”与“组织”。
这项发现之所以特别引人注目,是因为它规避了人工智能中常见的权衡取舍。通常情况下,提高模型的准确性需要增加其复杂性或降低其速度。生成式模型(即逐字生成文本的模型)速度较慢,因为它们必须等待每个词写完后才能进行下一个词。判别式模型(即仅对单词进行标注的模型)速度很快,但往往缺乏最新、最大规模模型的深度理解力。“只需通过两次”的方法弥合了这一差距。它允许一个拥有丰富知识的大型模型执行快速、精准的文本标注工作。研究人员在没有改变模型架构或需要从头开始重新训练的情况下实现了这一点。他们只是改变了输入方式,通过复制文本,使模型能够以单次、并行的计算爆发式处理,而非缓慢的顺序处理。
这项工作的意义不仅限于在文本中寻找名称。它表明,现代语言模型的局限性并不总是源于智能不足,有时而是源于它们被要求工作的方式。通过找到一种让这些模型观察句子完整语境的方法,研究人员释放了更高水平的效率和准确性。他们的方法不是魔术,也不是复杂的算法改造;它是一种简单的调整,以一种全新的方式利用了模型现有的能力。结果是一个既更快又更聪明的系统,能够以一种此前此类工具无法企及的精准度来处理人类语言的细微差别。这种方法表明,人工智能的前进之路并不一定总是需要建造更大或更复杂的机器,而是要寻找更简单、更优雅的方式来使用我们现有的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。