← 最新论文
💬 NLP

Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction

本文介绍了超并行解码(HPD),这是一种新颖的算法,它通过利用输出序列的条件独立性来实现乱序并行令牌生成,从而加速属性值提取等任务的大语言模型推理,在保持质量不受影响的前提下,将推理时间和成本降低高达 13.8 倍。

原作者: Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位技艺高超的图书管理员(即人工智能),任务是填写一叠庞大的产品卡片。每张卡片上都有一系列待填写的空白字段,例如“屏幕尺寸”、“显示类型”和“分辨率”。

旧方法(自回归解码):
传统上,图书管理员会严格从上到下逐个填写这些字段。他们必须写完“屏幕尺寸”,甚至才能开始思考“分辨率”。尽管“屏幕尺寸”与“分辨率”毫无关联,但图书管理员被迫必须等待第一项任务完成后,才能开始下一项。这就像一条单行道,每辆车都必须等待前车完成移动后才能前行。由于图书管理员是顺序工作的,这种方式既缓慢又昂贵。

新方法(超并行解码或 HPD):
这篇论文介绍了一种巧妙的技巧,称为超并行解码(HPD)。作者们意识到,对于此类任务,答案实际上是相互独立的。知道屏幕尺寸并不会改变分辨率。那么,为什么要等待呢?

HPD 允许图书管理员同时处理所有空白字段。

以下是他们如何在不搞乱图书管理员大脑(即 AI 模型)的情况下施展这一魔法的技巧:

  1. “虚假”间隔:图书管理员被训练为通过观察单词的位置来理解顺序。HPD 通过在句子中制造“虚假间隔”来欺骗图书管理员。想象一下,图书管理员看到的列表中,第一个答案位于位置 1,但第二个答案被神奇地跳到了位置 10,第三个则跳到了位置 20。
  2. 填补间隔:因为图书管理员认为这些答案在句子中相距甚远,所以它同时编写它们也无妨。它可以在同一瞬间生成“屏幕尺寸”的首字母、“分辨率”的首字母以及“显示类型”的首字母。
  3. 流水线:在下一时刻,它同时填入这三个答案的第二个字母。它会持续这样做,直到所有字段都被填满。

“堆叠”红利:
论文还提到了第二种技巧,称为文档堆叠。想象一下,图书管理员不是填写一张卡片,而是被给予一叠 10 张卡片,并被要求同时为所有卡片填写相同的字段。HPD 将这种堆叠与“虚假间隔”技巧相结合。现在,图书管理员不仅仅是在一张卡片上填写 3 个字段,而是在 10 张不同的卡片上同时填写 3 个字段。这就像一条工厂流水线,突然通过并行处理多个产品而将速度提升了一倍。

结果:
该论文在现实世界的电子商务数据(如电视规格)上测试了这种方法。他们发现:

  • 速度:处理速度比旧方法快高达13.8 倍
  • 成本:由于速度快得多,运行成本降低了高达13.8 倍
  • 质量:答案的准确度与缓慢的旧方法一样。在某些情况下,它们甚至略胜一筹。

简而言之:
这篇论文并没有发明一位新的图书管理员,它只是发明了一种新的办公桌组织方式。通过重新排列“位置 ID"(座位号)并使用特殊的掩码来告诉图书管理员应该查看哪些单词,他们打破了“你必须一次只做一件事”的规则。这将一条缓慢的单行道变成了一条高速的多车道高速公路,为需要从数百万产品描述中提取数据的企业节省了巨大的时间和金钱。

重要提示:作者特别指出,这种方法适用于答案相互独立的任务(如产品属性)。他们并不声称这种方法适用于那些一个问题的答案严重依赖于前一个答案的任务(例如撰写复杂的故事或逐步解决数学问题)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →