← 最新论文
🤖 machine learning

ReconSpan: Reconstruction-Guided Adaptive Latent Tokenization

ReconSpan 是一种重构引导的自适应潜在标记化方法,它根据后向解码器从前缀重构文本块的能力,将文本分割成变长的块,在以牺牲精确细节恢复为代价的同时,实现了高效压缩并保留了主题信息。

原作者: Lixing Li

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Lixing Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位朋友讲述一个冗长而复杂的故事,但你一次只能低声耳语几个词。在人工智能的世界里,计算机也面临着类似的问题。它们并不像我们这样逐字逐句地阅读故事;相反,在开始思考之前,它们会将文本切分成被称为“Token”(标记)的微小、预设的块。这就像是一座图书馆强制要求每本书都必须被切割成正好 100 个单词的页面,无论句子是否结束,也无论新章节是否开始。这种方式虽然可行,但非常僵化。有时,计算机会在微小的、毫无意义的碎片上浪费能量;有时,它又会被一个过于庞大、难以一次性理解的块所压垮。科学家们一直试图构建更聪明的方法来切割文本——即根据故事在某一时刻的阅读难度来动态调整切割方式。这就是“自适应分词”(adaptive tokenization)的游乐场,其目标是让计算机能够决定:“好吧,这部分很简单,我会把它打包起来;这部分很棘手,我会放慢速度仔细观察。”

于是,康奈尔大学的研究人员提出了一种名为 ReconSpan 的新方法,它就像是一个非常严格、具有后向观察能力的 AI 编辑。它不是去猜测在哪里切割文本,而是使用了一个巧妙的技巧:尝试从一个块的末尾向开头进行“重构”文本。想象一下你有一个神奇的解码环,它一次只能记住几个单词。你对着一个句子问道:“你能记住最后几个词吗?”如果它回答“可以”,你就继续前进。但一旦它踉跄了一下并忘掉了一个词,你就停下来并说:“好了,这就是这一组的终点。”然后你将这个“踉跄点”保存为一个特殊的标记(潜在标记/latent token),并从刚才停下的地方重新开始。这意味着,简单的文本部分会被打包成长而高效的组,而困难、令人困惑的部分则会被分解成细小、谨慎的碎片。研究人员发现,这种方法创造的块平均长度在 6.512.2 个单词之间,具体取决于对“遗忘”规则的严格程度。

他们发现中最令人兴奋的部分是,这种方法在保留故事“大意”方面表现得惊人地好。当他们测试其他 AI 模型是否能通过阅读这些特殊的标记并告诉你故事的主题时,模型表现得非常出色。模型可以可靠地判断出主题,比如知道一个故事是关于“太空探索”还是“烹饪”的。然而,当涉及到细枝末节——比如记住某个角色的确切名字或一个特定的数字时——模型就显得力不从心了。这就像是 ReconSpan 方法是一个优秀的摘要撰写者,却是一个糟糕的笔记记录员。研究人员证明,与仅仅在相同长度的随机位置切割故事相比,这种基于智能、后向观察的边界保留了更多的原始文本。虽然该系统目前还不完美,还无法捕捉每一个细节,但它展示了一种极具前景的新途径,即通过让文本的难度来决定其如何被切分,从而让 AI 阅读得更快、更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →