← 最新论文
💻 computer science

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

本文介绍了 UniRec-0.1B,这是一个用于文本和公式识别的高效 0.1B 参数统一模型,它利用了一个全新的 40M 样本数据集、层级监督以及语义解耦分词器,在多个识别层级上实现了超越更大规模视觉语言模型的性能,并取得了显著的加速。

原作者: Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图阅读一份杂乱、复杂的文档——也许是一本带有数学题的教科书、一张手写便条,或者一篇科学论文。多年来,计算机一直试图通过使用巨大的、拥有“大脑”的模型来“阅读”这些内容,这些模型就像超级智能的图书管理员。这些模型非常庞大,参数量往往高达数十亿(你可以把这想象成时钟内部微小齿轮的数量)。问题在于,它们太重、太慢了,以至于难以在日常设备上运行,而且当文本和数学公式混合在一起时,它们经常会感到困惑。

于是有了 UniRec-0.1B,一个由复旦大学和字节跳动研究人员构建的微型机器人阅读器。它是一个“统一”模型,这意味着它能同时阅读纯文本和数学公式,但它极其轻巧,只有 0.1 亿个参数。为了让你有个直观的概念,这就像是将一艘巨大的货轮换成了一艘灵活的快艇。

重大发现:越大并不一定越好

研究人员在测试模型规模如何影响性能时,发现了一个非常有趣的现象。他们发现,对于阅读文本和公式的任务,让模型变得越来越大很快就会遇到一个“天花板”。一旦模型的规模达到约 0.1 亿参数,增加规模并不会带来多少帮助,只会让计算机运行得更吃力、更缓慢。

这就像是在尝试解决一个简单的数学题。你不需要一台拥有百万级处理器的超级计算机;一台标准的计算器就能胜任。事实上,论文显示,对于阅读文本和公式这类特定任务,性能在 0.1B 左右就达到了顶峰。超过这个规模,你只是在为额外的重量买单,却并没有得到更好的答案。与此同时,像阅读复杂表格这样的任务确实能从更大的模型中受益,但文本和公式的情况则不同。

秘诀:两大新招式

构建一个能与巨型模型抗衡的微型模型是非常困难的。研究人员必须解决两个棘手的难题:

  1. “我在哪儿?”问题(结构变异性): 文档是有层次的。有单个词、文本行,还有整个段落。微型模型经常会迷失方向,不知道自己看的是一个字母还是一个完整的句子。为了解决这个问题,团队使用了**层级监督训练(Hierarchical Supervision Training)**来教导 UniRec-0.1B。想象一下,你给机器人一张带有特殊标记的地图:一个标记代表“行结束”,另一个标记代表“段落结束”。这些标记帮助机器人理解页面的结构,这样它就不会只看到一堆乱码,而是理解这些词是如何组合在一起的。

  2. “双面间谍”问题(语义纠缠): 在计算机的世界里,单词“sum”既可以指数学公式中的加法,也可以仅仅是句子中“the sum of all things”(万物的总和)里的那个“sum”。大模型因为记忆力丰富,足够聪明,能够分辨两者的区别。但微型模型呢?它会感到困惑。它会认为“sum”永远是同一种东西。研究人员通过**语义解耦分词器(Semantic-Decoupled Tokenizer)**解决了这个问题。他们给了机器人两个独立的字典:一个用于纯文本,一个用于数学公式。现在,当机器人看到数学方程中的“sum”时,它会使用它的“数学字典”;当它在故事中看到“sum”时,它会使用它的“文本字典”。这防止了含义发生混淆。

数据:一座巨大的图书馆

为了教导这个微型机器人,研究人员不能只使用一些旧教科书。他们构建了 UniRec40M,一个包含 4000 万个样本的海量数据集。这个图书馆包括:

  • 3000 万个英文样本。
  • 1000 万个中文样本。
  • 纯文本、纯数学公式以及文本与公式混合在一起的内容。
  • 内容来源广泛:维基百科、科学论文 (arXiv)、手写笔记,甚至还有模糊的文档照片。

这个庞大的图书馆确保了机器人在现实世界中可能遇到的几乎每种类型的文档都有过“见识”。

结果:快速且准确

当他们对 UniRec-0.1B 进行测试时,结果令人惊喜。在一个名为 UniRec-Bench 的新基准测试中(该测试在字符、单词、行和段落等不同层级测试阅读能力),这个微型模型的表现与那些体积大它 10 到 30 倍的巨型模型一样出色,甚至更好。

  • 准确度: 它在阅读文本和公式方面超越或匹配了领先的模型,如 Dolphin-1.5 (0.3B) 和 PaddleOCR-VL (0.9B)。
  • 速度: 这正是它真正闪光的地方。因为它如此之小,它的速度比大模型快 2 到 9 倍。在一项测试中,它仅用 6.2 秒就解析完了一整页,而一个较大的模型则需要 42.72 秒。这几乎是近 7 倍的加速。

论文明确排除了“我们需要通过不断做大模型来获得更好结果”的观点。相反,他们认为“分而治之”的策略更好:使用像 UniRec-0.1B 这样微型、专业且超快的模型来处理文本和公式,而只在处理像复杂表格这样真正困难的任务时才使用更大的模型。

总结

UniRec-0.1B 证明了你不需要一个巨大的大脑也能有效地阅读文档。通过使用聪明的训练方法和巧妙的词汇组织方式,一个微型模型可以比巨型模型更快、更准确地阅读文本和数学。它提醒我们,有时候,最精巧的工具才是最强大的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →