← 最新论文
💻 computer science

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

本文介绍了 Qianfan-OCR,这是一个 40 亿参数的端到端视觉语言模型,通过引入“布局即思考”(Layout-as-Thought)机制在统一架构中实现了从图像到 Markdown 的直接转换及多样化的文档理解任务,并在多项权威基准测试中取得了领先或具有竞争力的性能。

原作者: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu
发布于 2026-03-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你手里有一堆杂乱无章的文档:有的满是数学公式,有的是复杂的财务报表,有的还是手写笔记。以前,要处理这些文档,我们得像流水线工厂一样,把任务拆成好几步:先派一个“侦探”去画框框(找哪里是文字、哪里是表格),再派一个“翻译官”去认字,最后再请一个“分析师”来理解内容。

这就像做一道复杂的菜:你得先切菜(布局分析),再洗菜(文字识别),最后炒菜(理解内容)。如果切菜的人手抖了,后面的厨师再厉害,菜也做不好。而且,中间环节太多,不仅慢,还容易把菜里的“原汁原味”(比如文字之间的空间关系、图表的布局)给弄丢了。

Qianfan-OCR 就是百度团队推出的一个**“全能大厨”**。它不需要流水线,一个人就能搞定从“看菜”到“出锅”的全过程。

🍳 核心亮点:一个大脑,三种技能

这个模型只有 40 亿参数(在 AI 界算个“精干”的体型),但它把**“找位置”、“认字”和“懂内容”**这三种技能完美融合在了一起。

1. 它是“端到端”的(End-to-End)

以前的系统像接力赛,第一棒跑丢了,后面就全完了。Qianfan-OCR 像个人全能运动员,直接看着图片,脑子里过一遍,直接输出整理好的 Markdown 格式文档(就像直接给你一份排版完美的 Word 文档)。

  • 好处:速度快,不会在传递过程中丢失信息,而且它记得住文字在图片里的“家”在哪里(空间关系)。

2. 它的独门秘籍:“思考即布局”(Layout-as-Thought)

这是这篇论文最酷的地方。
以前,让 AI 直接输出结果,遇到那种**“文字、图片、表格混在一起”**的复杂试卷或报告时,AI 容易晕头转向,把表格里的数字读错,或者把两栏文字读串了。

Qianfan-OCR 引入了一个**“思考模式”**(就像你在做数学题前先打草稿):

  • 普通模式:直接输出答案。适合简单的文档(比如纯文本)。
  • 思考模式:当遇到复杂文档时,AI 会先在心里(或者在输出里)画一张**“思维导图”**。它会先说:“哦,这里有个标题,那里有个表格,那个图在左边,文字在右边……"(生成结构化的布局信息),然后再开始写最终答案。

打个比方
这就好比你要整理一个乱糟糟的衣柜

  • 普通 AI:直接伸手去抓衣服,容易把袜子塞进衬衫里。
  • Qianfan-OCR(思考模式):先花 1 秒钟把衣柜里的东西分类摆放好(“这是衬衫区,那是裤子区”),然后再把衣服整齐地拿出来。虽然多花了一点点时间,但出来的结果井井有条,绝不混乱

3. 它是个“多面手”

它不仅能认字,还能:

  • 读图表:看懂复杂的统计图,告诉你“这个数据为什么上涨”。
  • 做问答:看着合同问你“违约金是多少?”。
  • 提取关键信息:从一堆发票里自动把“金额”、“日期”、“商家”挑出来。

🏆 战绩如何?

在最新的“考试”(基准测试)中,Qianfan-OCR 的表现非常亮眼:

  • 全能榜第一:在专门测试文档理解的 OmniDocBench 上,它拿到了 93.12 分,是所有“端到端”模型里的第一名,甚至把很多传统的“流水线”老大哥也甩在了身后。
  • 中文更强:在处理中文文档、手写体和复杂表格时,它比那些几百亿参数的超级大模型(比如 Qwen3-235B)还要准,而且反应更快。
  • 性价比极高:它只有 40 亿参数,却能在单张显卡上跑得飞快,处理速度(每秒处理页数)和那些庞大的流水线系统差不多,但部署起来简单多了。

💡 为什么这很重要?

以前,如果你想让电脑看懂复杂的文档,你得买一套昂贵的软件,还要请一堆工程师去维护那个复杂的“流水线”。

现在,Qianfan-OCR 就像是一个**“瑞士军刀”。你只需要把它放在那里,给它一张图,它就能自动判断**:“这张图很简单,我直接读;那张图很乱,我先思考一下再读。”

它证明了:不需要把任务拆得支离破碎,一个聪明的、能“边想边做”的 AI,就能把文档处理得既快又准。

总结一下:Qianfan-OCR 就是一个会“打草稿”的超级文档管家。它不再需要繁琐的流水线,而是用一种更聪明、更灵活的方式,把混乱的纸质文档瞬间变成整洁、可搜索、可理解的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →