← 最新论文
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

该报告针对法语文档构建了基于模型分歧采样的基准测试,提出了一种结合单元测试与类别归一化的评估方法,以克服现有基准对格式差异的过度惩罚,并评估了 15 个视觉语言模型在复杂法语 PDF 转 Markdown 任务中的表现,发现顶级专有模型在手写和表单处理上更具鲁棒性,而部分开源模型在标准打印布局上仍具竞争力。

原作者: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

发布于 2026-02-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“法国文档翻译官大比武”的评测报告**。

想象一下,你有一堆杂乱无章的法国文件:有的字迹潦草像天书(手写体),有的排版像迷宫(多栏报纸),有的表格密密麻麻像数据海洋,还有的甚至画满了复杂的图表。你的目标是把这些 PDF 图片,完美地转换成电脑能读懂、能搜索的 Markdown 格式(一种简单的文本格式)。

为了搞清楚现在的 AI 谁最厉害,作者们组织了一场“考试”,并发明了一套独特的“评分规则”。以下是用大白话和比喻对这篇论文的详细解读:

1. 为什么要搞这场考试?(背景与痛点)

  • 现状:现在的 AI(视觉语言模型)很聪明,能看图说话。但在处理文档时,它们经常犯一些“小毛病”。
  • 旧规则的尴尬:以前的考试(基准测试)太死板了。比如,AI 把“列表”写成了“段落”,或者换行位置稍微不一样,旧规则就会直接判错。这就像写作文,只要意思对了,但标点符号位置差了一个,老师就给你打零分,这显然不公平。
  • 新规则:作者们说:“别管那些无关紧要的格式细节,我们要看核心内容有没有丢,阅读顺序对不对,表格结构乱没乱。”他们设计了一套像“单元测试”一样的检查法,专门抓大错,放过小错。

2. 考卷是怎么出的?(数据集构建)

  • 题库来源:他们从 6 万份法国文档里挑题。
  • “找茬”选题法:他们让两个不同的 AI 先试着翻译同一份文档。如果两个 AI 翻译出来的结果大相径庭(比如一个说这是“苹果”,另一个说这是“橘子”),那就说明这张图很难,AI 们在这里容易“打架”。
  • 精选难题:他们专门挑这些让 AI 们“打架”的页面作为考题。
    • 题型包括
      • 蚂蚁字:字小得像蚂蚁,看不清。
      • 迷宫图:多栏排版,容易读错顺序。
      • 数据海:横跨整页的复杂表格。
      • 天书:手写体和历史手写信件。
      • 填表题:半结构化的表格,里面填了手写内容。
      • 看图说话:复杂的科学图表。

3. 谁参加了比赛?(参赛模型)

一共有 15 位选手 参赛,分为两大阵营:

  • 豪门战队(闭源商业模型):比如 Google 的 Gemini 系列、OpenAI 的 GPT 系列。它们通常很贵,但能力很强。
  • 草根战队(开源模型):比如 OlmOCR、PaddleOCR 等,大家都能免费用,但能力参差不齐。

4. 比赛结果如何?(核心发现)

  • 冠军是谁?

    • Google 的 Gemini 3 Pro 拿了第一,总分最高。它就像是一个经验丰富的老教授,无论是看潦草的手写体,还是处理复杂的表格,都稳如泰山。
    • Gemini 3 Flash 紧随其后,速度快一点,稍微弱一点点。
    • 开源界的“扛把子”:叫 Chandra 的模型表现最好,但在处理手写体时,还是比不过商业巨头。
  • 谁在“翻车”?

    • 很多小模型在手写体填表题上几乎交了白卷(得分接近 0)。这就像让小学生去解微积分,完全不在一个维度。
    • 有些模型(如 dots.ocr)有个怪毛病:它们太“洁癖”了,看到图就自动跳过。结果在现实文档中,很多重要的文字其实是嵌在图片里的,它们直接把这些内容漏掉了
  • 速度与质量的博弈

    • 快刀手:像 MinerUDocling 这样的模型,处理速度极快(不到 1 秒一页),但准确率一般,容易在复杂页面上“迷路”。
    • 慢工出细活:像 Chandra 这样的模型,虽然准,但慢(一页要 4 秒多),因为它是个“大块头”,思考得比较深。

5. 独特的“评分尺子”(评估方法)

这是这篇论文最创新的地方。他们不再用“字符串相似度”(比如两个句子有几个字不一样)来打分,而是用**“体检报告”**式的检查:

  • 文字存在性检查:关键的那句话,有没有出现在结果里?(有就及格,没有就挂科)。
  • 顺序检查:是不是先读左边再读右边?有没有把下半页的内容跑到上半页去?
  • 表格结构检查:表格里的数字有没有串行?
  • 宽容度:如果 AI 把“法国”写成了“法国(带个空格)”,或者把引号换了一种写法,不算错。只有当内容真的错了,才扣分。

6. 总结与启示

  • 结论:如果你要处理极其复杂、手写、排版混乱的法国文档,目前花钱买商业大模型(如 Gemini)是最稳妥的方案。开源模型在处理标准打印文档时已经很好用了,但在面对“脏乱差”的文档时,还需要努力。
  • 未来:作者希望这个“考试”不是一个死板的排行榜,而是一个活的社区资源。大家可以把新的难题、新的测试方法加进来,让 AI 们不断进化。

一句话总结
这就好比给 AI 们发了一套**“法国老式档案整理员”的入职测试**。结果发现,大厂请的“老专家”(商业模型)最能干,能搞定潦草字迹和复杂表格;而“实习生”(开源模型)在整理普通文件时很能干,但一遇到手写乱码就抓瞎了。 同时,作者还制定了一套更人性化的“录用标准”,不再因为标点符号的微小差异就刷掉人才。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →