← 最新论文
💬 NLP

CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia

本文介绍了 CzechDocs,这是一个由捷克语及少数民族语言组成的格式化文档多路并行数据集,旨在评估并推进能够保留文档布局的机器翻译系统。

原作者: Josef Jon, Ondřej Bojar

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Josef Jon, Ondřej Bojar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你有一块装饰精美的蛋糕。蛋糕本身就是你想翻译的文本(即“口味”),而糖霜、蜡烛、小旗帜和精致的花纹则是格式标签(比如 HTML 代码、加粗文本或链接)。

长期以来,当计算机尝试翻译这些“蛋糕”时,它们经常会把蛋糕吃掉,忽略掉装饰,然后试图猜测该把蜡烛放回哪里。有时它们把蜡烛放在了糖霜里,有时放在了盘子上,有时甚至完全忘了它们。这使得最终的产品看起来凌乱且破碎。

CzechDocs 是由布拉格查理大学的研究人员开发的一个新工具,旨在解决这个问题。以下是他们所做的工作及发现的简单拆解:

1. 问题所在:“紧急蛋糕”

研究人员注意到了一种现实世界的需求。2022 年,当成千上万的乌克兰难民抵达捷克共和国时,出现了对政府网站、法律表格和健康指南进行翻译的紧迫需求。这些不仅仅是纯文本;它们是复杂的文档,带有按钮、链接和特定的布局。如果翻译破坏了布局,信息就会变得无法使用或难以阅读。

2. 解决方案:一个新的“蛋糕模具”(数据集)

团队构建了一个庞大的集合,包含 77 份独特的文档(如政府表格和教育指南),这些文档同时以多种语言存在。

  • 原料: 他们从真实的捷克网站中收集了这些资料。
  • 格式: 文档有三种形状:HTML(网页)、DOCX(Word 文件)和 PDF(印刷手册)。
  • 语言: 虽然主要侧重于捷克语和乌克兰语,但他们也包含了英语、越南语、俄语等其他语言。
  • 魔力: 他们仔细清洗了这些文档,确保每一句捷克语都有一个完美的匹配句子,且在其他语言中也包含完全相同的格式标签。这就像拥有一个大师级的蓝图,其中每一个蜡烛和糖霜旋涡在所有版本中都完美对齐。

3. 实验:如何烘焙这个蛋糕?

研究人员使用这个数据集来测试使用现代 AI(大语言模型)翻译这些“装饰蛋糕”的两种不同方法:

  • 方法 A:“剥离并重建”(脱标签与投影)
    想象一下,把所有的蜡烛和糖霜从蛋糕上取下来,把素面蛋糕交给面包师进行翻译,然后用机械臂尝试将蜡烛精准地插回原来的位置。

    • 结果: 这是传统的方法。它效果尚可,但机械臂有时会偏离目标。
  • 方法 B:“展示并讲述”(直接带标签输入)
    想象一下,把整个装饰好的蛋糕交给面包师,并对他说:“请翻译蛋糕的口味,但请务必让蜡烛和糖霜保持原样。”

    • 结果: 研究人员测试了 AI 是否可以直接观察整体并自然地完成任务。他们发现,如果你给 AI 一个特定的指令(提示词)让它注意保护装饰,它能做得非常出色。

4. 发现:谁烘焙出的蛋糕最好?

他们在数据集上测试了两个不同的 AI“面包师”(一个来自 OpenAI,一个来自 Cohere)。

  • 结论: 两种方法都表现良好,但各有千秋。
    • “剥离并重建” 方法在将装饰物放回正确位置方面非常一致,但有时文本本身的翻译质量会略逊一筹。
    • “展示并讲述” 方法(利用 AI 的自然能力)产生的文本翻译质量非常高。当研究人员给 AI 一个明确的指令要求“保留标签”时,它在不依赖机械臂后期修复的情况下,出色地完成了结构保留工作。
  • 惊喜: AI 并不需要经过专门的训练来做这件事;它只需要被清晰地告知该怎么做即可。

5. 下一步计划

研究人员已经发布了他们数据集中的“清洗后部分”(验证集),供其他科学家立即使用。他们保留了一个“秘密测试集”(最终考试),用于未来的竞赛,届时不同的团队将尝试看谁能最出色地翻译这些装饰文档。

简而言之: 他们构建了一个高质量的、多语言的真实世界文档库,旨在教会计算机如何在翻译文本的同时不破坏其格式。他们发现,只要你礼貌地要求 AI 保持装饰完整,现代 AI 在处理这类任务时表现得非常出色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →