Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
本文提出了名为 Jagle 的迄今为止规模最大的日语多模态后训练数据集,该数据集包含约 920 万条通过多种策略生成的实例,实验证明基于该数据训练的模型在日语任务上表现优异,且能显著提升日语能力的同时保持甚至增强英语性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 Jagle 的新项目,它的核心目标是给人工智能(AI)“喂”一顿丰盛的日语大餐,让它能更聪明地理解日语图片和文字。
为了让你更容易理解,我们可以把训练 AI 想象成培养一个超级助手。
1. 为什么要造 Jagle?(背景与痛点)
想象一下,你想培养一个精通英语的超级助手。你很容易找到成千上万本英语的“看图说话”练习册(现有的英语数据集),把这些书汇总起来,助手就能学会各种技能,比如认路、看图表、读文档。
但是,如果你想培养一个精通日语的助手,情况就麻烦了。日语的“看图说话”练习册非常少,而且种类单一。这就好比你想教一个学生日语,但手里只有一本薄薄的字典,没有练习册,也没有丰富的阅读材料。结果就是,现有的日语 AI 助手虽然能看懂简单的图,但遇到复杂的图表、文档或专业场景时,就“晕头转向”了。
Jagle 的出现,就是为了解决这个“日语教材匮乏”的问题。
2. Jagle 是怎么做出来的?(核心方法)
以前的做法是“去图书馆借书”(收集现有的日语数据集),但日语书太少了。Jagle 的团队换了一种思路:“从零开始,自己造书”。
他们建立了一个智能流水线工厂,通过以下三种“魔法”来制造 920 万份练习题:
- 魔法一:AI 出题(VLM 生成)
他们找了一个已经很强的英语 AI(Qwen3-VL),给它看各种日语图片(比如日本街头的照片、维基百科的图),然后让这位 AI 用日语自己出题、自己写答案。就像让一个懂日语的机器人当老师,看着图片给学生出题。 - 魔法二:翻译与“变脸”(翻译 + 文本渲染)
他们把英语的图表题(比如“这个柱状图显示了什么?”)翻译成日语。更有趣的是,他们不仅翻译了问题,还把图表里的英文文字直接“变”成了日文。这就像把一本英文漫画书,不仅翻译了台词,还把里面的招牌、路牌都 P 成了日文,确保图文一致。 - 魔法三:OCR 提取(把字“抠”出来)
对于全是文字的 PDF 文档(比如政府公文),他们利用 OCR 技术把文字“抠”出来,然后生成问答。这就像把一份纸质文件扫描后,直接变成可以提问的电子题库。
最终,他们收集了920 万个这样的“图片 + 问题 + 答案”组合,涵盖了从日常照片、复杂图表到政府公文等各种场景。
3. 效果怎么样?(实验结果)
为了测试 Jagle 有没有用,研究人员训练了一个22 亿参数的 AI 模型(可以理解为中等体型的“大脑”)。
日语能力大爆发:
用 Jagle 训练出来的模型,在 10 个日语测试任务中的平均分,吊打了之前最强的开源日语模型(InternVL3.5-2B),甚至只比目前最强的商业模型(Qwen3-VL-2B)低了 5 分。
比喻:这就好比一个原本只能考 60 分的学生,吃了 Jagle 这顿大餐后,直接考到了 95 分,离满分学霸只有一步之遥。没有“顾此失彼”:
通常,教一个 AI 学太多语言,可能会让它英语变差(这叫“多语言诅咒”)。但 Jagle 的神奇之处在于,它让 AI 在日语变强的同时,英语能力反而还提升了!
比喻:这就像给一个学生加了一门日语课,结果不仅日语好了,他的英语阅读理解能力也跟着变强了,因为 Jagle 带来的数据多样性让他的思维更灵活了。
4. 总结与意义
Jagle 是什么?
它是目前最大的日语多模态(看图说话)训练数据集,拥有 920 万条数据。
它为什么重要?
- 打破垄断:它证明了即使没有现成的海量数据,通过巧妙的“制造”策略,也能为非英语国家(如日本、中国等)打造出顶级的 AI 模型。
- 开源共享:作者把数据、代码和训练好的模型都公开了,让全世界的研究者都能用,加速日语 AI 的发展。
一句话总结:
Jagle 就像是为日语 AI 建造了一座超级图书馆,里面不仅有书,还有无数本由 AI 老师亲手编写的习题集。有了它,日语 AI 助手终于能像英语助手一样,看懂复杂的图表、读懂深奥的文档,真正变得“博学多才”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。