✨ 要点🔬 技术摘要
想象一下,你拥有一支神奇的画笔,只要你描述,它就能画出任何东西。如果你说“一只坐在地毯上的猫”,它能完美完成。但如果你要求它画“分子 A 分解为 B 和 C 的化学反应”,或者“展示罗马帝国确切日期的历史时间轴”,这支神奇的画笔往往会感到困惑。它可能会画出一幅漂亮的画,但其中的科学或历史内容可能是错误的。这就像一位擅长画风景画,却看不懂地图或数学教科书的艺术家。
论文 “DisciplineGen-1M” 为这个问题提出了一个解决方案。以下是对他们所做工作的简单拆解:
1. 问题所在:“好看但错误”的陷阱
目前的 AI 图像生成器就像是见过数百万张照片的天才艺术家。它们非常擅长制作逼真且美观的事物。然而,它们在处理学术图表 (如数学图表、生物细胞或乐谱)时却表现挣扎。
问题在于: 在一张普通的照片中,如果一棵树看起来稍微有点偏差,也没关系。但在化学图表中,如果一个原子放错了位置,整个绘图在科学上就毫无用处了。
差距: 缺乏足够大的“正确”学术图像库来教会 AI 如何掌握这些细节。
2. 解决方案:构建一个庞大的“教科书”库
该团队构建了 DisciplineGen-1M ,这是一个包含 120 万 个示例的数据集。你可以把它想象成不是一个相册,而是一个巨大的、有组织的说明书 库。
里面包含什么? 它涵盖了 10 个学科:数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐和体育。
目标: 教会 AI 不仅仅是“如何画”,还要知道“画什么”,从而确保事实是正确的。
3. 他们是如何构建的:四种不同的“施工队”
你不能直接从互联网上抓取照片,因为那些照片往往很杂乱或错误。因此,团队使用了四种不同的方法来构建他们的库,就像四支专业的施工队一样:
施工队 1:矢量建筑师 (SVG & TikZ)
类比: 他们不是在画画,而是在编写用于绘图的计算机代码。
工作原理: 他们使用代码(如 SVG 或 TikZ)来生成完美的图表。因为是代码,他们可以更改一行代码(例如“移动这个箭头”)并立即得到一张新的、完美对齐的图片。这确保了数学和几何的 100% 准确性。
施工队 2:OCR 编辑员 (文本遮盖)
类比: 就像一个“找 Waldo”的游戏,你把答案盖住。
工作原理: 他们获取教育类图像,使用工具找到所有文本标签,然后将它们“擦除”(遮盖)。AI 学习观察空白区域,并根据上下文填入正确的标签。
施工队 3:筛选员 (清理网络内容)
类比: 淘金而非捡沙。
工作原理: 他们从互联网上提取了数百万张图像,并使用智能过滤器丢弃掉那些糟糕的图像(如模糊的照片或文本密集的页面),只保留清晰、结构化的图表,使其看起来像教科书插图。
施工队 4:程序员 (专业引擎)
类比: 使用专门的工厂机器来制造特定部件。
工作原理: 对于像化学分子、乐谱或国际象棋棋盘这类复杂的东西,他们编写了专门的计算机程序从头开始生成图像,确保遵循每一条规则(例如有效的国际象棋走法或正确的音符)。
4. 结果:一位更聪明的 AI 艺术家
利用这个新的库,团队训练了一个新的 AI 模型。
测试: 他们让 AI 参加了关于数学、科学和历史的“考试”(基准测试)。
结果: 这个新的 AI 比之前的开源模型得分更高。它不仅制作了漂亮的图片,还制作了事实正确 的图表。
例子: 如果被要求画出特定的化学结构,它能正确处理连接;如果被要求编辑历史地图,它能正确放置边界。
额外收获: 有趣的是,这种训练也帮助 AI 在通用任务(如理解图像中的因果关系)上变得更好,这表明学习严格的规则有助于它提升整体思维能力。
总结
把 DisciplineGen-1M 想象成一本为 AI 准备的庞大、高质量的教科书和练习册 。以前,AI 艺术家就像是通过看随机照片来学习绘画的人。现在,它们拥有了一套结构化的课程,教会了它们科学、数学和历史的规则。论文声称,这是让 AI 从仅仅制作“漂亮”图像转向制作“有用且正确”的知识型图像的关键。
该团队承诺将分享他们用于构建此库的库和代码,以便其他研究人员也可以使用。
技术摘要:DisciplineGen-1M
问题陈述
目前的图像生成与编辑模型在生成具有美感的自然图像方面取得了显著成功。然而,在处理知识密集型图表 (例如数学、物理、化学、生物学等领域)的生成或编辑任务时,这些模型仍然不够可靠。在这些学科语境下,正确性取决于精确的符号结构、空间关系和学术概念,而非仅仅是视觉上的合理性。符号、标签或分子基团的一个微小错误都可能导致整个结果失效。
现有的图像生成与编辑数据集主要侧重于自然图像、艺术品或通用世界知识(如 WISE、RISE)。虽然存在一些专门的数据集(如 StructVisuals、TextAtlas5M),但它们往往缺乏多学科覆盖范围 、联合文本生成图像(T2I)与编辑监督 ,或显式的推理与知识标注 。目前极度缺乏大规模、结构化的数据集来训练模型处理学术视觉创作中的严苛约束。
方法论
1. 数据构建:DisciplineGen-1M
作者引入了 DisciplineGen-1M ,这是一个包含 120 万个样本 的百万级数据集,涵盖十个学科:数学、物理、化学、生物、地理、计算机科学、经济学、历史、音乐和体育。该数据集同时支持 T2I 生成与图像编辑。
为了应对学术图像的异质性,作者设计了一个结合四种互补流水线的可扩展框架:
矢量图形渲染(SVG 与 TikZ):
SVG 分支: 用于生物、物理和经济学。它构建了映射到模板的结构化语义实例(节点、关系、曲线)并渲染为 SVG。这实现了确定性的重新渲染以及对语义编辑(例如移除标签、移动曲线)的显式控制。它还利用 Web 图像初始化,由 Gemini-3-Flash 从候选图像中生成 SVG 代码。
TikZ 分支: 针对生物、地理、物理、化学、CS 和经济学。它使用一个包含 1,346 个知识点的种子库,将其扩展为绘图蓝图并转化为可编译的 TikZ 代码。通过“编译器在环”(compiler-in-the-loop)修复过程来修正 LaTeX 错误,并使用视觉语言模型(VLM)评判员来过滤正确性、清晰度和完整性。通过将标签替换为占位符并重新编译来实现编辑。
基于 OCR 的编辑:
针对带有信息标签的教育类图表。使用 PP-OCR v5 提取文本实例和边界框。VLM 选择适合遮罩(masking)的区域(拒绝模糊或不重要的文本)。遮罩后的图像作为输入,原图作为真值(ground truth),并由 VLM 生成编辑指令。
大规模 T2I 数据过滤:
过滤开源教育图像池(如 K12、MV-MATH)。该流水线应用 pHash 去重、分辨率过滤和 OCR 预筛选,以移除以文本为主或依赖特定语言的图像。剩余图像由 Qwen3-VL-8B 根据学科相关性、图表性质、视觉复杂度和领域知识等维度进行评分。
专门的程序化合成:
在网络数据稀缺的领域使用特定领域的引擎进行数据合成。
数学: 使用 Matplotlib、MathCanvas、GeoGebra 进行函数图像、几何图形和立体变换。
化学: 使用 RDKit 和 Indigo 进行分子生成和反应方程式。
计算机科学: 使用 Graphviz 和 Matplotlib 生成树、图和有限状态机。
历史: 使用 Wikimedia Commons 和底图生成时间轴和地图。
音乐: 使用 IrishMAN ABC 曲调和 LilyPond 生成乐谱和钢琴卷轴。
体育: 使用国际象棋/象棋记录、围棋 SGF 以及营养数据进行棋类及战术分析。
2. 模型架构
基于 DisciplineGen-1M,作者引入了一个学科启发式推理生成模型 :
推理模块: Qwen3-VL-8B 将隐性的学科请求转换为显性的推理计划,识别相关的知识、目标元素和结构变化。
生成模块:
T2I: Qwen-Image-2512。
编辑: Qwen-Image-Edit-2511。
训练策略: 模型通过在 DiT 主干上使用 LoRA(低秩自适应)进行适配。训练采用带有动态分辨率加载的 FlowMatch SFT 损失。推理模块保持冻结,而图像生成器进行微调。
核心贡献
可扩展框架: 一种结合了矢量渲染、基于 OCR 的编辑、程序化合成和大规模过滤的新颖数据构建框架,用于产生高质量、结构化的学术视觉内容。
DisciplineGen-1M 数据集: 首个百万规模(1.2M)的多学科视觉生成数据集,涵盖十个不同学术领域的 T2I 与编辑,并带有结构化监督。
最先进的性能: 证明了利用该数据集适配开源生成器,可以在学科特定基准测试中取得开源模型中的 SOTA 结果,并在更广泛的推理任务中表现出显著的泛化能力。
实验结果
学科特定基准测试
GenExam (T2I 生成): 该模型实现了 51.4 的整体宽松得分(relaxed score),在开源模型中排名第一。它超越了 Qwen-Image-2512 15.6 分,并超过 FLUX.2 dev 8.5 分。这种提升在十个学科中是一致的,在化学、经济学、音乐、CS 和历史领域增益尤为显著。
GRADE (图像编辑): 编辑模型达到了 58.7 的整体宽松得分,超过了最佳开源基线(DreamOmni)14.4 分,并超过 Qwen-Edit-2511 28.7 分。其提升广泛分布于物理、化学、数学、地理、生物、CS 和历史领域。
通用推理基准测试
WISE (世界知识 T2I): 该模型得分为 0.66 ,优于 Qwen-Image-2512 0.16 分。在空间、生物、物理和化学类别中的提升最为强劲,表明结构化知识向涉及科学约束的世界知识任务的迁移。
RISE (推理驱动编辑): 该模型实现了 26.4 的准确率,优于 Qwen-Image-Edit-2511 7.0 分和 BAGEL (thinking) 10.8 分。其整体得分显著超过了最强的闭源基线,这主要得益于在时间、因果和空间推理方面的提升。
定性分析
视觉对比显示,与基线模型相比,所提模型能更好地保留关键的结构约束(例如分子连接性、图拓扑、音乐记谱法),而基线模型往往会产生视觉上合理但结构上错误的输出。
意义与主张
论文声称,大规模结构化学术视觉数据是实现从“美学合理性”向“可验证的知识驱动视觉创作”跨越的关键要素 。
作者断言:
在多学科、结构化数据上进行训练,不仅能提高视觉保真度,还能提高遵循学科特定约束(如符号表示、空间关系)的能力。
这种结构化监督带来的益处不仅限于特定的学术领域,还扩展到了通用的推理驱动生成与编辑,特别是在需要空间、因果或科学推理的任务中。
虽然开源模型与闭源模型之间仍存在差距,但 DisciplineGen-1M 显著缩小了这一差距,验证了显式知识约束和配对结构化监督对于学术视觉创作的效用。
作者公开发布了数据集、训练好的模型以及数据策展流水线的源代码,以确保可复现性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。