← 最新论文
💻 computer science

GenExam: A Multidisciplinary Text-to-Image Exam

本文提出了首个名为 GenExam 的多学科文生图考试基准,通过包含 10 个学科、1000 个样本及细粒度评分标准的严谨评估体系,揭示了现有开源模型在整合理解、推理与生成能力方面与领先闭源模型之间的巨大差距。

原作者: Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一个名为 GenExam 的全新“考试”,专门用来测试人工智能(AI)的画图能力

想象一下,如果 AI 不仅要会“做选择题”(理解题目),还要会“画解答题”(根据题目画出精确的图表),那它才算真正聪明。目前的 AI 大多擅长看图说话,或者画一些漂亮的风景画,但一旦让它们像人类专家一样,根据复杂的理科题目画出精确的几何图、电路图或化学分子式,它们就经常“翻车”。

GenExam 就是为了解决这个问题而诞生的。我们可以用以下几个生动的比喻来理解这篇论文的核心内容:

1. 什么是 GenExam?—— AI 的“高考”与“绘图竞赛”

以前的 AI 考试,就像让 AI 做填空题选择题(比如:“这张图里有什么?”)。
而 GenExam 则像是一场高难度的绘图考试

  • 题目像“高考题”:题目不是简单的“画一只猫”,而是像数学题:“画一个包含 7 个顶点的无向加权图,边 AB 权重为 3,边 AF 权重为 6……"或者化学题:“画出苯环经过一系列反应后的产物结构”。
  • 科目全:涵盖了数学、物理、化学、生物、历史、音乐等 10 个学科。
  • 有标准答案:每一道题都有“标准答案图”(Ground Truth),就像老师手里的满分试卷。

2. 怎么给 AI 打分?—— 像“阅卷老师”一样抠细节

以前的 AI 画图评价,可能只是看“像不像”或者“美不美”。但 GenExam 的评分标准非常死板且严格,就像一位拿着红笔的严厉阅卷老师

  • 细粒度打分(Scoring Points)
    老师不会只给个总分,而是把题目拆解成一个个小问题来检查。
    • 例子:如果题目要求画一个苯环,老师会问:“碳原子数是 6 个吗?”“双键位置对吗?”“氢原子标对了吗?”
    • 只要有一个原子画错,或者箭头方向反了,这道题的分数就会大打折扣。
  • 两个维度的考核
    1. 语义正确性(Semantic Correctness):内容对不对?(比如:化学方程式配平了吗?地图上的国家位置对吗?)
    2. 视觉合理性(Visual Plausibility):画得清不清楚?字有没有写错?逻辑通不通?(比如:地图上的文字有没有乱码?线条有没有重叠看不清?)

3. 考试结果如何?—— “优等生”与“学渣”的差距

论文测试了 17 种目前最先进的 AI 模型(包括闭源的“大厂模型”和开源的“社区模型”),结果非常残酷:

  • 顶尖闭源模型(如 Google 的 Nano Banana Pro, OpenAI 的 GPT-Image-1.5)
    它们像是聪明的优等生,能画出大概正确的图,结构看起来很像样。但在极其严格的“阅卷”下,它们的得分也往往只有 40%-70% 左右。这意味着它们经常会在细节上出错(比如把化学键画错,或者把地图上的国家标错)。
  • 开源模型(如 FLUX, Qwen 等)
    它们更像是还在努力的小学生,很多模型在严格标准下的得分甚至低于 5%,甚至接近 0%
    • 常见错误:它们可能知道“要画个地图”,但画出来的文字是乱码(拼写错误);或者知道“要画个电路”,但把正负极接反了(逻辑错误)。
  • 核心结论:目前的 AI 在“画图”这件事上,离真正的“专家级智能”还有巨大的鸿沟。它们能“模仿”画画的风格,但很难真正“理解”并“执行”复杂的逻辑绘图任务。

4. 为什么这个考试很重要?

这就好比教孩子学画画:

  • 以前的 AI 只是临摹(看到苹果画个苹果)。
  • GenExam 要求 AI 解题(根据“画一个受力分析图”的指令,自己构思并画出正确的力、方向和标注)。

这篇论文告诉我们,真正的通用人工智能(AGI),不仅要能“看懂”世界,还要能像人类专家一样,把脑子里的知识精准地转化成可视化的图表。GenExam 就是用来衡量 AI 是否具备这种“知行合一”能力的尺子。

总结

GenExam 就像给 AI 出了一套全科绘图高考题。它用极其严格的“阅卷标准”告诉我们:现在的 AI 虽然能画得花团锦簇,但在处理需要深度推理和精确执行的学科绘图任务时,还非常“笨拙”。这为未来的 AI 研发指明了方向——不仅要让 AI 画得好看,更要让它画得、画得

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →