← 最新论文
💬 NLP

StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs

本文介绍了 StructEval,这是一个涵盖 18 种格式和 44 种任务类型的综合性基准,旨在通过生成和转换两种范式系统评估大语言模型在生成非渲染(如 JSON、YAML)及可渲染(如 HTML、React)结构化输出时的结构保真度,并揭示了当前模型在此类任务上仍存在显著的性能差距。

原作者: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu
发布于 2026-04-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Jialin Yang, Dongfu Jiang, Lipeng He, Sherman Siu, Yuxuan Zhang, Disen Liao, Zhuofeng Li, Huaye Zeng, Yiming Jia, Haozhe Wang, Benjamin Schneider, Chi Ruan, Wentao Ma, Zhiheng Lyu, Yifei Wang, Yi Lu, Quy Duc Do, Ziyan Jiang, Ping Nie, Wenhu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 StructEval 的新工具,它的核心任务就像是给大语言模型(LLM)举办一场"格式规范大考"。

为了让你更容易理解,我们可以把大语言模型想象成一位才华横溢但有点“粗线条”的超级厨师

1. 背景:厨师的“摆盘”难题

过去,我们主要测试这位厨师能不能把菜做得好吃(内容是否通顺、逻辑是否清晰、知识是否准确)。比如,让他写一首诗或回答一个历史问题,他做得很好。

但在现实世界中,很多任务不仅要求“好吃”,还要求摆盘必须极其精准

  • 非渲染格式(StructEval-T):就像要求厨师把食材按特定的清单(JSON、YAML、CSV)列出来,不能多一个字,也不能少一个逗号,否则电脑系统就“读不懂”了。
  • 渲染格式(StructEval-V):就像要求厨师不仅要把菜做好,还要把盘子摆成特定的形状(HTML、React、SVG、LaTeX),甚至要能直接“端上桌”让人看到漂亮的网页或图表。如果摆错了,网页就乱码了,图表就画不出来了。

StructEval 就是为了解决这个问题而诞生的“考官”。它不再只问“菜好不好吃”,而是问:“你的摆盘是否符合严格的规格说明书?”

2. 考场设置:两大“赛区”

这个考试分成了两个主要赛区,涵盖了 18 种不同的“摆盘风格”:

  • 赛区 A:纯文本结构(StructEval-T)

    • 任务:让模型生成像 JSON、XML、TOML 这样的代码。
    • 比喻:就像让厨师写一份购物清单。清单必须严格遵循格式:{ "苹果": 5, "香蕉": 3 }。如果厨师写成了 { "苹果": 5, "香蕉": 3 }(少个引号),或者把香蕉写成了“香蕉:3",系统就崩溃了。
    • 子任务
      • 生成:直接根据“我要买 5 个苹果”这句话写出清单。
      • 转换:把一份手写的清单(CSV)翻译成电脑能读的清单(JSON)。
  • 赛区 B:视觉渲染(StructEval-V)

    • 任务:让模型生成能直接显示在屏幕上的代码,如 HTML 网页、SVG 图标、React 组件、甚至 LaTeX 论文排版。
    • 比喻:就像让厨师现场搭建一个微缩景观。你让他“画一个红色的圆”,他不仅要画出圆,还要确保圆是红色的、位置在中间、大小合适。如果圆歪了,或者颜色不对,考试就不及格。
    • 子任务:同样分为“生成”(直接画图)和“转换”(把一张手绘草图变成标准的工程图纸)。

3. 评分规则:不仅看“像不像”,还要看“对不对”

以前的考试可能只看“大概像不像”,但 StructEval 的评分非常死板且严格,就像用精密仪器在测量:

  1. 语法分(Syntax Score):代码能不能跑通?就像检查清单有没有写错别字,或者网页能不能打开。如果代码报错,直接 0 分。
  2. 关键词匹配(Keyword Matching):你要求的元素都在吗?比如要求“标题必须是 H1 标签”,如果模型用了 H2,扣分。
  3. 视觉问答(VQA Score):这是最厉害的一招。系统会把模型生成的网页或图片“拍下来”,然后让另一个 AI(像 GPT-4.1)当质检员,对着图片提问:“标题文字是什么?”“表格里有几行?”。如果质检员答对了,说明模型真的画对了。

4. 考试结果:高手也有“手抖”的时候

论文对目前最顶尖的模型(包括 OpenAI 的 o1-mini、GPT-4o,以及开源的 Llama、Qwen 等)进行了测试,结果令人深思:

  • 没有满分选手:即使是目前最强的商业模型 o1-mini,平均分也只有 75.58 分。这意味着,即使是顶级厨师,在严格的格式要求下,也会经常“摆盘”失败。
  • 开源 vs 闭源:商业模型(闭源)普遍比开源模型强,大概领先 10 分 左右。这就像大餐厅的厨师比家庭厨师更擅长处理复杂的摆盘。
  • 生成难,转换更难?:
    • 让人“从零开始写代码”(生成任务)比“把一种格式转成另一种”(转换任务)更难。
    • 最难的挑战:生成视觉内容(如画图、做网页)比生成纯文本结构更难。
    • 特别“坑”的格式:有些格式(如 TOML、Mermaid 图表、TikZ 绘图)是所有模型的噩梦,很多模型在这些任务上得分极低,甚至不及格。

5. 总结与启示

StructEval 告诉我们
大语言模型虽然“博学多才”,能写诗、能聊天,但在严格遵守格式规范精准控制视觉结构方面,它们还像个还没出师的小学徒

  • 对于开发者:如果你指望模型直接生成完美的、可运行的代码或数据格式,目前还需要人工检查,不能直接“甩手不管”。
  • 对于未来:这篇论文就像一面镜子,指出了模型需要改进的方向。未来的模型不仅要“聪明”,还要“细心”,能够像老练的工匠一样,精准地控制每一个字符和每一个像素。

简单来说,StructEval 就是给 AI 戴上了“紧箍咒”,逼着它们学会在严格的规则下跳舞,而不仅仅是自由发挥

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →