StructEval: Benchmarking LLMs' Capabilities to Generate Structural Outputs
本文介绍了 StructEval,这是一个涵盖 18 种格式和 44 种任务类型的综合性基准,旨在通过生成和转换两种范式系统评估大语言模型在生成非渲染(如 JSON、YAML)及可渲染(如 HTML、React)结构化输出时的结构保真度,并揭示了当前模型在此类任务上仍存在显著的性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 StructEval 的新工具,它的核心任务就像是给大语言模型(LLM)举办一场"格式规范大考"。
为了让你更容易理解,我们可以把大语言模型想象成一位才华横溢但有点“粗线条”的超级厨师。
1. 背景:厨师的“摆盘”难题
过去,我们主要测试这位厨师能不能把菜做得好吃(内容是否通顺、逻辑是否清晰、知识是否准确)。比如,让他写一首诗或回答一个历史问题,他做得很好。
但在现实世界中,很多任务不仅要求“好吃”,还要求摆盘必须极其精准:
- 非渲染格式(StructEval-T):就像要求厨师把食材按特定的清单(JSON、YAML、CSV)列出来,不能多一个字,也不能少一个逗号,否则电脑系统就“读不懂”了。
- 渲染格式(StructEval-V):就像要求厨师不仅要把菜做好,还要把盘子摆成特定的形状(HTML、React、SVG、LaTeX),甚至要能直接“端上桌”让人看到漂亮的网页或图表。如果摆错了,网页就乱码了,图表就画不出来了。
StructEval 就是为了解决这个问题而诞生的“考官”。它不再只问“菜好不好吃”,而是问:“你的摆盘是否符合严格的规格说明书?”
2. 考场设置:两大“赛区”
这个考试分成了两个主要赛区,涵盖了 18 种不同的“摆盘风格”:
赛区 A:纯文本结构(StructEval-T)
- 任务:让模型生成像 JSON、XML、TOML 这样的代码。
- 比喻:就像让厨师写一份购物清单。清单必须严格遵循格式:
{ "苹果": 5, "香蕉": 3 }。如果厨师写成了{ "苹果": 5, "香蕉": 3 }(少个引号),或者把香蕉写成了“香蕉:3",系统就崩溃了。 - 子任务:
- 生成:直接根据“我要买 5 个苹果”这句话写出清单。
- 转换:把一份手写的清单(CSV)翻译成电脑能读的清单(JSON)。
赛区 B:视觉渲染(StructEval-V)
- 任务:让模型生成能直接显示在屏幕上的代码,如 HTML 网页、SVG 图标、React 组件、甚至 LaTeX 论文排版。
- 比喻:就像让厨师现场搭建一个微缩景观。你让他“画一个红色的圆”,他不仅要画出圆,还要确保圆是红色的、位置在中间、大小合适。如果圆歪了,或者颜色不对,考试就不及格。
- 子任务:同样分为“生成”(直接画图)和“转换”(把一张手绘草图变成标准的工程图纸)。
3. 评分规则:不仅看“像不像”,还要看“对不对”
以前的考试可能只看“大概像不像”,但 StructEval 的评分非常死板且严格,就像用精密仪器在测量:
- 语法分(Syntax Score):代码能不能跑通?就像检查清单有没有写错别字,或者网页能不能打开。如果代码报错,直接 0 分。
- 关键词匹配(Keyword Matching):你要求的元素都在吗?比如要求“标题必须是 H1 标签”,如果模型用了 H2,扣分。
- 视觉问答(VQA Score):这是最厉害的一招。系统会把模型生成的网页或图片“拍下来”,然后让另一个 AI(像 GPT-4.1)当质检员,对着图片提问:“标题文字是什么?”“表格里有几行?”。如果质检员答对了,说明模型真的画对了。
4. 考试结果:高手也有“手抖”的时候
论文对目前最顶尖的模型(包括 OpenAI 的 o1-mini、GPT-4o,以及开源的 Llama、Qwen 等)进行了测试,结果令人深思:
- 没有满分选手:即使是目前最强的商业模型 o1-mini,平均分也只有 75.58 分。这意味着,即使是顶级厨师,在严格的格式要求下,也会经常“摆盘”失败。
- 开源 vs 闭源:商业模型(闭源)普遍比开源模型强,大概领先 10 分 左右。这就像大餐厅的厨师比家庭厨师更擅长处理复杂的摆盘。
- 生成难,转换更难?:
- 让人“从零开始写代码”(生成任务)比“把一种格式转成另一种”(转换任务)更难。
- 最难的挑战:生成视觉内容(如画图、做网页)比生成纯文本结构更难。
- 特别“坑”的格式:有些格式(如 TOML、Mermaid 图表、TikZ 绘图)是所有模型的噩梦,很多模型在这些任务上得分极低,甚至不及格。
5. 总结与启示
StructEval 告诉我们:
大语言模型虽然“博学多才”,能写诗、能聊天,但在严格遵守格式规范和精准控制视觉结构方面,它们还像个还没出师的小学徒。
- 对于开发者:如果你指望模型直接生成完美的、可运行的代码或数据格式,目前还需要人工检查,不能直接“甩手不管”。
- 对于未来:这篇论文就像一面镜子,指出了模型需要改进的方向。未来的模型不仅要“聪明”,还要“细心”,能够像老练的工匠一样,精准地控制每一个字符和每一个像素。
简单来说,StructEval 就是给 AI 戴上了“紧箍咒”,逼着它们学会在严格的规则下跳舞,而不仅仅是自由发挥。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。