LongWebBench: Evaluating Structural and Functional Webpage Generation in Long-Horizon Settings
本文介绍了 LongWebBench,这是一个旨在评估视觉语言模型在长程网页生成中的结构忠实度与功能可执行性的综合基准测试,揭示了当前的先进系统尽管在视觉上具有合理性,但在长程连贯性和交互能力方面仍面临挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位才华横溢的建筑师,根据一张巨大的豪宅照片来建造一座房子。
问题所在:
直到现在,大多数针对 AI“建筑师”(称为视觉语言模型)的测试都只要求它们建造微小的单间小屋。这些测试检查的是前门看起来是否正确,或者油漆颜色是否匹配。但真正的网站就像宏伟的豪宅,拥有数十个房间、多层楼层和复杂的布线。如果你要求 AI 根据一张照片建造整座豪宅,它可能把前门做得很好,却忘了如何将楼梯连接到二楼,或者造出了一个看起来很真实但却没有可用水槽的厨房。
解决方案:LongWebBench
论文作者创建了一个更严苛的新测试,名为 LongWebBench。他们不仅检查房子看起来是否像照片中的样子,还检查两件事:
- 蓝图(结构): 整个建筑是否合理?房间的顺序是否正确?屋顶是否与墙壁相连?
- 水管与电路(功能): 如果你打开水龙头,水会流出来吗?如果你按下灯的开关,灯会亮吗?
他们是如何构建这个测试的:
他们收集了两个巨大的现实世界“豪宅照片”(长网页)集合:
- 490 个“形似”测试: 他们拍摄了一些非常长的网站照片(有些长到你必须向下滚动 30 个屏幕才能看到底部),并要求 AI 模型重新生成这些页面的代码。测试旨在检查 AI 是否能在页面顶部到底部之间保持布局的一致性。
- 507 个“实操”测试: 他们挑选了 129 个网站,并给 AI 分配了具体任务,例如“查找飞往东京的航班”、“将商品加入购物车”或“筛选搜索结果”。AI 必须编写出能在真实浏览器中实际执行这些操作的代码,而不仅仅是假装在做。
结果:“现实差距”
当研究人员让最优秀的 AI 模型通过这项新测试时,他们发现了令人惊讶的现象:
- “长滚动”问题: 随着网站变得越来越长,AI 保持结构正确的能力就变得越来越差。这就像一位建筑师可以设计出一个完美的底层,却忘记了二层如何与之一层连接。
- “假房子”问题: 许多 AI 构建的网站看起来非常漂亮且逼真(就像电影布景),但当你尝试点击按钮或填写表单时,什么也不会发生。“水管”是坏的。
- 输入问题: 即便研究人员将长照片切分成更小的碎片以方便 AI 观察,AI 仍然难以将这些碎片组合成一个完整运行的整体。
核心结论
论文得出结论,我们不能仅仅根据 AI 的绘画作品有多漂亮来评判它。要真正发挥作用,AI 需要能够构建出长而复杂的网站,并且在用户交互时能够真正运行。LongWebBench 是他们用来衡量这一能力的全新标尺,它向我们展示了尽管 AI 在绘画方面已经做得很好,但在构建一个功能完备的数字房屋方面,仍有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。