← 最新论文
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench 引入了一个自动化的智能体框架,通过涉及专门角色的动态协作评审过程,重新定义了网页生成评估,以应对前端产物具有的交互性、多样性和快速演进的特性,从而实现与人类专家判断的一致性。

原作者: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅能与你聊天,还能真正动手建造事物的世界。在人工智能(特别是大语言模型,LLM)领域,我们已经达到了这样一个阶段:这些数字大脑可以编写代码来创建整个网站,而不仅仅是单个句子。可以将大语言模型想象成一名超级快速、知识渊博的学徒建筑师。如果你要求它“造一个树屋”,它可以绘制蓝图、切割木材,甚至粉刷墙壁。但棘手之处在于:你如何知道这个树屋是否真的安全可攀爬?长期以来,我们通过查看它们的蓝图(代码)或拍摄一张成品房屋的照片来测试这些 AI 建造者。但网站不是静态的照片;它们是活生生的、呼吸着的游乐场,按钮会点击,动画会跳动,用户会在其中穿梭。如果你只检查蓝图,你可能会错过一个摇晃的梯子或一扇打不开的门。这就是研究人员正在解决的大问题:我们如何测试一个 AI 是否能建造出一个真正“好用”且体验良好的网站,而不仅仅是看起来在纸面上很完美?

LiveEvalBench 应运而生,这是一个旨在解决这一精确问题的全新且巧妙的框架。作者认为,旧的测试方法——就像老师批改一篇静态文章——对于交互式网页项目来说是不够的。相反,他们构建了一个系统,该系统就像一支由不同专家组成的检查小组,每个人都有不同的职责,从而彻底测试 AI 的作品。

以下是他们的“检查小组”运作方式:

  1. 构建工程师(The Build Engineer): 想象一位试图实际组装房屋的施工领班。这个智能体获取 AI 的代码并尝试启动网站。如果网站崩溃或指令令人困惑,这位工程师就会发现问题。
  2. 代码工程师(The Code Engineer): 这是一位不接触房屋、只观察蓝图(源代码)的质量控制检查员。他们检查材料是否组织有序、结构是否稳固,以及 AI 是否遵循了你给出的特定规则(例如“使用蓝色油漆”或“制作一个 React 应用”)。
  3. UI 测试员(The UI Tester): 这是一个在游乐场里到处乱跑的好奇小孩。这个智能体完全不看代码,它只是点击按钮、悬停在图像上,并像人类一样尝试使用网站。它会检查动画是否流畅、文本是否易读,以及网站是否真的实现了你的要求。

LiveEvalBench 的特别之处在于它是自适应的(adaptive)。在过去,测试是僵化的,就像是一场只有一个正确答案的多选题。但在现实世界中,建造一个优秀的网站有一百万种方法。LiveEvalBench 会观察 AI 实际 建造了什么,并为那个特定版本创建一个定制的清单。如果 AI 建造了一个侧滑菜单而不是下拉菜单,测试也会随之调整,去检查侧滑菜单是否可用,而不是因为它不是下拉菜单就判定失败。这就像一位理解披萨可以是方形或圆形的裁判,只要它味道美味即可。

研究人员在 100 个真实世界的请求(从简单任务到复杂的、多页面的应用程序)上测试了这个新系统,并要求 11 个最聪明的 AI 模型 来完成它们。结果发人深省。虽然许多模型擅长编写代码并成功启动网站,但它们在实际的用户体验方面经常跌跤。 “UI 测试员”发现,最大的问题往往发生在用户尝试与网站交互时——按钮点不动、动画冻结或布局崩溃。

当他们将这些 AI 检查员与人类专家进行比较时,结果非常接近,这表明这种自动化团队是评判 AI 建造者的可靠方式。研究发现,表现最好的模型得分约为 90 分中的 70 分,其中顶尖选手(如 Claude Opus 4.7)展现了强大的技能,而其他模型在交互部分则表现得相当吃力。论文指出,虽然 AI 在建造方面正变得越来越好,但“有趣”的部分——让事物感觉鲜活且具有响应性——仍然是最难的挑战。LiveEvalBench 提供了一种全新的、灵活的方式来衡量这种进步,确保随着 AI 建造能力的提升,我们拥有正确的工具来确保这些建筑是安全、有趣且准备好面向世界的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →