← 最新论文
🤖 AI

HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML

HTMLCure 引入了一种状态引导的浏览器体验框架,该框架通过确定性交互轨迹评估并修复交互式 HTML,从而将种子语料库显著扩展为高质量数据集,使 27B 模型在交互式网络基准测试中取得与 Kimi-K2.6 和 GPT-5.4 等领先系统相当的性能。

原作者: Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiajun Wu, Jian Yang, Tuney Zheng, Wei Zhang, Haowen Wang, Yihang Lou, Xianglong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 HTMLCURE 论文的解析,将其拆解为简单概念并辅以日常类比。

核心难题:“看着不错,实则已坏”

想象你请一位极具天赋的艺术家(人工智能)制作一辆玩具车。艺术家递给你一个精美的模型。它在照片中看起来完美无缺。但当你试图推动它时,轮子却掉了;当你试图转动方向盘时,方向盘却空转无用。

这就是当前 AI 生成网页(HTML)面临的问题。它们往往在单张快照(截图)中看起来很棒,但当真人尝试点击按钮、向下滚动、调整窗口大小或玩游戏时,页面就会崩溃。

  • 旧方法: 研究人员过去只是拍摄页面的照片,检查它是否美观,以此判断它是否“好”。这种方法忽略了所有像“掉落的轮子”那样的问题。
  • 结果: 他们丢弃了成千上万本可修复的页面,或者保留了一些看起来不错但无法运行的页面。

解决方案:HTMLCURE(“试驾”技师)

作者构建了一个名为 HTMLCURE 的系统。它不再仅仅查看照片,而是像一位技师那样,将汽车进行 试驾

以下是其工作原理,分步说明:

1. 试驾(浏览器体验)

HTMLCURE 不只是拍张照片,而是将网页加载到真实的浏览器中。它不会只是静止不动,而是主动与之交互:

  • 它上下滚动。
  • 它调整窗口大小(就像检查汽车是否能停进小车库)。
  • 它点击按钮、悬停在链接上,并尝试玩游戏。
  • 它精确记录发生的情况:“按钮没反应”、“游戏卡死”或“移动端布局崩坏”。

类比: 这就像给汽车进行 驾驶测试。你不仅仅看车漆,还要开起来看看引擎能否启动、刹车是否有效、变速箱换挡是否顺畅。

2. 诊断(状态信号)

试驾结束后,系统会给页面一个“健康评分”和诊断结果。它将页面分为三类,就像医生对病人进行分诊:

  • 低分(报废车): 页面一团糟。缺失了大块的结构性内容。
    • 修复方案: 彻底重写。 不要试图修补它;从零开始建造一辆新车。
  • 中等分数(旧破车): 页面大部分能运行,但有特定的损坏部分(例如收音机不工作,或门把手卡住)。
    • 修复方案: 针对性修复。 诊断出具体损坏的部分,仅修复该部分。
  • 高分(跑车): 页面已经非常出色。
    • 修复方案: 仅做抛光。 不要触碰引擎;也许只需打蜡。如果你试图“修复”那些并未损坏的东西,反而可能会弄坏它。

关键洞察: 论文指出,对所有页面使用 相同 的修复方法是一个错误。你需要根据页面实际损坏的程度采取不同的策略。

3. 修复循环(反馈周期)

一旦系统确定了策略(重写、修补或抛光),它就会要求 AI 修复页面。

  • 关键步骤: 系统不会仅仅相信 AI 的话。它会获取页面的 新版本 并再次运行 试驾
  • 守门人: 如果新版本更好,就保留它;如果新版本更差(即“回归”),则将其丢弃并重试。
  • 目标: 持续进行此过程,直到页面通过高质量标准(达到 97/100 的分数)。

类比: 想象一位厨师在品尝汤。如果太咸,他们就加水。然后他们 再次 品尝。他们不会假设加水就解决了问题,而是进行验证。如果他们加了太多水导致汤现在太淡,他们就停下来尝试不同的食谱。

成果:构建更优质的库

作者将这套系统应用于一个包含 97,000 个 AI 生成页面的庞大集合。

  • 他们从一个小的“完美”页面堆开始。
  • 他们使用 HTMLCURE 修复了那些“损坏”的页面。
  • 最终,他们获得了 63,000 个经过验证的高质量页面(相比最初的小集合有了显著增长)。

随后,他们利用这个新的、经过清理的库来训练一个新的 AI 模型(称为 HTMLCure-27B)。

结果:

  • 新模型在制作可运行网页方面显著更出色。
  • 在名为 HTMLBENCH 的严格测试中,它得分 50.6,与顶级商业模型(如 Kimi-K2.6 和 GPT-5.4)相当。
  • 在另一项测试(MiniAppBench)中,与未训练版本相比,其得分提高了 15 分

一句话总结

HTMLCURE 是一个系统,它阻止 AI 仅仅“猜测”网页是否可用;相反,它强制 AI 试驾 每一个页面,诊断 确切的问题所在,利用正确的策略 修复 它,并 重新测试 以确保修复确实有效,从而构建出一个包含大量高质量、可运行代码的庞大库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →