← 最新论文
🤖 machine learning

Generative Visual Code Mobile World Models

该论文介绍了 gWorld,这是一种移动图形用户界面世界模型的新范式,它利用单一视觉 - 语言模型将下一个界面状态预测为可执行的网页代码而非原始像素,从而在实现高保真视觉渲染和精确文本生成的同时,在准确性上显著超越规模大得多的现有模型。

原作者: Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Woosung Koh, Sungjun Han, Segyu Lee, Se-Young Yun, Jamin Shin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《生成式视觉代码移动世界模型》(介绍 gWorld)的通俗解释,辅以生动的类比。

核心难题:“模糊的水晶球”

想象一下,你正在教机器人如何使用你的智能手机。为此,机器人需要一个“水晶球”(即世界模型),能够预测:“如果我点击这个按钮,下一个屏幕会是什么样子?”

目前构建这种水晶球的尝试存在一个主要缺陷:

  1. “纯文本”模型:某些模型试图用文字描述下一个屏幕(例如,“按钮变蓝了”)。这很快,但就像通过阅读剧本描述电影一样。你会失去所有视觉细节,比如确切的字体、颜色深浅或布局。
  2. “像素生成”模型:其他模型试图像画家作画一样逐像素绘制下一个屏幕。虽然看起来不错,但这些模型在绘制文字方面表现极差。它们经常产生乱码字母、扭曲的按钮或奇怪的布局。为了解决这个问题,它们需要一个庞大、缓慢且多步骤的“工厂”,涉及其他 AI 工具来检查文字并修正错误。这就像为了画一个按钮,先雇佣一名画家,再雇佣一名拼写检查员,接着雇佣一名建筑师,最后再雇佣一名编辑。

解决方案:“建筑师的蓝图”

作者提出了一种构建水晶球的新方法。他们不是让 AI 绘制图片(像素)或描述它(文本),而是让它编写构建该图片的代码

可以这样理解:

  • 旧方法(像素生成器):要求一位艺术家完美复刻一个网站。他们可能能调对颜色,但文字看起来可能像涂鸦。
  • 新方法(gWorld):要求一位资深建筑师为网站编写蓝图(HTML/CSS 代码)。

因为 AI 正在编写代码(具有结构性和逻辑性),它确切知道如何放置按钮、如何拼写单词以及如何安排布局。当这段代码被“渲染”(在浏览器中运行)时,它会瞬间变成一个完美、清晰的下一个屏幕图像。

什么是 gWorld?

gWorld 是作者构建的新 AI 系统的名称。

  • 它是一个“世界模型”:它接收当前屏幕和一个动作(如“点击这里”),并预测下一个屏幕。
  • 它讲“代码”:它不输出图像文件,而是输出网页代码(HTML/CSS)。
  • 它是开源且快速的:作者免费发布了该模型的“权重”(即“大脑”)。因为它跳过了其他方法中缓慢复杂的“工厂”流程,所以速度极快——在不到一秒的时间内就能预测下一个屏幕。

他们是如何训练它的?

你不能仅仅要求 AI 为它从未见过的屏幕编写代码。作者必须建立一个特殊的训练工厂:

  1. 回收旧数据:他们利用了现有的人类手机使用记录(点击和滑动的轨迹)。
  2. 翻译器:他们利用一个超级智能的 AI,观察人类操作后的“结果”图片,并将其翻译成干净、可运行的代码。
  3. 推理步骤:他们还教导 AI 先“大声思考”。在编写代码之前,它会解释屏幕为何会发生变化(例如,“用户点击了‘发送’,所以邮件应该消失,并出现‘已发送’的消息”)。

结果:为何重要

作者将 gWorld 与 8 个其他顶级 AI 模型进行了测试(其中一些模型的规模大 50 倍且更昂贵)。

  • 准确性:gWorld 在预测下一个屏幕方面最为准确。它正确拼写了文字,布局也完美无缺。
  • 效率:它以小得多的模型规模实现了这些结果。就像一辆紧凑型跑车在赛跑中击败了一辆巨型卡车。
  • “帕累托前沿”:在图表中,gWorld 创造了一条新的“最佳可能”线。如果不大幅增加模型规模,就无法获得更高的准确性,而 gWorld 在其规模下已经是最佳表现。
  • 现实世界测试:他们甚至将其测试于从未见过的应用和语言(如韩语),它依然表现优异。

蓝图的“魔力”

论文强调了一个关键见解:移动屏幕主要是结构和文本,而非复杂照片。
虽然某些屏幕包含照片(如相机视图),但大多数是列表、按钮和文本。因为 gWorld 编写代码,它将屏幕视为结构化文档。这意味着它永远不会犯拼写错误或布局错误,而这正是“像素绘画”模型最大的弱点。

总结

这篇论文介绍了 gWorld,这是一种新型 AI,能够预测用户与手机交互后屏幕将如何变化。gWorld 不尝试“绘制”下一个屏幕(这会导致文字模糊和错误),而是编写构建屏幕的代码。这种方法更快、更准确、所需的计算能力更少,并能生成完美的文字和布局,为 AI 智能体学习如何使用我们的手机设立了新标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →