✨ 要点🔬 技术摘要
以下是关于论文《生成式视觉代码移动世界模型》(介绍 gWorld)的通俗解释,辅以生动的类比。
核心难题:“模糊的水晶球”
想象一下,你正在教机器人如何使用你的智能手机。为此,机器人需要一个“水晶球”(即世界模型 ),能够预测:“如果我点击这个按钮,下一个屏幕会是什么样子?”
目前构建这种水晶球的尝试存在一个主要缺陷:
“纯文本”模型 :某些模型试图用文字描述下一个屏幕(例如,“按钮变蓝了”)。这很快,但就像通过阅读剧本描述电影一样。你会失去所有视觉细节,比如确切的字体、颜色深浅或布局。
“像素生成”模型 :其他模型试图像画家作画一样逐像素绘制下一个屏幕。虽然看起来不错,但这些模型在绘制文字方面表现极差。它们经常产生乱码字母、扭曲的按钮或奇怪的布局。为了解决这个问题,它们需要一个庞大、缓慢且多步骤的“工厂”,涉及其他 AI 工具来检查文字并修正错误。这就像为了画一个按钮,先雇佣一名画家,再雇佣一名拼写检查员,接着雇佣一名建筑师,最后再雇佣一名编辑。
解决方案:“建筑师的蓝图”
作者提出了一种构建水晶球的新方法。他们不是让 AI 绘制 图片(像素)或描述 它(文本),而是让它编写构建该图片的代码 。
可以这样理解:
旧方法(像素生成器) :要求一位艺术家完美复刻一个网站。他们可能能调对颜色,但文字看起来可能像涂鸦。
新方法(gWorld) :要求一位资深建筑师为网站编写蓝图 (HTML/CSS 代码)。
因为 AI 正在编写代码(具有结构性和逻辑性),它确切知道如何放置按钮、如何拼写单词以及如何安排布局。当这段代码被“渲染”(在浏览器中运行)时,它会瞬间变成一个完美、清晰的下一个屏幕图像。
什么是 gWorld?
gWorld 是作者构建的新 AI 系统的名称。
它是一个“世界模型” :它接收当前屏幕和一个动作(如“点击这里”),并预测下一个屏幕。
它讲“代码” :它不输出图像文件,而是输出网页代码(HTML/CSS)。
它是开源且快速的 :作者免费发布了该模型的“权重”(即“大脑”)。因为它跳过了其他方法中缓慢复杂的“工厂”流程,所以速度极快——在不到一秒的时间内就能预测下一个屏幕。
他们是如何训练它的?
你不能仅仅要求 AI 为它从未见过的屏幕编写代码。作者必须建立一个特殊的训练工厂:
回收旧数据 :他们利用了现有的人类手机使用记录(点击和滑动的轨迹)。
翻译器 :他们利用一个超级智能的 AI,观察人类操作后的“结果”图片,并将其翻译成干净、可运行的代码。
推理步骤 :他们还教导 AI 先“大声思考”。在编写代码之前,它会解释屏幕为何会发生变化(例如,“用户点击了‘发送’,所以邮件应该消失,并出现‘已发送’的消息”)。
结果:为何重要
作者将 gWorld 与 8 个其他顶级 AI 模型进行了测试(其中一些模型的规模大 50 倍且更昂贵)。
准确性 :gWorld 在预测下一个屏幕方面最为准确。它正确拼写了文字,布局也完美无缺。
效率 :它以小得多的模型规模实现了这些结果。就像一辆紧凑型跑车在赛跑中击败了一辆巨型卡车。
“帕累托前沿” :在图表中,gWorld 创造了一条新的“最佳可能”线。如果不大幅增加模型规模,就无法获得更高的准确性,而 gWorld 在其规模下已经是最佳表现。
现实世界测试 :他们甚至将其测试于从未见过的应用和语言(如韩语),它依然表现优异。
蓝图的“魔力”
论文强调了一个关键见解:移动屏幕主要是结构和文本,而非复杂照片。 虽然某些屏幕包含照片(如相机视图),但大多数是列表、按钮和文本。因为 gWorld 编写代码,它将屏幕视为结构化文档。这意味着它永远不会犯拼写错误或布局错误,而这正是“像素绘画”模型最大的弱点。
总结
这篇论文介绍了 gWorld ,这是一种新型 AI,能够预测用户与手机交互后屏幕将如何变化。gWorld 不尝试“绘制”下一个屏幕(这会导致文字模糊和错误),而是编写构建屏幕的代码 。这种方法更快、更准确、所需的计算能力更少,并能生成完美的文字和布局,为 AI 智能体学习如何使用我们的手机设立了新标准。
技术摘要:生成式视觉代码移动世界模型
问题陈述
移动图形用户界面(GUI)世界模型(WMs)旨在预测未来的界面状态,以提升智能体在训练和推理期间的性能。现有方法面临一个关键权衡:
基于文本的世界模型: 通过将像素空间抽象为文本而牺牲视觉保真度,丢失了关键的空间布局和视觉属性(例如图标、排版)。
基于视觉(像素)的世界模型: 难以实现精确的文本渲染和离散的 GUI 动态。现有的视觉世界模型(例如 VIMO)依赖复杂的多阶段流程,涉及外部 OCR、文本掩码、扩散模型以及用于文本填充的闭源权重大语言模型。这导致了显著的计算开销、延迟,并因闭源权重而可复现性差。
此外,现有基准测试通常通过将动作转换为文本或仅测试分布内场景来简化问题,未能评估零样本泛化能力或原生视觉动作空间。
方法论
作者提出了 gWorld ,这是一种通过可渲染代码生成 进行视觉移动 GUI 世界建模的新范式。该模型不直接生成像素,而是将下一个 GUI 状态预测为可执行的 Web 代码(HTML/CSS),进而渲染为像素。
核心架构
模型: gWorld 基于开源权重的视觉 - 语言模型(VLMs)构建,具体为 Qwen3 VL (8B 和 32B 参数)的微调版本。
表示: 模型输出结构化的 Web 代码。这利用了 VLM 的语言先验知识以实现精确的文本渲染,并利用其在结构化 Web 代码上的预训练以实现高保真的视觉生成。
训练目标: 模型被训练为根据当前图像状态(S t S_t S t )和动作(A t A_t A t ),预测推理轨迹(R t R_t R t )和基于代码的下一状态(S t + 1 c o d e S^{code}_{t+1} S t + 1 co d e )。
数据生成框架
由于不存在基于代码的 GUI 世界建模数据集,作者引入了一个框架来合成训练数据:
轨迹复用: 将离线移动智能体策略轨迹(来自 AitW、GUIOdyssey、AndroidControl、AMEX)转换为转换三元组 ( S t , A t , S t + 1 ) (S_t, A_t, S_{t+1}) ( S t , A t , S t + 1 ) 。
跨模态重标注: 使用前沿模型(Gemini 3 Flash)通过“图像转代码”提示,将真实标签的下一状态图像(S t + 1 i m a g e S^{image}_{t+1} S t + 1 ima g e )转换为可渲染的 Web 代码(S t + 1 c o d e S^{code}_{t+1} S t + 1 co d e )。
前瞻推理: 利用前沿模型对真实标签下一状态的“自由前瞻”访问权限,合成推理轨迹(R t R_t R t )。这将问题分解为首先用自然语言预测状态变化,然后转换为代码,确保推理与最终输出之间的一致性。
基准测试:MWMBENCH
作者引入了 MWMBENCH ,这是一个包含 6 个数据集的综合基准测试:
分布内(ID): 4 个数据集(AitW、GUIOdyssey、AndroidControl、AMEX)。
分布外(OOD): 2 个新数据集:
AndroidWorld: 从 AndroidWorld 基准测试中自动收集。
KApps: 人工策划的韩语轨迹,包含流行的韩国应用程序(例如 Baemin、KakaoTalk),测试多语言和区域泛化能力。
关键特性: MWMBENCH 在原生视觉模态 下评估模型(保留动作的原始坐标),而不是将动作转换为文本,并包含针对零样本泛化的 OOD 评估。
主要贡献
gWorld 模型: 首个通过可渲染代码生成运行的开源权重、单一自包含的视觉移动 GUI 世界模型(8B 和 32B)。
数据生成流程: 一个框架,能够从现有策略轨迹中自动合成带有推理轨迹的大规模基于代码的训练数据。
MWMBENCH: 一个新的基准测试套件,支持在分布内和分布外设置下,结合原生视觉动作空间,对视觉世界建模进行系统评估。
实证验证: 证明了基于代码的建模优于基于像素的生成和基于文本的抽象,在准确率与模型规模方面确立了新的帕累托前沿。
结果
在 6 个基准测试(4 个 ID,2 个 OOD)上的广泛评估显示:
性能: gWorld 8B 和 32B 在所有基准测试中取得了最佳和次佳的指令准确率(IAcc.)。它们优于 8 个前沿开源权重模型(包括 Llama 4 402B 和 Qwen3 VL 235B),这些模型的参数量高达 50.25 倍 。
帕累托前沿: gWorld 确立了新的帕累托前沿,以显著少于现有最先进模型的参数量实现了更高的准确率。
鲁棒性: 模型在 OOD 基准测试(AndroidWorld 和 KApps)上表现出强大的泛化能力,与 ID 设置相比,性能没有显著下降。
渲染保真度: 基于代码的方法几乎消除了结构错误,渲染失败率低于 1% (而某些基线模型超过 30%)。
缩放定律: 性能随数据集规模(37K 到 240K 样本)遵循可预测的幂律,表明随着更多数据可能获得进一步提升。
下游影响: 通过广度展开和值估计将 gWorld 集成到策略智能体(M3A)中,相比仅使用策略或没有世界模型的值函数,带来了显著的性能提升(例如,平均准确率比基线提高 +22.4%)。
效率: gWorld 比之前的基于像素的世界模型(例如 VIMO)快得多。端到端延迟为 0.55 秒(8B) 和 1.30 秒(32B) ,而 VIMO 报告的延迟为 160 秒。
意义与主张
该论文声称,可渲染代码世界建模 为可扩展且高效的移动 GUI 智能体提供了实用基础。通过将表示从像素转变为代码,gWorld 在保留 GUI 结构和文本保真度的同时,避免了多阶段基于像素流程的复杂性和延迟。
作者强调:
这种方法解决了视觉保真度与文本精度之间的权衡。
它使得创建开源权重、可复现的世界模型成为可能,这些模型优于规模大得多的闭源权重或基于像素的替代方案。
该方法效率极高,使得移动智能体的实时世界建模成为可能。
引入的基准测试和数据生成框架为未来移动 GUI 世界建模的研究提供了必要的基础设施。
该论文在局限性方面保持适度,指出照片级真实内容(例如视频播放器中的复杂自然图像)难以通过 Web 代码高保真地重建,但这并不会显著影响大多数 GUI 任务的语义效用。未来的工作建议引入显式的工作记忆以处理长程依赖。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。