← 最新论文
🤖 AI

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

本文介绍了 MobileForge,这是首个针对多屏移动应用生成的项目级基准测试,旨在评估多模态大语言模型在构建、导航、视觉保真度、可维护性和效率方面的表现,并揭示了当前模型虽然能够编译和导航应用,但在可靠交互和代码质量方面仍面临挑战。

原作者: Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你只需向计算机展示一个装满智能手机拍摄照片的文件夹,它就能立即编写出构建该款应用程序所需的全部计算机程序。这就是被称为“设计转代码”(design-to-code)领域的愿景,即人工智能试图将视觉图像转化为使软件运行的功能性指令。多年来,研究人员通过向系统展示单张网页图片并要求其生成重建该单一页面的代码来测试这些系统。虽然这在处理简单、孤立的页面时取得了令人印象深刻的成果,但却忽略了现实世界软件的复杂性。一个真正的移动应用程序不仅仅是一张图片;它是一个由许多屏幕组成的连接世界,拥有能将你从一处引导至另一处的按钮,以及必须在整个体验中保持一致的共享设计元素。问题仍然存在:人工智能能否观察一套完整的真实应用截图,并构建出一个人类团队真正可以使用的、可运行的多页面项目?

一组研究人员致力于通过一项名为 MobileForge 的新测试来回答这个问题。他们不再要求模型构建单个页面,而是要求它们从头开始构建整个应用程序。研究人员收集了 2 la 29 个人们日常使用的真实流行移动应用的截图,涵盖了从社交媒体到金融和导航的所有领域。这些应用总共包含 309 个不同的屏幕。随后,他们要求六个目前最先进的人工智能模型观察这些图像,并生成这些应用的完整源代码。为了确保测试公平且严谨,团队创建了一份详细的地图,说明这些屏幕应该如何相互连接,并编写了数百个特定的测试,以检查生成的应用是否真的可以运行。他们不仅检查代码是否可以编译,还检查了导航按钮是否能引导至正确的位置,视觉设计是否与原始照片相符,以及代码是否足够整洁,以便其他工程师日后进行维护。

结果揭示了这些模型能够做到的与它们仍然无法做到的之间存在明显的鸿线。从积极的一面来看,每一个模型都能够生成可以被构建成运行项目的代码。最强大的模型甚至可以实现 92% 的成功率,在生成的应用中进行导航并到达正确的页面。然而,从一个运行中的应用到完美应用的旅程依然漫长。虽然代码可以运行,但视觉细节往往会偏离原始照片。模型难以在不同屏幕之间保持颜色和布局的一致性,经常在每个页面上以略微不同的方式重新创建同一个导航栏,而不是使用单一的共享组件。这种不一致性意味着,虽然这些应用看起来与原图相似,但缺乏专业设计产品所具有的那种精致、统一的感觉。

或许最令人惊讶的发现是,视觉上的准确并不意味着代码编写得好。生成视觉上最忠实于原图的应用的模型,其生成的代码实际上比其他模型长了两倍,也更混乱。它创建了许多未使用的部分,并且未能高效地复用通用元素。相比之下,另一个模型生成的代码要短得多、也更整洁,更容易由人类编辑和维护,尽管其视觉输出稍逊一筹。这表明,当前一代人工智能尚未学会如何在应用的视觉外观与底层代码的工程质量之间取得平衡。研究人员还发现,模型的失败往往具有可预测性。有时,一个按钮出现在屏幕上,但点击时却毫无反应;有时,屏幕虽然加载了,却是完全空白的,导致用户陷入停滞状态。这些失败并非随机的故障,而是模型在理解视觉元素与其功能之间的联系时出现了特定的逻辑断裂。

为了进行这项测试,研究人员不得不发明新的衡量成功的方法,使其超越了简单的视觉对比。他们开发了一种测试导航的方法,通过从每个测试的特定、固定的起点开始,而不是让计算机在应用中进行链式漫游,这防止了一个错误毁掉整个评估过程。他们还创建了一个系统,由一个人工智能裁判将生成的屏幕与原始照片进行比较,但其中内置了一个安全检查,以确保裁判确实在认真观察,而不仅仅是在猜测。这种严谨的方法使他们能够观察到那些旧测试可能会忽略的细微差别。研究结论指出,尽管人工智能在将图片转化为代码方面取得了显著飞跃,但它尚未准备好在复杂的多屏幕项目中取代人类设计师和工程师。这项技术可以构建应用程序的骨架,但在导航的肌肉记忆以及使应用感觉真实可靠的设计细节一致性方面,它仍然面临挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →