StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design
StepX-Edge 是一个拥有 0.9B 参数的端侧视觉语言模型,它通过 UI 感知架构、协同五阶段训练课程以及高精度量化策略的新颖协同设计,实现了最先进的 UI 理解能力以及在移动芯片上的高效实时部署。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑,它既能读懂书籍,也能观察图片并回答相关问题。这就是**视觉语言模型(Vision-Language Models, VLMs)**的世界。长期以来,这些大脑都生活在拥有庞大服务器的巨型云端数据中心里,因为它们需要极高的算力和内存来进行思考。但如果能把这个大脑缩小到可以装进你的智能手机里呢?这就是梦想所在:拥有一个能够观察你的手机屏幕、理解你的操作并帮助你点击正确按钮,且无需联网的 AI。
问题在于一个经典的权衡。为了让大脑足够聪明,能够读懂屏幕上的微小文字或找到特定的图标,你通常需要大量的“神经元”(参数),这会让它变得臃型的且运行缓慢。但你的手机在电池、内存和处理能力方面有着严格的限制。如果你把大脑缩得太小,它就会变笨并开始出错,比如把“关闭”按钮误认为“保存”按钮。如果你保持它的规模,它会在几分钟内耗尽你的电量。科学家们一直试图解决这个“准确度 vs 效率”的谜题,往往必须在“聪明但慢”的模型与“快速但笨”的模型之间做出选择。
于是,StepX-Edge 项目应运而生,该项目声称破解了这个密码。研究人员构建了一个仅有 0.9 亿参数(对于此类任务而言这是一个非常小的尺寸)的微型 AI 模型,直接在手机上运行。他们不仅仅是缩小了一个现有的巨型模型,而是从底层进行了重新设计。这就像是打造一辆定制的赛车,而不是仅仅给卡车换了一个更小的发动机。
首先,他们重新设计了架构(赛车的车架)。他们为模型创建了一个特殊的“眼睛”,这个眼睛对手机屏幕的奇特形状(通常是高瘦型的,不像正方形照片那样)非常痴迷,并建立了一座“桥梁”,将眼睛所见的景象连接到大脑的语言技能,且不会丢失任何细节。他们避开了手机难以处理的那些华丽、复杂的部件,转而使用标准且可靠的部件,以便在移动芯片上流畅运行。
其次,他们改变了训练方式(驾驶员学校)。他们没有将模型投入到各种类型数据的混乱混合中,而是采用了“课程学习”的方法。他们发现,同时教导模型四项技能——阅读文本(OCR)、理解屏幕布局、回答问题以及指向特定按钮——实际上能让这些技能共同提升。这就像一个学生同时学习钢琴和国际象棋;学习其中一项所需的专注力有助于提升另一项。他们分五个阶段对模型进行训练,从简单的对齐开始,逐渐过渡到复杂的现实世界屏幕交互,确保这四项技能能够相互强化,而不是互相干扰。
最后,他们掌握了部署技术(引擎调校)。为了让模型适配手机,他们必须对其进行深度压缩,而这通常会破坏模型的智能。团队使用了一种巧妙的两步压缩技术。他们对“眼睛”(视觉部分)和“大脑”(语言部分)采取了不同的处理方式:将大脑压缩到极小的 4-bit 大小,同时保持眼睛较高的精度。随后,他们使用一种特殊的训练方法来“教导”压缩后的脑如何补偿细节的损失,从而将准确度的损失控制在 1% 以内。
结果如何?在高端手机芯片(骁龙 8 Gen5)上,这个微型模型运行稳定。它能观察截图、理解内容并开始回答问题,耗时仅需约 0.84 秒,生成文本的速度达到 98 token/秒,且仅占用 1.4 GB 的内存。在测试中,这个 0.9B 的模型在阅读屏幕上的中文文本和回答有关显示内容的问题等任务上,击败或匹配了规模大得多的模型(有些模型的参数量为 2 到 2.3 亿)。作者指出,通过对架构、训练和部署进行精心的协同设计,实现一个既具备高能力又无需在准确度和速度之间做取舍的设备端 AI 是完全可能的,这为完全生活在手机里的智能助手打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。