MCP-Driven Accessibility Tree Standardization for AI-Powered Screen Reader Agents
本文提出了一个概念性框架,该框架利用模型上下文协议(MCP)将异构的特定平台无障碍 API 统一为一个标准化的、语义丰富的层,以供基于大语言模型的屏幕阅读器智能体使用,从而在降低集成复杂度的同时,实现持久的用户偏好和一致的跨平台交互。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,计算机与无法看到屏幕的人进行交流的方式一直依赖于一个隐藏的翻译层。当用户在电脑上打开一个窗口或在手机上打开一个页面时,软件不仅仅是在绘制像素;它还在构建一张关于这些像素代表什么的秘密地图。这张地图列出了每一个按钮、链接和文本框,并为它们分配名称和角色,例如“提交按钮”或“标题”。屏幕阅读器软件通过朗读这张地图,让盲人用户能够通过聆听而非观察来在数字世界中导航。然而,一种新型的计算机程序最近出现了:人工智能代理(AI agents),它们可以观察屏幕并像人类一样自行点击按钮。这些代理旨在通过自主执行任务来帮助残障人士。为了实现这一目标,它们需要理解屏幕,但目前面临着一个艰难的选择。它们要么拍摄一张屏幕照片并尝试猜测一切内容的含义,要么尝试阅读那张秘密地图。这两种方法都有缺陷。拍摄照片会丢失屏幕阅读器所依赖的精确名称和角色,而阅读地图则通常速度缓慢,且需要为每一种类型的计算机或手机构建不同的翻译器。
来自美国公司和大学的一个研究小组提出了解决这一问题的新方法。他们建议构建一个位于计算机操作系统和人工智能代理之间的通用翻译器。该系统不再强迫人工智能去分别学习如何阅读 Windows、macOS、Android 和网络浏览器的秘密地图,而是作为一个单一的标准桥梁。研究人员将这个桥梁称为“模型上下文协议”(Model Context Protocol)。他们设计了一个系统,让计算机原生的辅助功能将信息输入到一个中央服务器中,然后由该服务器对信息进行清理,并以整洁、一致的格式呈现给人工智能。该服务器还会记住用户的特定需求,例如他们希望信息读取的速度有多快,或者按钮必须有多大,并将这些信息安全地保留在不同的会话和设备之间。其目标是让人工智能代理能够根据需求请求特定的内容——例如屏幕的某个特定部分或一组操作列表——而不必每次都下载整个界面地图。
研究人员并没有构建一个完全可运行的版本来在真人身上进行测试。相反,他们创建了一个详细的架构方案,并将其与目前领域内使用的方法进行了对比。他们分析了现有的 AI 代理是如何感知屏幕的,研究了速度、准确性和开发软件所需精力的权衡。他们的分析表明,所提出的系统将显著减少支持不同平台所需的工程量。目前,开发者必须为每个操作系统编写独特的代码来提取信息。有了这个新标准,他们只需要编写一套指令来连接到这个桥梁,剩下的工作将由桥梁处理。研究人员还发现,通过仅请求屏幕地图中微小且特定的部分,而不是整个地图,该系统可以节省大量的计算机内存,而这正是人工智能模型的关键约束条件。
然而,这项研究也明确指出,这种新桥梁无法解决现有技术中存在的根本问题。人工智能观察屏幕的速度仍然受限于计算机自身操作系统提供信息的速率。如果手机或电脑上的原生地图生成速度很慢,那么新系统也会很慢。研究人员强调,他们的提议并不会神奇地加速底层技术;它只是更有效地组织了信息的流动。他们还指出,该系统依赖于计算机提供信息的质量。如果原始地图缺失标签或存在错误,新系统无法凭空创造缺失的细节。它只能翻译已有的内容。
该团队确定了其提议最具价值的三个主要领域。首先,它为人工智能代理创造了一种与任何屏幕对话的共享语言,消除了为每种设备构建定制解决方案的需求。其次,它允许系统记住用户的残障特征(例如他们偏好的阅读速度或导航方式),以便代理在每次登录时都能自动适应用户。第三,它提供了一种以小块数据请求信息结构化方式,防止人工智能被过多的数据淹没。研究人员认为,虽然他们的想法还不是一个成品,但它提供了一条清晰的前行路径。他们建议,下一步是为至少两种不同类型的计算机构建一个工作原型,以测量实际的速度和准确性。在此之前,他们的工作是关于如何让人工智能代理对那些最需要它们的人来说更加可靠且更容易构建的一份蓝图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。