← 最新论文
💻 computer science

Large Language Models for Web Accessibility: A Systematic Literature Review

本文对 38 项研究进行了系统性文献综述,这些研究分析了大型语言模型当前如何应用于网络无障碍任务,突显了其主要集中在以文本为中心的问题和 Web 内容无障碍指南(WCAG)方面,同时指出了在解决认知无障碍问题以及让残障用户参与评估方面存在的显著差距。

原作者: Wajdi Aljedaani, Rubel Hassan Mollik

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Wajdi Aljedaani, Rubel Hassan Mollik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将互联网想象成一座巨大而繁忙的城市。要让这座城市真正“无障碍”,就必须让每个人都能轻松通行,无论他们使用的是轮椅、导盲犬、助听器,还是拥有不同的思维方式。不幸的是,这座城市的许多区域目前仍建有人行道破损、标识缺失或布局混乱的问题,阻碍了残障人士的通行。

近年来,一种名为**大型语言模型(LLM)**的“超级智能助手”进入了这座城市。你可以将 LLM 想象为一个博览群书、语速极快的机器人,它能够编写代码、描述图片并修正文本。研究人员一直在追问:这个机器人能否帮助我们重建这座城市,使其更加无障碍?

本文是一篇系统文献综述,就像一份侦探报告。作者(Wajdi Aljedaani 和 Rubel Hassan Mollik)收集并分析了33 项不同的研究(摘要中提及 38 项,但方法论部分的最终统计为 33 项),以确切了解这些机器人如何被用于解决互联网的无障碍问题。

以下是他们发现的简要总结:

1. 机器人正在承担哪些工作?

研究人员发现,这些 AI 机器人主要被用作专项助手,而非全职的城市规划师。它们正在执行具体且重复的任务:

  • 撰写描述:如果网站上的图片缺少描述,机器人会为其撰写(例如为视障人士描述照片)。
  • 发现破损标识:机器人扫描网页,找出其中破损或令人困惑的内容。
  • 修复代码:发现问题后,机器人会建议如何重写代码以修复它。

比喻:想象一支施工队。机器人是那些擅长粉刷墙壁或铺设砖块的工人(修复特定的文本或代码),但目前它们并未被要求重新设计整座建筑的架构。

2. 它们遵循哪些规则?

互联网拥有一套名为**WCAG(网页内容无障碍指南)**的无障碍“规则手册”。这就像城市的建筑规范。

  • 好消息:几乎所有研究都使用了这本规则手册。机器人被训练用来检查网站是否遵循这些规则。
  • 缺失的一环:还有一套针对认知无障碍(帮助学习障碍人士或那些容易被复杂文本压垮的人)的规则,称为COGA。研究人员发现,机器人几乎忽视了这些规则。它们擅长修复视觉问题(如颜色对比度),但往往忘记了如何让内容更易于大脑理解。

3. 它们使用的是哪些机器人?

这些研究主要依赖大型、知名且通用的机器人(如 GPT-4、ChatGPT 和 Claude)。

  • 比喻:这就像试图仅用一把瑞士军刀来修复整座城市。这些工具功能强大且用途广泛,但研究人员并未构建专门针对无障碍设计的定制工具。它们只是利用手头已有的通用工具,并让它们去完成任务。
  • 如何与它们交互:大多数研究人员只是向机器人提问(即“提示”),例如“修复这个网站”。他们并未构建复杂的系统,让机器人之间相互对话或随时间进行学习。

4. 它们正在解决哪些问题?

机器人主要修复那些“容易”的视觉问题:

  • 缺失的替代文本:描述图片。
  • 糟糕的颜色:确保文字与背景形成鲜明对比。
  • 混乱的标题:组织文本,以便屏幕阅读器能够导航。

它们遗漏了什么:它们很少修复与时间相关的问题(如缺少字幕的视频)、复杂的导航或难以阅读的内容。此外,它们有时还会编造事实(称为“幻觉”),例如描述照片中实际上并不存在的物体。

5. 我们如何知道它们有效?

这一点让报告显得有些批判性。研究人员考察了这些工具在研究中是如何被测试的。

  • 问题:许多研究是通过其他计算机测试机器人,或请专家查看结果。极少有研究真正邀请残障人士来使用这些工具。
  • 比喻:这就像测试一个新的轮椅坡道时,只是让木匠看着它说“看起来不错”,而不是让坐轮椅的人实际尝试推上去。
  • 结果:我们知道机器人能够修复代码,但我们没有足够的证据证明这些修复在实际世界中真正帮助了真实的人。

结论

本文总结认为,大型语言模型是使网络更加无障碍的有前途的助手,但目前它们的使用方式较为有限。

  • 它们擅长修复视觉和结构性文本问题。
  • 它们主要遵循标准的视觉规则(WCAG),却忽视了思维/认知规则(COGA)。
  • 它们主要由计算机和专家进行测试,而非由它们旨在帮助的人群进行充分测试。

作者建议,未来我们需要构建更好的系统,以理解认知需求,停止仅依赖那些“大型”通用机器人,并且最重要的是,与真实的残障人士一起测试这些工具,以确保它们确实有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →