← 最新论文
🤖 AI

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA 是一个实时框架,通过利用增强型注意力 LSTM 和时间稳定模块将手语姿态转换为语义指令,从而增强了人机交互中的无障碍能力,使视觉-语言-动作模型能够为聋哑及言语障碍用户执行机器人操控任务。

原作者: Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个通常只能通过语音或键盘输入指令来理解你的机器人。现在,想象同一个机器人如果能通过你的手势(手语)来“交流”也能理解你。这正是 SignVLA 系统所做的事情。

以下是其工作原理的简单拆解,使用了日常类比:

问题所在:只有“听觉”的机器人

当今大多数先进的机器人使用视觉-语言-动作 (VLA) 模型。可以将这些模型看作机器人的大脑:它观察场景,读取文本指令(如“拿起杯子”),然后移动机械臂去执行。

然而,这些机器人通常只能“听”懂口语或输入的文本。这为聋哑人士或无法说话的人群制造了障碍。这就像是一位非常聪明的图书管理员,但如果你通过低声耳语或在纸条上写下请求,他才能理解你的需求,而如果你挥动手势向他要书,他却拒绝理解。

解决方案:SignVLA(“手到脑”的翻译器)

研究人员构建了一个名为 SignVLA 的系统,它充当了手势与机器人指令之间的通用翻译器。它并没有改变机器人的大脑,只是增加了一种新的沟通方式。

该系统通过三个主要步骤运行,就像一场接力赛:

1. 眼睛(观察双手)
首先,系统观看一段人做手语的视频。它并不试图理解整个画面,而是使用一个名为 MediaPipe 的工具,将注意力严格集中在手的“骨架”上。它会逐帧追踪手指、指关节和手腕的确切移动位置。

  • 类比: 想象一个监控摄像头,它忽略背景,只用一个发光的火柴人轮廓来追踪你手的运动。

2. 大脑(理解手势)
接下来,系统将这些手部动作输入到一个特殊的计算机模型中,称为 Attention LSTM

  • LSTM: 可以将其看作一个记忆库,它能记住你的手在前一秒做了什么,从而理解动作是一个“序列”(就像一个句子),而不仅仅是一个静止的姿态。
  • Attention(注意力机制): 这就像一个聚光灯。当模型观察手部动作序列时,它知道该关注手势中最重要的部分(即“关键词”),并忽略那些摇摆不定、不太重要的部分。
  • 输出: 这个部分将手部动作转化为一系列“词汇标签”(glosses,即简单的手语单词,如“苹果”、“拿起”或“篮子”)。

3. 翻译器(使其自然化)
这组手语单词列表随后会被传递给一个大语言模型(LLM),它扮演着人类翻译的角色。它将列表(例如:“拿起 黄油 篮子”)转化为机器人已经能够理解的完整、自然的句子:“拿起黄油并将其放入篮子中。”

安全保障:稳定性缓冲器

手语存在一个大问题:手部可能会抖动或快速移动,导致计算机在瞬间产生困惑。如果机器人对每一个微小的误差都做出反应,它就会开始不停地颤抖或反复改变主意。

为了解决这个问题,SignVLA 使用了时间稳定性缓冲器 (Temporal Stability Buffer)

  • 类比: 想象一个夜店的保安。如果有人喊了一次指令,保安可能会忽略它,以确保那不是在咳嗽。但如果那个人连续三次喊出相同的指令,保安才会放行。
  • 系统会观察同一个手语指令是否在连续几帧内一致出现,然后再向机器人发送指令。这防止了机器人变得“神经质”。

结果:效果如何?

研究人员在包含一个机械臂(Franka Emika Panda)的计算机模拟环境中测试了这个系统。

  • 识别率: 该系统在识别 33 个特定手语单词(如“苹果”、“瓶子”、“拿起”、“放置”)方面表现出色。它在第一次尝试时的正确率约为 89%,这比之前未使用“注意力”聚光灯的方法有了巨大的提升。
  • 机器人动作: 当机器人接收到这些翻译后的指令时,它完成诸如拿起物体并放入篮子等任务的成功率约为 95% 至 98%

核心结论

这篇论文表明,你不需要重建机器人的整个大脑就能让它理解手语。你只需要一个轻量级的、实时的“翻译器”,它负责观察手部、记忆序列、稳定信号,并将清晰的英文句子传递给机器人。

团队也已经构建了物理硬件(一个真实的机器人手臂),并正准备从计算机模拟转向实际物理机器人的真实世界测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →