← 最新论文
💻 computer science

RoboFind: Multi-Agent Personalized Object Search for People Who Are Blind or Have Low Vision

RoboFind 是一个多智能体框架,它通过将基于智能手机的教学界面与四足机器人的自主搜索与验证能力相结合,使盲人和低视力用户能够定位特定的个人物品,从而实现了比基准方法显著更高的成功率和可靠性。

原作者: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

发布于 2026-09-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruiping Liu, Shaofang Quan, Qian Yin, Jingqi Zhang, Junwei Zheng, Yufan Chen, Di Wen, Weijia Fan, Kailun Yang, M. Saquib Sarfraz, Tamim Asfour, Kunyu Peng, Rainer Stiefelhagen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

对于盲人或低视力人士而言,世界通常是通过声音、触觉和记忆来感知的。虽然技术在长期以来为辅助移动提供了工具,例如导盲犬或盲杖,但仍存在着一种不同的挑战:在房间里寻找特定物品。目前的解决方案通常依赖于用户走动、拿着相机,并寄希望于捕捉到所寻找目标的瞬间。如果物体被椅子遮挡或藏在角落里,相机就无法看到它,搜索也会失败。研究人员一直在思考的问题是,机器人能否接管物理搜索的工作,在用户安全留在原处的情况下,通过在空间内移动来寻找物品,且无需用户亲自看到结果。

这正是名为 RoboFind 的新系统所解决的核心问题。在德国卡尔斯鲁厄理工大学工作的研究人员构建了一个框架,将用户持有的智能手机与一台执行搜索任务的四足机器人连接起来。该系统旨在处理一个非常具体的难点:寻找特定的物品,比如一个心爱的蓝色背包或一副特定的眼镜,而不仅仅是该类别的任何物品。一个只能找到“一个背包”的机器人可能会带回错误的一个,让用户感到沮丧。RoboFind 通过将任务分为两个截然不同的阶段来解决这个问题:教机器人要找什么,然后验证它是否找到了完全正确的那个东西,之后再告知用户任务已完成。

过程始于用户对机器人的教学。使用一款专为语音和触控设计的无障碍智能手机应用,用户可以录制目标物体的短视频。应用会引导用户围绕物体移动手机,从正面、侧面和顶部进行拍摄,并更换不同的背景。这不仅仅是一个简单的照片;系统通过分析这些视频来创建一个详细的数字档案。它存储了一组视觉参考资料,精确描述了那个特定背包的具体外观,从而将其与家中的任何其他包区分开来。一旦保存了该档案,用户就可以从列表中选择它并要求机器人去寻找。

当搜索开始时,一台形状类似于狗的四足机器人进入房间。它不知道物体在哪里,因此使用导航系统来探索环境,通过前进、转向和扫描空间来进行探索。当机器人的导航系统认为它发现了一个潜在的匹配项时,它会停下来。然而,这正是该系统与以往尝试的不同之处。机器人并没有立即宣布找到了物体,而是暂停下来,并将它所看到的图片发送回智能手机进行二次检查。软件的另一个部分会将这张新图片与教学阶段创建的原始参考库进行对比。它会问一个简单的问题:这个看起来是否与我学习到的那个特定物品完全一致?

如果图片与存储的参考资料高度吻称,机器人就会确认发现并向用户报告成功。如果图片不匹配——例如,机器人停在了一个看起来很像但并非正确目标的黑色包包前——系统就会拒绝该候选目标。机器人并不会放弃;它会清除该位置的记忆,转身并继续搜索,直到找到正确的物品。这种搜索、停止、检查以及接受或继续搜索的循环,是该系统的核心。它确保机器人不仅仅是根据一般描述进行猜测,而是通过验证物体的身份,在宣布任务完成之前确保万无一失。

研究人员在现实场景中测试了该系统,包括卧室、客厅、厨房甚至花园。他们进行了 32 次独立的任务,涉及 10 种不同的目标物体,范围从可移动的物品(如雨伞和毛巾)到固定物品(如椅子和马桶)。在这些试验中,该系统的成功率达到了 85%。为了理解这一效果如何,研究人员将其与一种更简单的方法进行了对比,即机器人会在看到第一个看起来有点像的物体时就停下并宣布胜利。那种更简单的方法成功率仅为 25%,且有四分之三的概率出错,经常给用户带来错误的物品。新系统也优于仅依赖强大人工智能模型而没有特定验证步骤的版本,后者的成功率在共享试验中不足一半。

数据表明,花费额外的时间进行检查和重新搜索是值得的。虽然成功的任务平均耗时约三分四十五秒,但系统很少出错。相比之下,较简单的方法虽然速度更快,但经常导致“虚假成功”,即机器人声称找到了物体,但实际上并未找到。验证步骤至关重要;它过滤掉了几乎所有的错误停顿。当机器人停在错误的地方时,系统会捕捉到错误,让机器人重新出发,并最终找到正确的物体。这种从错误中恢复并持续搜索直到找到精确匹配的能力,使其对于无法通过视觉确认结果的用户来说是可靠的。

研究还观察了系统如何处理不同类型的物体。对于可以移动的物品,如杯子或背包,系统依赖于物体本身的视觉外观。对于保持原位的物品,如书桌旁的一把特定椅子,系统也会检查周围环境以确保物体处于预期的语境中。这种区别使得机器人能够应对现实家庭的复杂性,因为家中可能存在许多相似的物体。研究人员指出,虽然该系统非常有效,但并非完美无缺;在少数罕见情况下,机器人难以区分非常相似的物品或遇到技术中断,但这些都是例外而非规律。

最终,这项工作证明了机器人可以成为视障人士可靠的伙伴,不仅是帮助他们从一个地方移动到另一个地方,而是通过主动寻找他们的个人物品来提供帮助。其关键创新在于将“搜索”与“确认”分离。通过让机器人承担在空间内移动的繁重体力活,并使用严格的检查来确保找到正确的物体,该系统弥补了机器人所见与用户所需之间的鸿沟。结果表明,通过这种多步骤验证,机器人可以超越简单的导航,成为日常任务中可靠的助手,让用户确信,当机器人说它找到了他们的物品时,它确实已经找到了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →