The here-and-now of "real-time visual assistance". Assembling gestalt contexture in blind-sighted navigation
这项民族方法论研究探讨了经验丰富的视力引导者如何通过有条理地分割和索引环境特征,在盲人过街过程中动态地构建一个共享的“此时此地”,从而揭示了实时视觉辅助是一个组建格式塔语境的过程,而非仅仅是对既有场景的描述。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
无形的地图:我们如何共同构建现实
想象你正走在一条繁忙的城市街道上。你看到的不仅仅是随机物体的集合,比如一辆红色的汽车、一段灰色的路面和一片蓝色的天空。相反,你的大脑会瞬间将这些事物编织成一个单一的、流动的叙事:“这里可以安全过马路,”或者“那辆车正要撞到我。”在科学领域,研究人类如何理解周围环境的研究者将这种现象称为“格式塔语境”(gestalt contexture)。你可以把它想象成一个拼图游戏,其中的碎片不仅仅是静静地躺在桌子上,而是实时地拼合在一起,形成一幅能告诉你下一步该做什么的图像。通常情况下,一个群体中的每个人都拥有相同的拼图碎片,因为他们能看到同样的事物。但如果一个人失明而另一个人视力正常,情况会怎样?他们如何构建出那个相同的共享现实图像呢?
随着我们开始使用智能眼镜和人工智能助手来帮助盲人导航世界,这成为了研究人员正在探讨的核心问题。人们希望技术能够为他们描述场景,就像电影里的旁白一样。但问题在于:描述一个场景不仅仅是列举事实。它关乎时机、紧迫感,以及知道某个事实在此时此刻为何重要。如果人工智能说“有一辆车”,却在两秒钟后——即车已经驶过后才开口——它所说的描述即便在技术上是正确的,也是毫无用处的。本论文深入探讨了穿越街道这一混乱且节奏极快的现实场景,旨在研究人类是如何自然地完成这种“拼图构建”过程的,以及为什么目前的 AI 仍难以跟上这种节奏。
论文的故事:与时间的赛跑
这项研究背后的研究人员想要理解“实时视觉辅助”的秘诀。他们不仅观察了描述的准确性,还观察了对于试图过马路的人来说,这些描述有多么“及时”且“有用”。为了实现这一点,他们设置了一场非常有趣的对决,由两个截然不同的引导者进行竞技:一副带有 AI 语音的高科技智能眼镜,以及一位正在协助盲人骑手的真人教练。
AI 对阵人类:两种过街方式的故事
在第一个场景中,一位名叫劳拉(Laura)的盲人女性尝试使用 Meta 智能眼镜穿过哥本哈根的一条繁忙街道。她问 AI:“路面清空了吗?”AI 拍了一张照片,处理了一段时间,在几秒钟的沉默后宣布:“路面看起来是清空的。”
但转折点就在这里:就在 AI 忙于处理那张照片时,两辆汽车从劳拉身边疾驰而过。当 AI 开口说话时,路面实际上已经“不再清空”了。劳拉立刻意识到了这一点,因为她听到了汽车的声音。她笑了起来,对 AI 说:“显然不是。”研究人员发现,AI 的描述是“脱节的”。它就像一个游客在拍完街景后才回头描述,完全没有意识到交通灯已经变化,或者刚才有一辆车疾速驶过。AI 描述的是一张静态的照片,而不是劳拉正在经历的那个鲜活、跳动的时刻。它没能理解“清空”不仅仅意味着“照片里没有车”,更意味着“现在没有车朝我冲过来”。
在第二个场景中,研究人员观察了一位盲人骑手索菲亚(Sophia)和她的明视引导者特琳(Trine)。她们正排成一列准备过马路。当特琳看到一辆车时,她并没有只说“那里有一辆车”,而是说:“他们在等待,”以及“过来。”
这听起来可能很简单,但研究人员认为这简直是魔法。特琳不仅仅是在报告事实,她是在构建一个“共享现实”。通过说“他们在等待”,她告诉索菲亚,那辆车是属于“我们”的故事的一部分,而且现在是安全的。她使用“前面”和“后面”这样的词汇,并非将其作为地图上的方向,而是作为他们特定过街计划的一部分。她说话的时机与马匹的静止以及交通的声响完美契合。她没有描述整个世界,她只描述了索菲亚在那个精确瞬间解决问题所需的碎片。
重大发现
本论文的主要发现是,“实时”不仅仅关乎速度,它关乎连接。
人类引导者之所以成功,是因为她和索菲亚正在共同构建“此时此地”。她们将马匹的声音、看到的车辆以及过街的计划编织进了一个单一的、共享的故事中。引导者的语言不仅是在描述世界,更是在帮助创造让过街成为可能的局面。
AI 之所以失败,是因为它将世界视为一个被观察和描述的独立客体。它就像一面悬浮在空中的镜子,反射着事物却从未触碰它们。它不理解“当下”是一个眨眼间就会改变的瞬息时刻。研究人员指出,为了让 AI 真正发挥作用,它不能仅仅是一个带有声音的摄像头。它需要理解那一刻的紧迫感。它需要知道,即使它一秒钟前拍的照片显示街道是空的,但如果现在有一辆车经过,那么路面就是“不清空”的。
这对未来意味着什么
论文并未声称 AI 永远无法修复,但它确实表明目前的系统缺失了拼图中的关键一块。它们擅长描述静态场景,比如博物馆里的画作,但在应对现实生活中混乱、快速移动的舞步时却显得力不从心。研究人员建议,要解决这个问题,我们需要停止将描述仅仅视为“事实”,而应将其视为一种“行动”。对于盲人来说,一个好的描述不仅仅是列出存在什么,它应该是一个能帮助他们在此时此刻决定下一步该做什么的工具。
简而言之,过马路不仅仅是关于看路,更是关于感受交通的节奏并与之共舞。人类引导者知道如何随着那个节奏起舞,而 AI 目前仍在努力学习舞步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。