← 最新论文
💻 computer science

Time-Aware Assistive Navigation

本文介绍了一个用于时间感知辅助导航的大规模基准测试,利用多模态大语言模型,揭示了虽然对指令推理进行直接监督能显著提高性能,但目前的模型在关键的时间推理和安全意识方面仍然存在困难。

原作者: Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你被蒙着眼睛站在一个繁忙的城市路口,完全依赖一个声音来引导你前进。在这种情况下,那个声音的时机与它所说的话语同样关键。如果引导者说话过多,听者会感到不知所措并分心;如果他们说话太少,或者在错误的时机说话,听者可能会步入危险之中。这种在沉默与言语之间的微妙平衡,是旨在协助视障人士的一种新型人工智能所面临的核心挑战。现代计算机在描述图像中所见内容方面已经变得非常出色,但它们却难以理解现实生活的节奏。它们往往不知道何时该说话,何时该保持沉默,而这对于在混乱的世界中确保安全至关重要。

一组研究人员通过创造一种新的测试方法和一种新的训练方式,来指导人工智能扮演实时向导的角色,从而解决了这一问题。他们构建了一个名为 TIMELI 的系统,其全称为“时间感知语言指令基准”(time-aware language instruction benchmark)。该系统的设计初衷不仅是教计算机说什么,还要教它准确地在何时说。研究人员首先观察了人类向导是如何实际帮助盲人导航的。他们发现,资深向导在路口时通常保持沉默,让行人能够倾听交通状况并利用其他感官;他们只在出现新障碍物或需要转向时才开口。他们还发现,向导会避免给出冗长、复杂的解释,而是倾向于使用简短、清晰的指令,如“向前走”或“稍微向右转”。

为了教会计算机这项技能,研究人员首先必须建立一个可以安全练习的世界。由于在真实的城市中对真人进行测试风险过高,他们创建了一个详细的计算机城市模拟器。在这个数字世界中,他们生成了数千段视频剪辑,展示了人们在人行道上行走、穿过街道以及绕过其他行人和障碍物的场景。他们编写程序使模拟器能够模仿真实城市的复杂条件,包括不同的天气模式和交通流量。利用这些数据,他们创建了一个庞大的示例库,展示了说话的最佳时刻和保持沉默的最佳时刻。

当研究人员将标准的、现成的(off-the-shelf)人工智能模型应用于这项任务时,结果令人失望。即使是最先进的模型(通常在回答有关图像的问题方面表现出色),也无法理解时机的把握。它们倾向于不停地说话,提供一种流水账式的解说,这会分散真实用户的注意力。它们经常在应该保持沉默的时候说话,例如在行人穿过街道时,同时也经常错过真正需要发出警告的关键时刻。研究表明,仅仅给这些模型提供更多的阅读数据并不能解决问题。这些模型并非为了思考事件的序列或情况的紧迫性而构建。

为了解决这个问题,研究人员改变了训练模型的方式。他们不再只是要求计算机描述场景,而是强迫它首先决定自己为什么要说话。在生成句子之前,模型必须先对自己的意图进行分类,从诸如“保持沉默”、“警告障碍物”或“给出方向”等选项中做出选择。这个简单的步骤——让模型思考其说话的原因——极大地提高了它的表现。研究人员还增加了一个特定的检查机制,以确保模型知道何时停止说话。通过训练系统去预测在任何给定秒钟内是否有必要进行指令,他们教会了它做到简洁且及时。

这种新方法的成果是显著的。在计算机模拟中,改进后的模型学会了在适当的时候保持沉默,并仅在必要时说话,就像人类向导一样。它们成功减少了不必要的词汇,并避免了在用户穿过街道时说话这一危险习惯。当研究人员将这些模型应用于它们从未见过的真实世界视频片段时,系统仍然能够迁移其技能,尽管表现得比在模拟中稍逊一筹。在最后一项测试中,当计算机指令被用于控制一个在城市中行走的虚拟行人时,表现最好的模型成功引导该行人到达目的地一半的次数,且未发生碰撞或迷路。

这项工作凸显了当前人工智能的一个根本局限性:描述世界的能力并不自动意味着能够安全地与之交互。研究证明,对于辅助技术而言,要实现真正的实用性,它必须理解时间的流动和当下的语境。仅仅让机器变得聪明是不够的,它还必须知道何时保持沉默。虽然这项技术尚不完美,在理解复杂距离和物体间关系方面仍面临挑战,但这项研究提供了一条清晰的前进路径。通过教会机器去推理其行为的时机,我们可以更接近于创造出智能向导,为在世界上穿行的各类人群提供安全、可靠且真正有帮助的支持。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →