← 最新论文
💻 computer science

LongStream: Long-Sequence Streaming Autoregressive Visual Geometry

本文提出了 LongStream,一种通过预测关键帧相对姿态、解耦尺度学习以及采用缓存一致性训练与定期刷新机制,从而在严格在线设置下实现公里级长序列稳定、无漂移度量尺度重建的流式视觉几何模型。

原作者: Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

发布于 2026-03-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 LongStream 的新 AI 模型,它的核心任务是:让机器人或自动驾驶汽车在“边走边看”的过程中,能够连续、稳定地构建出长达数公里的 3D 地图,而且不会“迷路”或“崩溃”。

为了让你更容易理解,我们可以把这项技术想象成**“一个拥有超强记忆力和方向感的旅行家”**。

1. 以前的“旅行家”为什么容易迷路?(现有技术的痛点)

想象一下,你让一个旅行家(现有的 AI 模型)去画一张地图。

  • 传统做法(离线模式): 让他走完整个旅程,把照片全拿回来,坐在桌子前慢慢拼。这很准,但太慢了,没法实时用。
  • 以前的流式做法(Streaming): 让他边走边画,每走一步就画一步。这很快,但有个致命问题:
    • 死记硬背的“原点”: 以前的模型就像是一个死板的学生,它把第一张看到的照片当作绝对的“世界中心”(锚点)。
    • 记忆过载与偏差: 随着路越走越远(比如走了几公里),它脑子里关于“第一张照片”的记忆太深了,导致后面所有的判断都歪向那个起点。这就好比你走了一万步,却还在死死盯着出发时的那块石头,导致你算出来的位置越来越偏,最后地图直接崩塌(就像论文图 1 里展示的,走几十米就乱成一团)。
    • 注意力偏差: 它的“注意力”像聚光灯,总是死死盯着第一个画面(这叫"Attention Sink"),忽略了眼前正在发生的事情。

2. LongStream 是怎么解决的?(三大创新法宝)

LongStream 给这个旅行家换了一套全新的“生存法则”,让它能走几公里而不迷路。

法宝一:扔掉“原点”,只记“相对位置”(Gauge-Decoupled Pose)

  • 旧习惯: “我离起点有多远?”(这很难算,因为起点太远,误差会累积)。
  • 新习惯: “我离刚才那个关键路口有多远?”
  • 比喻: 以前是让你从北京走到上海,一直算离北京的距离,算到最后肯定算错。LongStream 让你只算“从上一个休息站到当前站”的距离。
  • 效果: 无论走多远,每次只算一小段,难度永远一样,永远不会因为距离太远而算错。这就叫**“解耦”**(把全局坐标和局部位置分开)。

法宝二:把“形状”和“大小”分开管(Orthogonal Scale Learning)

  • 问题: 有时候 AI 会把地图画得很大,有时候很小,就像把照片随意缩放,导致距离感混乱。
  • 解决: LongStream 把“画形状”和“定大小”分给两个不同的部门管。
    • 形状部门: 只管物体长什么样、相对位置在哪(不管它是大是小)。
    • 大小部门: 专门负责看路标,告诉形状部门“现在这个场景是真实的 1 米,还是 10 米”。
  • 效果: 就像盖房子,先搭好骨架(形状),再最后统一刷漆定尺寸(尺度)。这样就不会因为尺寸搞错导致房子塌了。

法宝三:定期“清理大脑缓存”(Cache-Consistent Training & Refresh)

  • 问题: 人的大脑(AI 的缓存)如果一直塞满从出发开始的所有记忆,后面进来的新信息就挤不进去了,而且旧信息会干扰新判断。
  • 解决:
    1. 训练时模拟真实: 在教 AI 的时候,就故意让它像走路一样,只保留最近的一段记忆,把太老的记忆“修剪”掉。
    2. 定期刷新: 每走一段路(比如每经过几个关键路口),就强制把脑子里那些“过时的、有污染的”旧记忆清空,只保留最核心的框架。
  • 比喻: 就像你的浏览器开了 1000 个标签页,电脑会卡死。LongStream 会定期关闭那些没用的旧标签页,只保留当前正在看的几个,保证运行速度飞快且稳定。

3. 它有多厉害?(实际效果)

  • 跑得快: 每秒能处理 18 帧画面(18 FPS),就像看高清视频一样流畅,可以实时用在自动驾驶或 AR 眼镜上。
  • 跑得远: 以前走几十米就“晕”了,现在能稳定地走几公里(比如 2.45 公里),而且地图是真实比例的(Metric-scale),不是那种忽大忽小的模糊图。
  • 稳得住: 无论是在复杂的室内(像迷宫一样的房间),还是在户外(像高速公路),它都能画出连贯、不崩塌的 3D 地图。

总结

LongStream 就像是一个**“不念旧情、只关注当下、定期清理记忆”**的超级向导。

它不再死盯着“出发地”,而是专注于“刚才那一步”;它不再让“大小”和“形状”互相打架;它还会定期清理大脑里的垃圾信息。正是这些聪明的策略,让它成为了目前世界上能在超长距离上实时构建精准 3D 地图的最强 AI 模型之一。

这对于未来的自动驾驶汽车(需要看几公里外的路况)、机器人(在巨大仓库里不迷路)和AR 眼镜(在公园里实时叠加虚拟信息)来说,是一项巨大的突破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →