LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift
本文介绍了 LESSViT,这是一种传感器灵活的视觉 Transformer 架构,它采用低秩空谱注意力机制和专用的掩码自编码器,以在不同光谱配置下实现鲁棒、高效且可泛化的高光谱表示学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一台机器人利用“超视”相机来识别不同类型的土壤、作物或森林。这些并非只能看见红、绿、蓝(RGB)三种颜色的普通相机,而是高光谱相机。它们能看见数百种不同的“颜色”(波长),为图像中的每一个像素生成详细的化学指纹。
然而,存在一个大问题:并非所有相机的构造都相同。
- 相机 A 可能看见 100 种颜色,主要集中在红色和近红外范围。
- 相机 B 可能也看见 100 种颜色,但主要集中在红外范围。
- 相机 C 可能看见一套完全不同的 80 种颜色,而相机 A 从未见过这些颜色。
如果你用相机 A 的数据训练机器人,当你将其切换到相机 B 或 C 时,它通常会感到困惑。这就像只通过观察金毛寻回犬来教某人识别狗;当他们看到贵宾犬时,就不知道那是什么了。
本文介绍了一种名为LESSViT的新型机器人“大脑”,旨在解决这一确切问题。以下是其工作原理的通俗解释:
1. 问题:昂贵的“大脑”
此前让机器人理解这些相机的尝试只有两个糟糕的选项:
- 选项 A(懒惰法): 机器人忽略颜色的具体顺序,仅仅将它们视为一堆杂乱的数据。这种方法很快,但它忘记了“红色”不同于“蓝色”,因此当相机改变时就会失败。
- 选项 B(过度思考法): 机器人试图同时查看图像中的每一种颜色和每一个位置,以理解它们之间的关系。这非常聪明,但需要巨大的计算能力,导致当颜色数量达到数百种时,计算机会崩溃(或耗时极长)。
2. 解决方案:LESSViT(“智能整理者”)
作者创建了LESSViT,它使用了一种名为LESS 注意力机制的巧妙技巧。
类比:图书馆与书架
想象你有一个图书馆,里面有 本书(空间位置),每本书有 个章节(光谱颜色)。
- 旧方法: 为了理解故事,你试图将每一本书的每一页与其他每一页进行比对。如果你有 1,000 本书和 100 个章节,那就是万亿种组合。这不可能完成。
- LESSViT 方法: LESSViT 意识到“故事”(空间)和“语言”(光谱)是相关但独立的,因此它不会一次性阅读所有内容。
- 它创建一个故事摘要(空间摘要)。
- 它创建一个语言摘要(光谱摘要)。
- 然后,它使用一种“低秩”捷径将这两个摘要结合起来。
这就像听一首歌。你不需要试图同时记住每种乐器演奏的每一个音符,而是分别学习旋律(空间)和节奏(光谱),然后将它们组合在一起。这使得数学计算变得快得多(从“不可能”变为“可行”),同时仍保持机器人足够聪明以理解细节。
3. 实现灵活性:“通用适配器”
为了处理不同的相机,LESSViT 具备两个特殊功能:
- 通道无关的块嵌入: 想象一个通用电源适配器。无论相机有 50 个插头还是 200 个插头,LESSViT 都能插上并工作。它不在乎相机看见了多少种“颜色”;它只是按原样处理它们。
- 波长感知的位置编码: 普通机器人认为“通道 1"总是第一种颜色。LESSViT 知道“通道 1"在一台相机上可能是 500 纳米(绿色),而在另一台相机上可能是 700 纳米(红色)。它关注的是实际的波长(物理颜色),而不仅仅是插槽编号。
4. 训练:“捉迷藏”游戏
为了在不依赖数百万个标记样本的情况下训练这台机器人,他们使用了一种名为HyperMAE的方法。
- 游戏: 他们向机器人展示一张图像,但隐藏(掩蔽)了大部分颜色和大部分位置。
- 挑战: 机器人必须猜测缺失的部分。
- 转折: 他们独立地隐藏颜色和位置。这迫使机器人学习到物体的“形状”和“化学颜色”是相互关联但 distinct 的,使其即使在相机改变时也能非常擅长猜测。
5. 结果:“变色龙”效应
研究人员在名为SpectralEarth的大型数据集上测试了 LESSViT。
- 测试: 他们在一种特定的相机设置(120 种颜色)上训练机器人,然后在以下设置中测试它:
- 相同的设置(简单)。
- 具有不同颜色的设置(困难)。
- 具有机器人从未见过的全新颜色的设置(非常困难)。
- 具有比训练时更多颜色的设置(扩展)。
结果:
- 旧模型: 当相机改变时,它们会感到困惑并严重失败(准确率有时下降 50-90%)。
- LESSViT: 它保持强劲。即使相机改变为一套完全不同的颜色,它也只损失了少量准确率。它证明,通过明确理解空间与光之间的关系,机器人可以在无需从头重新训练的情况下适应新传感器。
总结
LESSViT 是一种新型人工智能,它学习通过高光谱相机观察世界。它不再僵化,不会因相机改变而崩溃,而是利用一种聪明、高效的数学技巧,将“事物在哪里”与“它们是什么颜色”分离开来。这使它能够可靠地在不同传感器上工作,使其成为从太空分析地球的稳健工具,无论拍摄照片的是哪颗卫星或无人机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。