A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation
本文首次系统地评估了与语义分割基础模型相结合的四种不确定性量化方法,揭示了在域内和域外设置下,预测性能、可靠性与计算成本之间的关键权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,出现了一类被称为“基础模型”的新兴系统。这些是经过海量互联网图像训练的庞大数字大脑,它们学习识别模式的方式具有以往传统计算机程序所不具备的灵活性。它们可以观察一张照片并识别出物体,从沙发上的猫到街道上的汽车,其精度令人惊叹。这种为图像中的每一个像素分配标签的能力被称为“语义分割”,它是自动驾驶汽车和医学影像软件等技术背后的视觉引擎。然而,这种力量往往伴随着一个危险的缺陷:这些系统经常表现得过度自信。即使在图像模糊、光照异常或物体是它们从未见过的东西时,它们也会以绝对确定的语气宣布答案。在涉及高风险的情况中,例如汽车在雾天行驶或医生查看扫描图时,这种盲目的自信可能会导致灾难性的错误。为了解决这个问题,研究人员正在开发一种方法,教导这些模型了解它们“不知道什么”,这一概念被称为“不确定性量化”。这并不是要让模型减少猜测,而是要为它内置一个报警系统,当它感到不确定时发出信号,从而允许人类在错误发生前介入。
德国卡尔斯鲁厄理工学院的一个研究小组通过测试将“不确定性报警器”附加到目前最强大的基础模型之一时效果如何,在解决这一问题方面迈出了重要一步。他们专注于一个名为 SAM2 的模型,该模型以理解图像的能力而闻名,并将它与一个更简单、轻量级的解码器配对,以创建一个能够进行语义分割的系统。他们的目标是看是否能让这个强大的系统不仅准确,而且可靠。他们并没有从零开始发明一种新型人工智能;相反,他们采用了现有的、预训练好的基础模型并对其进行了微调,就像音乐家拿着一件大师级的乐器并调整琴弦以完美演奏特定的曲目一样。随后,他们测试了四种用于为该系统添加不确定性感知能力的不同方法。一种方法是要求模型多次观察同一张图像,并带有轻微的随机变化,以观察其答案是否会发生改变。另一种方法是使用一组略有不同的模型版本共同对答案进行投票。第三种方法是要求模型明确计算它对每个可能答案拥有多少证据,而第四种方法是在推理过程中向模型顺序展示同一图像的多个增强版本,以观察其预测的一致性。
研究人员使用两组截然不同的图像对这些系统进行了严格测试。第一组显示了城市中晴朗、阳光充足的街景,代表了一个标准的、受控的环境。第二组显示了室内房间,这些房间通常杂乱且复杂。为了真正测试这些系统的极限,他们还向模型展示了那些在重雨或浓雾覆盖下的相同街道图像,而这些情况在它们的训练过程中从未出现过。这使得团队不仅可以衡量模型在熟悉领域中的表现,还可以衡量它们处理突发状况的能力。结果揭示了一个清晰且困难的权衡。没有任何添加不确定性特征的系统速度最快,并能生成非常准确的街道地图,但它经常过度自信,并且在出错时无法发出警告。当研究人员添加不确定性特征时,模型变得更擅长于知道自己何时不确定,但这付出了代价。提供最佳不确定性警告的方法明显变慢了,处理每张图像所需的时间更长。其中一种依赖于模型组投票的方法提供了最高质量的警告,但与在标准数据集上的基础系统相比,其计算时间大约增加了五倍。另一种尝试直接计算证据的方法虽然速度很快,但表现很差,经常无法识别自身的错误。
或许最重要的发现是,并不存在单一的完美解决方案。对于雨天街道表现最好的方法,与对于室内房间表现最好的方法是不同的。在雨天条件下,一种向模型顺序展示多个图像版本的方法提高了校准度和不确定性质量,尽管另一种使用随机采样的方案实际上获得了略高的分割准确度。然而,在雾天条件下,另一种使用模型组的方法在识别最具不确定性的区域方面表现得更为出色。这项研究表明,虽然使这些强大的基础模型变得可靠是可能的,但这需要根据具体情况做出谨慎的选择。如果速度是最关键的因素,例如在实时视频流中,研究人员发现最简单、最快的模型可能仍然是最佳选择,即便它的可靠性较低。如果安全性是绝对的优先项,例如在医学诊断中,那么即使会有延迟,使用那些能提供更好警告的、更缓慢且更稳健的方法也是必要的。这项工作证实了高准确度并不自动意味着高可靠性,构建面向现实世界的可信人工智能需要平衡速度与谨慎之间的关系。研究人员总结道,虽然基础模型已经准备好投入使用,但使它们变得安全且具备自我意识的工具仍在不断完善中,这项技术的未来取决于能否为每个特定任务找到合适的平衡点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。