A Closer Look at In-Distribution vs. Out-of-Distribution Accuracy for Open-Set Test-time Adaptation
本文通过在受损的 CIFAR-10 和 ImageNet 数据集上对现有的开集测试时自适应方法进行基准测试,揭示了它们无法有效平衡分布内准确率与分布外拒绝率的问题,并提出了一种基于 Sigmoid 的基准方法来解决这些权衡问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个非常聪明的机器人厨师,它通过使用一套特定的食材(比如胡萝卜、土豆和牛肉)学习了多年如何烹饪完美的佳肴。这个机器人非常擅长识别这些熟悉的食材。但如果突然有人递给它一碗亮片、一只活青蛙或者一块形状奇怪的石头,会发生什么?
这篇论文是关于测试这些机器人厨师在现实世界中同时处理两件事的能力:
- 适应熟悉食材的新版本(例如,稍微烧焦了或沾了泥土的胡萝卜)。
- 拒绝烹饪奇怪、未知的物品(例如,青蛙或石头),而不是试图强行将它们纳入食谱。
作者将那些熟悉的东西称为“分布内”(In-Distribution,简称 InD),将那些奇怪的东西称为“分布外”(Out-of-Distribution,简称 OOD)。
问题所在:“过度热心”的厨师
研究发现,目前的机器人厨师非常擅长适应烧焦或沾了泥的胡萝卜。它们可以理解:“哦,这个胡萝卜脏了,但我还是可以烹饪它。”然而,它们却很难说出:“等等,这是一个青蛙!我不知道该拿它怎么办!”
相反,这些厨师经常会感到困惑。因为它们的程序告诉它们必须为每样东西都选出一个类别,所以它们会试图把青蛙强行归入“牛肉”或“蔬菜”类别。它们为了适应新环境而变得过于热心,结果导致它们不小心开始烹饪青蛙,从而导致糟糕的结果。
实验:测试厨师
研究人员在两个不同的厨房中测试了几种不同的“机器人厨师”策略(如 SAR、OSTTA、UniEnt 和 SoTTA 等方法):
- 小厨房 (CIFAR-10): 简单的物体图片,如猫和狗。
- 大厨房 (ImageNet): 数百万张复杂的图片。
他们测试了两种场景:
- “近处”的陌生人: 给厨师看一张“蒜香面包”的照片,而他们只知道“热狗”。它们很相似(都是食物),但仍属于未知物。
- “远处”的陌生人: 给厨师看一张“裂开的泥土”或“多孔海绵”的照片。它们与食物完全不同。
他们还测试了当食物组合发生变化时的情况。有时,厨师拿到的是一份 50% 胡萝卜和 50% 青蛙的盘子;有时,他们会拿到 90% 都是青蛙的盘子,或者一连串只有青蛙的盘子。
重大发现:“全有或全无”的陷阱
研究发现了一个主要的权衡关系。
- 如果你调整厨师,让它对胡萝卜超级自信,它就会变得非常不擅长识别青蛙。它会乐此不疲地把青蛙当成一种奇怪的胡萝卜来烹饪。
- 如果你调整它们以拒绝青蛙,它们往往会变得过于谨慎,甚至连稍微脏了一点的胡萝卜也会拒绝烹饪。
大多数现有方法就像是那种过于专注于把胡萝卜做对,结果却不小心把青蛙端给顾客的厨师。
新思路:改变菜单(Sigmoid 对比 Softmax)
论文提出了一种聪明的解决方法。目前,厨师们使用一种叫做 Softmax 的系统。想象一下这是一个菜单,厨师必须选择恰好一项,且所有选项的概率总和必须等于 100%。如果厨师不确定,他们仍然必须选出一个“最不错误”的选项。
研究人员尝试切换到 Sigmoid。想象一下这是一个菜单,厨师可以说:“我有 90% 的把握这是个胡萝卜,但我对它是青蛙的把握是 0%。”他们不需要强行做出选择。他们可以简单地说:“我不知道这是什么,”然后拒绝它。
结果:
- 使用这种新 Sigmoid 菜单的厨师在识别青蛙(拒绝未知物)方面表现得好得多。
- 虽然它们在烹饪胡萝卜方面稍微没那么完美了,但这种权衡是值得的,因为它们停止了供应青蛙。
- 这种新方法在食物组合发生剧烈变化时(例如,当厨师突然拿到一份 75% 都是青蛙的盘子时)特别有效。
“批次”带来的惊喜
研究人员还观察了厨师如何处理不同批次的食物。
- 混合批次: 当一个盘子里既有胡萝卜又有青蛙时,厨师会变得非常困惑,表现很差。
- 分离批次: 当厨师先拿到一个只有青蛙的盘子,接着拿到一个只有胡萝卜的盘子时,他们实际上的处理能力更好。
这表明,困惑来自于试图在学习胡萝卜的同时,也在学习青蛙。其背后的“批次归一化”(处理食物的一个技术部分)在两种类型的数据混合在一起时会出错。
核心结论
论文得出结论,我们不能再试图让我们的 AI 厨师同时在所有方面都做到完美。
- 现有方法过于渴望适应,并且经常无法拒绝未知的、危险的输入。
- 改变输出风格(从“选一个”变为“选多个或不选”)有助于 AI 知道何时说“我不知道”。
- 未来需要能够平衡“对熟悉事物的帮助”与“对未知事物的安全”的方法,而不是仅仅擅长其中一点而忽略另一点。
简而言之:我们需要教会我们的 AI 区分脏胡萝卜和青蛙,并让它有信心说出:“不,我不做那个。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。