DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding
本文介绍了 DishSeg24k,这是一个包含 24,096 张图像和 278 个细粒度类别的大规模食物分割基准数据集,以及 FEAST,一种新型 Transformer 模型,该模型利用强化学习引导的混合专家机制(Mixture-of-Experts)和随机专家解码,在复杂的长尾餐饮场景中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教会一个机器人通过它的眼睛来理解世界。这个被称为“计算机视觉”的领域,就像是赋予机器一种视觉能力,但带有一个转折:机器人不仅仅是识别出“那里有一只猫”,它还需要在每一部分周围画出完美的轮廓,将耳朵与尾巴分开,再将尾巴与它坐着的垫子分开。这被称为图像分割(image segmentation)。它是自动驾驶汽车识别道路边界与人行道边界,或是医疗扫描仪发现微小肿瘤背后的超能力。然而,尽管机器人在识别汽车和猫方面已经做得相当出色,但在面对一个混乱且美味的问题时,它们仍然感到棘手:食物。
为什么食物对机器人来说如此困难?因为一盘晚餐并不像一辆汽车那样规整;它是一个混乱的拼图游戏。想象一下,一个托盘里盛着米饭、炒牛肉和西红柿,它们挤在一起。米饭接触着牛肉,牛肉接触着西红柿,而且它们都共用同一个盘子。对机器人来说,这只是一个巨大的棕色和红色组成的团块。如果机器人无法分辨牛肉在哪里结束、米饭从哪里开始,它就无法告诉你你吃了多少蛋白质,或者这顿饭花了多少钱。这就是**食物分割(food segmentation)**的挑战:教计算机理清一盘混乱的晚餐,弄清楚每一件食物究竟属于哪个菜肴,并即使在食物堆叠得很高且看起来极其相似的情况下,也能在它们周围画出一条完美的线。
正是在这里,一项新的研究应运而生,它致力于解决世界上最混乱的餐桌问题。由 Yilin Wang 及其同事领导的研究人员意识到,现有的计算机程序之所以失败,是因为它们是在那些单件食物静置于白色桌面上的整洁、完美的照片上进行训练的。然而,现实生活却是一个拥挤的自助餐。为了解决这个问题,他们构建了一个庞大的新训练库,名为 DishSeg24k。这不仅仅是几张照片;它是一个包含 24,096 张图像、112,281 个独立食物项目以及 278 种不同菜肴的集合,所有这些都是在真实的餐厅和食堂中拍摄的。他们甚至加入了一份冗长的稀有地区特色菜清单,以确保机器人不仅能识别米饭或面条等最常见的食物。
但仅仅拥有一个优秀的图书馆是不够的;机器人需要一种新的思考方式。作者提出了一种名为 FEAST(食物专家自适应分割 Transformer)的新方法。把旧的教导机器人的方式想象成一份死板的、循序渐进的说明书:“第一步:观察红色斑点。第二步:假设它是西红柿。”如果机器人在第一步犯了错,它就会陷入僵局。然而,FEAST 将这个过程视为一场由专家团队进行的“二十个问题”游戏。机器人不再遵循单一的直线路径,而是会问自己:“如果这个红点其实是西红柿酱,或者也许是一块牛肉呢?”它会探索不同的可能性,就像侦探尝试不同的理论一样。
为了实现这一点,研究人员在机器人的大脑里配备了一个“专家团队”。想象一群专家:其中一位擅长识别液体酱汁,另一位是脆爽口感的专家,第三位则知道如何处理重叠的盘子。当机器人看到一堆混乱的食物时,它不仅仅是选择一名专家,而是让一个聪明的管理者决定在特定时刻该听取哪些专家的意见。这被称为**混合专家(Mixture-of-Experts, MoE)系统。为了确保这个团队保持平衡,而不是所有人都仅仅认同最常见的食物(如米饭),研究人员使用了受强化学习(Reinforcement Learning)**启发的技巧。这就像教练在团队正确分离出一个棘手的边界时给他们一个击掌(奖励),并在他们感到困惑时温柔地提醒“再试一次”,帮助他们在实时过程中从错误中学习。
结果令人印象深刻。在测试了他们这个新的、混乱的数据集后,这种“专家团队”方法以显著优势超越了以往的最佳方法。在其中一个关键衡量标准中,它将分离食物项目的准确度提高了 3.21%,在另一个标准中提高了 3.68%,在第三个标准中提高了 4.00%。研究人员还在一个较旧且较小的数据集 FoodSeg103 上测试了他们的方法,其表现依然优于竞争对手,这表明这种新的思维方式也可以适用于其他类型的混乱图像。
简而言之,这篇论文不仅仅是给了我们一本更大的食物相册;它还给了机器人一种更聪明、更灵活的方式来观察混乱的晚餐。通过将大规模、真实的数据库与能够探索不同可能性并向专业专家学习的决策系统相结合,作者展示了一条通往让计算机真正理解现实世界中复杂且美味的混沌状态的充满希望的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。