Multi-Scale Fruit Capsules: Dilated Convolutions and Dynamic Routing for In-the-Wild Explainable Fruit Recognition
本文介绍了 FruitCapsNet,这是一种利用空洞卷积和贝叶斯优化超参数的多尺度胶囊网络,通过保留空间姿态信息并聚焦于全果区域而非边缘,实现在多样化的野外条件下进行最先进且具可解释性的水果识别。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代农业繁忙的世界中,水果从树枝到餐桌的旅程正越来越多地由机器管理。农民和包装设施依赖自动化系统来对农产品进行分类、检查成熟度并识别缺陷,其速度和一致性是人工无法比拟的。为了让这些机器正常工作,它们必须能够像人类一样“看到”水果,无论苹果是挂在树枝上、放在塑料袋里、切片放在盘子里,还是因为跌落而受损,都能将其识别出来。这项任务具有欺骗性的难度,因为同一件水果根据其状态、光照以及周围环境的不同,看起来可能会截然不同。虽然计算机在识别照片中的物体方面已经变得非常出色,但当物体不在完美的、孤立的姿态时,它们往往会感到吃力。传统的计算机视觉系统倾向于关注微小的局部细节,比如皮肤的弧度或特定的颜色斑块,然后将这些碎片拼接起来。这种方法在受控环境下表现良好,但在农场或超市这种混乱、不可预测的现实场景中往往会失效,因为在那里的水果会相互重叠,阴影会落下,背景也会显得杂乱无章。
一组研究人员开发了一种新的方法,来教计算机如何通过理解整体而非仅仅是局部来理解水果,从而模仿人类的能力。他们创建了一个名为 FruitCapsNet 的系统,专门设计用于处理现实世界水果摄影中的混乱多样性。该系统没有使用多年来主导该领域的标准方法(这些方法通常会丢弃关于物体部件位置的重要信息),而是通过追踪每一个水果部分的方位和朝向来保持信息的完整性。它通过使用一种特殊的数字滤波器来实现这一点,这种滤波器允许计算机在不需要增加处理能力的情况下,观察到每个兴趣点周围更广泛的区域。通过将这种宽阔的视野与一种检查不同水果部分是否能相互契合以构成一个整体的方法相结合,该系统即使在水果被部分遮挡或被其他物体包围时也能识别出水果。
研究人员在四个不同的水果图像集上测试了他们的系统,这些图像集涵盖了从干净的影棚风格照片到一组全新的、极具挑战性的、包含超过一万张野外拍摄图像的集合。这个新集合被他们命名为 PD-19,其中的图像包含单帧内的多个水果,且具有光照不均以及水果处于各种状态(如剥皮、装袋或切片)等特点。当他们将该系统与十个最强大的现有计算机视觉模型进行对比时,FruitCapsNet 在每一个数据集上都表现得更好。这种差异在困难的现实世界图像中最为显著,新系统的表现比排名第二的竞争对手高出近三个百分点。在自动化分拣领域,面对数百万件产品的处理,即使是准确率上的微小提升也能防止显著的浪费和经济损失。研究人员发现,他们的系统并非在瞎猜,而是通过观察整个水果来进行决策,而不是像旧系统那样专注于边缘或背景噪声,而后者是常见的错误。
要理解其运作原理,必须观察该系统如何处理图像。传统系统通常将图像分解成小块,并判断某个特征是否存在于该块中,却忽略了该特征在块内的确切位置。这就像是仅通过鼻子的形状来识别一张脸,而不关心鼻子是在脸的左侧还是右侧。然而,新系统使用了一种能够保留部件之间关系的结构。它使用了一种称为“空洞卷积”(dilated convolution)的技术,这就像是一个放大了计算机视野的镜头,使其能够在不丢失精细细节的情况下观察水果周围的上下文。这意味着当系统观察一个切开的橙子时,它能理解这些果肉属于一个圆形的整体,即使背景是一个忙碌的厨房台面。随后,系统使用一种称为“动态路由”(dynamic routing)的过程,通过“投票”来决定这些部分是否正确地组合成了特定类型的水果。如果各部分对于整体的形状和姿态达成一致,系统就会对识别结果产生信心。
团队还花费了大量时间来微调系统的内部设置,他们并非通过猜测或尝试每一种可能的组合,而是使用一种能够从每次尝试中学习的智能数学搜索方法。这使得他们能够找到平衡不同类型误差以及如何随时间调整学习过程的最佳平衡点。其结果是一个比通常实现此类精度所需的庞大系统更小、更快的模型,仅使用了极小部分的计算深度。当研究人员查看系统生成的“热图”以观察其关注点时,他们看到了明显的区别。旧系统往往会突出显示水果的边缘或周围的阴影,而新系统则始终强调整个水果,从中心到表皮。这表明该系统真正学习了水果作为一个整体的概念,使其在面对现实世界的混乱环境时更加稳健。
这项研究证实,通过改变计算机网络处理视觉信息的方式,实现以前自动化系统无法企及的理解水平是可能的。研究人员证明,由于采用了这种方法,该系统可以跨越多种水果类型和条件,从一个数据集中的 15 类到他们新开发的野外数据集中的 19 类。虽然该系统并不完美,在处理极端噪声数据或在小型设备上运行复杂计算的高成本方面仍面临挑战,但结果展示了一条清晰的前进路径。这项工作表明,自动化水果识别的未来不在于让系统变得更大、更深,而在于让它们在如何拼凑视觉世界方面变得更聪明。通过尊重部件之间的空间关系并理解整体的上下文,机器终于可以学会像我们一样看待水果,准备好应对收获季节那混乱而美丽的现实。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。