← 最新论文
💻 computer science

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

本研究提出了一种基于 TinyCLIP 的轻量化、可边缘部署的多模态视觉-语言框架,该框架实现了对早期苹果果实解剖结构(花萼、果体和果柄)的高精度、可解释性的分类与定位,旨在为机器人疏果和精准果园管理提供支持。

原作者: Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在苹果园季节初期那宁静的时光里,在果实尚未长成全貌之前,一项关键且耗费体力的任务便开始了。工人们必须穿行在茂密的树行之间,仔细地摘除一些微小的、尚未成熟的绿色果实,这些被称为“小果实”(fruitlets)。这一过程被称为“疏果”(thinning),因为苹果树通常产生的果实远多于它们所能支撑的数量。如果任其发展,过度拥挤的果实簇会相互竞争养分,导致苹果个头变小、品质下降,并可能损害树木次年再次开花的能力。几十年来,这项工作一直由人工完成,需要工人不断观察树冠并有选择性地采摘多余的果实。这是一项体力消耗大、速度慢的工作,且随着全球农业劳动力短缺的加剧,招工也变得日益困难。为了解决这一问题,科学家们长期以来一直致力于研发能够识别并执行这项精细工作的机器人,但果园环境提出了一个独特的挑战:那些微小的绿色果实经常隐藏在叶片后方,与周围的枝叶融为一体,标准的摄像头很难将它们与支撑它们的枝条和茎干区分开来。

现在,一组研究人员开发出了一种新的方法,教机器如何识别这些隐藏的结构,这种方法超越了简单的图像识别,而是将视觉与语言相结合。他们的方案依赖于一种轻量级的人工智能模型,该模型不仅理解图像看起来是什么样子,还理解图像应当代表什么。通过向系统输入特定的描述,例如“一张花萼(calyx)的照片”或“一张果柄(peduncle)的照片”,模型学会了识别果实的特定解剖部分:曾经是花朵所在位置的星形基部、幼果的主体,以及连接果实与树木的细长茎部。这种区分至关重要,因为一台用于修剪树木的机器人需要知道确切的切割位置。它必须识别出要移除的果实,但更重要的是,它必须定位果柄(即茎部),这是机器人手臂需要进行剪切的精确点位,从而避免损坏剩余的果实簇。

研究人员在华盛顿州的一个商业苹果园中测试了他们的系统,使用了两种特定苹果品种的高分辨率照片。他们将这些大型图像分解成数百个较小的、重叠的正方形区域,使计算机能够详细检查场景中的每一寸空间。对于每个正方形区域,系统都会将视觉数据与目标部件的文本描述进行对比。事实证明,这种方法在寻找被部分遮挡或处于变化光照下的果实及其组成部分方面非常有效。当在高性能计算机硬件上进行测试时,系统在几乎所有情况下都能正确识别果实主体,并在大多数情况下识别出花朵基部。虽然它在识别细长的茎部方面稍显不确定(因为茎部天生难以观察),但整体准确率仍然很高。

至关重要的是,团队并未止步于证明该想法在强大的服务器上可行;他们还优化了系统,使其能在类似于现代机器人所使用的便携式小型计算机上运行。他们将模型转换为一种紧凑的格式,使其能够在专门用于边缘计算的硬件(如用于田间机器人的 NVIDIA Jetson 设备)上运行。即使在压缩模型以提高运行速度并减少内存占用后,它仍保留了做出正确决策的能力。该系统可以在几秒钟内处理单张果园图像,生成一张详细的地图,标明果实和茎部所在的确切位置。这张地图就像是一个指南,告诉机器人应该将注意力集中在哪里,以及在哪里放置切割工具。

这项研究表明,将视觉数据与简单的语言提示相结合,可以让机器理解复杂的农业场景,并获得纯图像分析往往无法达到的细微程度。通过教计算机去寻找“一张果柄的照片”而非仅仅是一个通用的形状,系统学会了忽略叶片和枝条构成的干扰背景。这一突破意味着,未来的机器人疏果系统将不再需要庞大且耗能的计算机来运行。相反,它们可以依靠高效、轻量级的模型直接在机器人本身上运行,从而在移动过程中做出实时决策。尽管该技术在各种光照条件下寻找每一个细长茎部的能力尚不完美,但结果展示了一条清晰的前进路径。研究人员已经证明,可以赋予机器人所需的视觉智能,使其能够执行农业中最精细的任务之一,从而为能够以熟练人工般的精准度和细致度管理作物负荷的自动化系统铺平道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →