← 最新论文
💻 computer science

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

本文介绍了混合分层多智能体框架(H²MAF),该框架将 EfficientNet-B3 与 ConvNeXt-Tiny 的决策级输出与多模态大语言模型(Gemma 4 和 Qwen3.5)的语义仲裁相结合,旨在通过基准数据集和真实世界机器人田间数据集,实现具有可解释性且高准确率的植物病害诊断。

原作者: Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每年,植物病害都会夺走全球很大一部分粮食供应,威胁着农民的生计和全球粮食市场的稳定。几十年来,科学家们一直试图利用计算机来早期发现这些疾病,依靠人工智能通过观察叶片照片来识别问题所在。然而,一个在实验室中表现完美的简单计算机程序,在面对真实的田间叶片时往往会失效,因为在那里光影在变化,背景很杂乱,且叶片相互重叠。此外,即使计算机猜对了疾病名称,农民需要的也不仅仅是一个名字;他们还需要知道情况有多严重、必须多快采取行动,以及如果坐视不管会付出多少代价。这项新研究通过创建一个结合了专业图像检测器的敏锐视觉与先进语言模型推理能力的系统,解决了这两个问题,并不仅是在互联网照片上进行测试,而是在由机器人在实际农田中移动时捕捉到的图像上进行了测试。

研究人员建立了一个数字专家团队来解决这个问题。首先,他们训练了两种不同类型的计算机视觉模型,即旨在识别图像模式的程序。一种模型经过训练来寻找特定的纹理,而另一种模型则旨在更广泛地理解形状和结构。这两个模型充当第一道防线,检查叶片照片并各自对存在的疾病做出判断。在许多情况下,它们意见一致,但在图像模糊或疾病难以辨认时,它们有时也会产生分歧。这就是系统的第二部分发挥作用的地方。研究人员加入了两个大型语言模型,这类强大的人工智能系统经过海量文本和图像训练,能够理解上下文和推理。这些模型不仅观察图片,还会阅读两个视觉专家的预测,并考虑具体的业务背景,例如作物的价值和情况的紧迫性。它们的任务是充当法官,权衡两名视觉专家的证据,决定哪一个更有可能正确,或者如果两者都错了,则提供最终的诊断。

为了验证该系统是否真的有效,团队在三组非常不同的数据集上对其进行了测试。第一组是互联网上的照片集,代表了农民每天面临的混乱且不可预测的环境。另外两组规模更大且更具现实意义:数千张由自主机器人移动于北卡罗来纳州研究站的番茄和马铃薯田中所拍摄的图像。这些机器人捕捉的图像是在机器人沿垄行驶时连续拍摄的,形成了一个看起来完全符合真实世界监测系统所见情况的数据流。研究人员发现,在互联网照片中,由于两个视觉专家有42%的时间存在分歧,语言模型法官显著提高了诊断的准确性。它成功解决了冲突,将成功率从约64%提升到了近69%。该系统特别擅长处理视觉专家不确定的困难案例,证明了在视觉证据不明确时,拥有来自推理模型的第二意见是非常有价值的。

然而,当系统在真实的机器人数据上进行测试时,情况发生了变化。在这些受控的田间环境中,两个视觉专家的准确度已经很高,它们在诊断上的意见一致率超过了95%。由于它们几乎总是达成共识,语言模型法官介入纠正错误的机会就非常少。在这些情况下,系统的表现依然极高,但由于几乎没有需要解决的分歧,额外的推理层并没有带来显著的提升。这揭示了一个关键洞察:语言模型法官的价值完全取决于视觉专家产生分歧的频率。当专家们充满信心且意见一致时,法官仅是对其决策进行确认;而当专家们感到困惑时,法官便变得至关重要。

研究人员还发现了一些关于这些不同的AI模型在被要求评估风险时如何表现的惊喜发现。他们编写程序让系统输出包含风险等级(如“危急”或“低”)以及建议治疗方案的建议。他们发现,他们测试的两个语言模型具有截然不同的“个性”。其中一个模型始终表现出良好的校准性,只有在田间实际存在的疾病率与观测到的比例相符时,才会分配“危急”风险等级。然而,另一个模型则更具“警报倾向”,它标记作物为危急情况的频率远高于实际疾病流行率所能解释的程度。这种差异并非数学计算上的错误,而是模型本身的一种基本特质。研究人员表明,如果农民使用这种爱报警的模型,将会浪费资金在不必要的治疗上,而校准良好的模型则能为决策提供更可靠的指导。

这项研究中最重要的教训来自于观察语言模型决定忽略两个视觉专家并做出自己判断时的情况。在极少数模型无视两个专家并提供完全独立的诊断的情况下,系统的准确性崩溃了。模型会自信地宣布一个并不存在的疾病,或者漏掉一个确实存在的疾病,导致失败率远高于仅仅信任视觉专家的情形。这一发现为构建此类系统确立了一个明确的规则:语言模型应该扮演调解专家之间争议的裁判,而不是取代专家。如果裁判试图独自参与比赛,系统就会失败。

研究结论指出,这种混合方法为农业技术提供了一条充满前景的路径,但也伴随着特定的条件。该系统在用于解决真正的确定性问题时效果最好,并且需要仔细选择语言模型,以确保它不会变得过度惊惶。研究人员还注意到,虽然系统在机器人捕捉的田间数据上表现优异,但这些图像的拍摄方式可能使得计算机比识别农民随手拍的随机照片更容易。未来的工作需要通过在更多样化的数据上测试系统,并微调模型以更好地理解不同作物的特定风险来解决这一问题。最终,这项研究证明,将专门的图像检测器技能与语言模型的推理能力相结合,可以创造出一个不仅能识别植物疾病,还能以有助于农民对作物做出更好、更明智决策的方式来解释疾病的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →