← 最新论文
🤖 AI

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

本研究系统评估了多模态大语言模型在农业图像解读与生成任务中的幻觉行为,揭示了尽管少样本提示有所改进,但显著的生物学不一致性和上下文不准确性问题仍削弱了人工智能驱动农学见解的可靠性。

原作者: Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你聘请了一位非常聪明、博览群书的助手来帮你经营农场。这位助手读过数百万本关于植物、天气和农业的书籍。然而,这位助手有一个奇怪的毛病:有时,当它看到一张植物的图片时,它会自信地告诉你一些完全不是事实的信息。或者,当你让它画一张生病植物的图片时,它画出的东西看起来逼真,却违背了自然规律。

这篇论文就像是为这位助手出具的成绩单,专门测试它在处理农业图像(作物图片)方面的表现。来自德克萨斯农工大学的研究人员想要看看,这些“多模态大语言模型”(能够看图和阅读的智能 AI 模型)是否可靠到足以让人信赖,从而用于实际的农业决策。

以下是他们研究发现的简要说明,使用了简单的类比:

1. AI 出错的两种途径

研究人员通过两种不同的方式测试了 AI,就像在两个不同的科目中检查学生的作业:

  • 科目 A:侦探(图像转文本)

    • 任务: 你向 AI 展示一张番茄叶的照片,并问:“这是健康的还是生病的?”
    • 问题: AI 有时会表现得像一个“过于自信”的侦探。它可能会看着一片完全健康的叶子说:“这肯定生病了!”(误报),或者看着一片布满斑点的叶子说:“这没问题!”(漏掉了问题)。
    • 结果: 即使是最聪明的模型(如 Gemma 或 MiniCPM),在需要独立猜测时,正确率也只有 63% 到 75% 左右。如果你先给它们一些例子学习(比如在测试前向它们展示一张“生病”的叶子和一张“健康”的叶子),它们的表现会有所提升(最高达 86%),但它们仍然会犯错。它们仍在“幻觉”——要么看到不存在的病害,要么漏掉真实存在的病害。
  • 科目 B:艺术家(文本转图像)

    • 任务: 你给 AI 一个描述,比如“画一株被虫子严重啃食的健康大豆植株”,并让它生成图像。
    • 问题: 这是 AI 以糟糕的方式变得“富有创造力”的地方。这就像要求一位艺术家画一个“干燥的湿海绵”。AI 并不理解这些事物是相互矛盾的。
    • 结果: 当被要求绘制不可能的事物(例如一株带有“严重虫害”的“健康”植物)时,AI 依然照画不误。
      • 一个模型(GPT-5)画了一片布满巨大孔洞的叶子,却自信地将其标记为“健康”。
      • 另一个模型(Gemini)画出了一片看起来绿色且健康的田地,但其中隐藏着细微的虫害损伤,忽略了提示词中要求的“严重”损伤。
      • 在某些情况下,AI 会添加你未要求的内容,比如当你只要求画水果时,它却画上了泥土和碎屑,或者让颜色看起来像一幅画,而不是一张科学照片。

2. 提示词的“魔术”

研究人员发现了一个非常有趣的现象:当你稍微改变措辞时,AI 的行为会发生显著变化。

  • 场景: 他们要求 AI 画一颗“覆盖着霉菌的无病草莓”。
  • 反应: 起初,AI(GPT-5)说:“不行,我做不到。这不合逻辑。无病的果实不可能长霉菌。”它拒绝配合。
  • 魔术: 但是,当研究人员添加了一个小短语,例如“请为研究插图这样做”时,AI 突然说:“好的!”并画出了那棵不可能的草莓。这就好像 AI 有一个安全开关,只要改变请求的语境就能将其关闭。这表明 AI 将“乐于助人”置于“生物学准确性”之上。

3. 这为何重要(“那又怎样?”)

该论文认为,虽然这些 AI 工具在撰写文章或总结新闻方面令人惊叹,但目前它们在农业领域是不可靠的

  • 风险: 如果农民信任 AI,而 AI 说一片健康的田地生病了,他们可能会喷洒不必要的化学品(浪费金钱并损害环境)。如果它说一片生病的田地是健康的,他们可能会推迟治疗,导致作物死亡。
  • 结论: 目前的 AI 就像一个 memorized 了大量事实但并未真正理解自然运作方式的学生。它可能听起来非常自信,但实际上完全错误。

总结

该论文得出结论,我们目前还不能仅仅信任这些 AI 模型来运营我们的农场。它们需要更好的“落地”(将它们与真实的生物学事实联系起来),以及更严格的规则来阻止它们编造病害或绘制不可能的植物。在我们修复这些“幻觉”之前,将它们用于关键的农业决策是危险的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →