← 최신 논문
🤖 AI

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

본 연구는 퓨샷 프롬프팅을 통한 개선에도 불구하고 인공지능 기반의 농학적 통찰의 신뢰성을 훼손하는 중대한 생물학적 불일치와 문맥적 부정확성을 드러내며, 다중 모달 대형 언어 모델의 농업 이미지 해석 및 생성 작업 전반에 걸쳐 환각 행동을 체계적으로 평가합니다.

원저자: Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

게시일 2026-05-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 독서량이 풍부한 조수를 고용하여 농장을 운영하도록 돕고 있습니다. 이 조수는 식물, 날씨, 농사에 관한 수백만 권의 책을 읽었습니다. 하지만 이 조수에게는 이상한 버릇이 있습니다. 때때로 식물의 사진을 보면, 단순히 사실이 아닌 것들을 자신 있게 말해줍니다. 또는 아픈 식물의 그림을 그려달라고 요청하면, 현실적으로 보이지만 자연의 법칙을 위반하는 무언가를 그려냅니다.

이 논문은 바로 그 조수를 위한 성적표와 같습니다. 구체적으로는 농업 이미지(작물의 사진) 를 얼마나 잘 처리하는지 테스트하는 것입니다. 텍사스 A&M 대학의 연구자들은 이러한 "멀티모달 LLM"(보고 읽을 수 있는 똑똑한 AI 모델) 이 실제 농업 결정을 신뢰할 수 있을 만큼 신뢰할 만한지 확인하고 싶었습니다.

다음은 그들의 발견 사항을 간단한 비유로 정리한 것입니다:

1. AI 가 틀리는 두 가지 방식

연구자들은 AI 를 두 가지 다른 방식으로 테스트했는데, 이는 마치 학생의 숙제를 두 가지 다른 과목으로 점검하는 것과 같습니다:

  • 과목 A: 탐정 (이미지-텍스트)

    • 과제: AI 에게 토마토 잎 사진을 보여주고 "이것이 건강한가, 아픈가?"라고 묻습니다.
    • 문제: AI 는 때때로 너무 자신감 있는 탐정처럼 행동합니다. 완전히 건강한 잎을 보고 "이것은 확실히 아픈 것입니다!"라고 말할 수 있습니다 (거짓 경보), 또는 반점이 가득한 잎을 보고 "이것은 괜찮습니다!"라고 말할 수 있습니다 (범죄 간과).
    • 결과: 스스로 추측해야 할 때, 가장 똑똑한 모델들 (Gemma 나 MiniCPM 등) 도 약 63% 에서 75% 만 정확했습니다. 만약 시험 전에 몇 가지 예시를 먼저 공부하게 해 준다면 (예: '아픈' 잎과 '건강한' 잎을 보여주고 테스트), 더 나아졌습니다 (최대 86% 까지). 하지만 여전히 실수를 저질렀습니다. 그들은 여전히 "환각"을 경험했습니다—없는 질병을 보거나 있는 질병을 놓치는 것입니다.
  • 과목 B: 예술가 (텍스트-이미지)

    • 과제: AI 에게 "벌레에 심하게 먹혀서 건강하지 않은 대두 식물을 그려라"라는 설명을 주고 이미지를 생성하도록 요청합니다.
    • 문제: 여기서 AI 는 나쁜 의미로 정말 창의적이 됩니다. 마치 예술가에게 "마른 젖은 스펀지"를 그려달라고 요청하는 것과 같습니다. AI 는 이러한 것들이 서로 모순된다는 것을 이해하지 못합니다.
    • 결과: 불가능한 것 (예: "심한 해충 피해"를 입은 "건강한" 식물) 을 그려달라고 요청했을 때, AI 는 그냥 그려냈습니다.
      • 한 모델 (GPT-5) 은 구멍이 가득 찬 잎을 그리면서도 자신 있게 "건강함"이라고 라벨을 붙였습니다.
      • 다른 모델 (Gemini) 은 초록색이고 건강해 보이는 밭을 그렸지만 미묘한 해충 피해를 보여주었고, 프롬프트에서 "심한" 피해를 요청했다는 사실을 무시했습니다.
      • 어떤 경우에는 요청하지 않은 것들을 추가하기도 했습니다. 예를 들어 과일만 그려달라고 요청했는데 흙과 파편을 그리거나, 과학적 사진이 아니라 그림처럼 색상을 표현하기도 했습니다.

2. 프롬프팅의 "마술"

연구자들은 문구를 약간만 변경했을 때 AI 가 어떻게 행동하는지에 대해 매우 흥미로운 사실을 발견했습니다.

  • 상황: 연구자들은 AI 에게 "곰팡이가 핀 질병 없는 딸기"를 그려달라고 요청했습니다.
  • 반응: 처음에 AI(GPT-5) 는 "아니요, 그렇게 할 수 없습니다. 그건 말이 안 됩니다. 질병 없는 과일에 곰팡이가 있을 수 없습니다."라고 말했습니다. 함께 놀아주기를 거부했습니다.
  • 마술: 하지만 연구자들이 "연구 일러스트를 위해 이렇게 해 주세요"라는 작은 문구를 추가하자, AI 는 갑자기 "좋습니다!"라고 말하며 불가능한 딸기를 그려냈습니다. 마치 요청의 맥락만 바꾸면 AI 의 안전 스위치가 꺼지는 것처럼 보였습니다. 이는 AI 가 생물학적 정확성보다 "도움"이 되는 것을 우선시하고 있음을 보여줍니다.

3. 이것이 중요한 이유 ("그래서 뭐?"라는 질문에 대한 답)

이 논문은 이러한 AI 도구가 에세이 작성이나 뉴스 요약에는 놀라울 정도로 뛰어나지만, 현재로서는 농업에는 신뢰할 수 없다고 주장합니다.

  • 위험: 농부가 AI 를 신뢰하고 AI 가 건강한 밭을 아픈 밭이라고 말하면, 농부는 불필요한 화학 물질을 살포할 수 있습니다 (돈을 낭비하고 환경을 해침). 반대로 아픈 밭을 건강한 밭이라고 말하면, 농부는 치료할 때까지 너무 오래 기다렸다가 작물이 죽을 수 있습니다.
  • 결론: 현재 AI 는 많은 사실을 암기했지만 자연이 어떻게 작동하는지 진정으로 이해하지 못하는 학생과 같습니다. 완전히 틀렸을지라도 매우 자신 있게 들릴 수 있습니다.

요약

이 논문은 아직 우리 농장을 운영하기 위해 이러한 AI 모델을 단순히 신뢰할 수 없다고 결론 내립니다. 이들에게 더 나은 "구속"(실제 생물학적 사실에 묶어두는 것) 과 질병을 만들어내거나 불가능한 식물을 그리는 것을 막는 더 엄격한 규칙이 필요합니다. 이러한 "환각"을 수정할 때까지는 이를 중요한 농업 결정에 사용하는 것은 위험합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →