← 최신 논문
🤖 machine learning

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

본 논문은 뷰어 수준의 도구와 문헌 검색을 활용하여 뇌 MRI 를 반복적으로 검사함으로써 기존 단일 패스 모델에 비해 희귀 신경학적 질환에 대한 제로샷 성능을 크게 향상시키는 의료용 시각-언어 모델을 가능하게 하는 그라운디드 에이전트 프레임워크인 GAZE 를 소개합니다.

원저자: Duaa Alim, Mogtaba Alim, Liam Chalcroft

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Duaa Alim, Mogtaba Alim, Liam Chalcroft

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

뇌의 MRI 스캔을 보는 방사선 의사를 상상해 보십시오. 그들은 한 번 훑어보고 무엇이 잘못되었는지 추측하지 않습니다. 대신, 의심스러운 부위에 확대경을 대고 숨겨진 세부 사항을 보기 위해 밝기를 조절하며, 대칭성을 확인하기 위해 이미지를 뒤집고, 그 다음에 그들이 보는 것을 알려진 사례와 비교하기 위해 의학 교과서를 열거나 온라인에서 검색합니다. 그들은 이를 반복적으로 수행하며 진단의 그림을 단계별로 완성해 나갑니다.

그러나 현재의 AI 모델들은 보통 속도 독서 시험을 보는 학생처럼 작동합니다. 한 장의 이미지를 받고 순간적으로 생각한 뒤 즉시 답변을 내놓습니다. 이는 흔한 경우에는 어느 정도 작동하지만, 희귀 뇌 질환과 같은 경우에는 이 "원샷(one-shot)" 접근 방식이 종종 실패합니다. AI가 미묘한 단서를 놓치거나 특정 질환에 대해 충분히 알지 못하기 때문입니다.

이 논문은 AI가 그 신중한 반복적 방사선 의사와 더 유사하게 행동하도록 하는 새로운 방법인 GAZE(Grounded Agentic Zero-shot Evaluation, 근거 기반 에이전트 제로샷 평가)를 소개합니다.

"스마트 어시스턴트" 비유

GAZE 를 단일 뇌가 아니라 AI 를 위한 도구 팀을 관리하는 스마트 어시스턴트로 생각하십시오.

  1. 뷰어 도구 (확대경):
    AI 는 이제 전체 이미지를 단순히 바라보는 대신 "뷰어 수준 도구"를 사용할 수 있습니다.

    • 작은 지점에 확대할 수 있습니다.
    • 어두운 부위가 선명하게 보이도록 대비 조정(TV 밝기를 높이는 것과 유사)할 수 있습니다.
    • 병변의 윤곽을 명확히 보기 위해 에지 감지를 할 수 있습니다.
    • 대칭성을 확인하기 위해 이미지를 뒤집거나 회전시킬 수 있습니다.
    • 길을 잃으면 초기화할 수 있습니다.
    • 비유: AI 에게 물리적인 라이트박스와 일련의 확대경을 주어, 정적 이미지를 처리하는 것이 아니라 인간이 하듯 이미지를 검사할 수 있게 하는 것과 같습니다.
  2. 도서관 도구 (연구자):
    AI 가 이상한 것을 발견하면 잠시 멈추고 두 개의 공식 의학 도서관 (텍스트용 PubMed 와 이미지용 Open-i) 에서 도움을 요청할 수 있습니다.

    • 의심되는 질환에 관한 논문을 검색합니다.
    • 다른 환자들로부터 해당 질환의 이미지를 찾아 일치 여부를 확인합니다.
    • 비유: 이는 탐정이 단서를 발견한 후 체포하기 전에 그 단서가 알려진 범죄자 프로필과 일치하는지 확인하기 위해 즉시 도서관으로 달려가는 것과 같습니다.

작동 방식 (에이전트 부분)

GAZE 는 AI 를 에이전트로 변환합니다. 즉시 답변하도록 강요받는 대신, AI 에게 "계속하기" 버튼이 주어집니다.

  • 1 단계: AI 가 이미지를 봅니다. "흠, 이상해 보이네."
  • 2 단계: 그 지점에 확대하기로 결정합니다.
  • 3 단계: 다시 봅니다. "좋아, 확실히 병변이야. 하지만 어떤 종류지?"
  • 4 단계: "이런 것처럼 보이는 뇌 병변"을 도서관에서 검색하기로 결정합니다.
  • 5 단계: 결과를 읽고 비교한 후 최종적으로 보고서를 작성합니다.

시스템은 AI 가 취하는 모든 이동 (모든 확대, 모든 검색) 을 기록하여 의사가 AI 가 어떻게 결론에 도달했는지 정확하게 감사할 수 있도록 합니다.

발견 사항 (결과)

연구자들은 281 가지의 다양한 희귀 신경 질환을 포함한 906 개의 뇌 MRI 스캔으로 구성된 어려운 데이터셋인 NOVA에서 이를 테스트했습니다.

  • "프레임워크"의 중요성: 어떤 도구를 사용하기 전에도 AI 에게 답변하도록 요청하는 방식 (엄격한 규칙과 더 나은 프롬프트 사용) 만 변경해도 병변을 찾는 능력이 크게 향상되었습니다. 이는 학생에게 더 나은 체크리스트를 주는 것과 같습니다. 새로운 정보 없이도 더 잘 수행합니다.
  • 도구가 희귀 사례에 가장 큰 도움을 줌: 이 도구들은 희귀 질환에 있어 게임 체인저였습니다. 테스트 세트에서 매우 드물게 나타난 질환의 경우, AI 가 뇌의 올바른 위치를 찾는 능력이 **17% 에서 58%**로 급증했습니다. 흔한 질환의 경우 개선은 좋았지만 그렇게 극적이지는 않았습니다.
  • "트레이드오프"의 놀라운 발견: 연구자들은 까다로운 부작용을 발견했습니다. 때때로 AI 가 도서관을 검색할 때 진단은 정확했지만 병변의 위치를 잘못된 곳으로 이동시켰습니다.
    • 비유: AI 가 "이 질환은 보통 왼쪽 귀에 나타난다"는 책을 읽었다고 상상해 보십시오. 그런 다음 MRI 에서 오른쪽 귀에 있는 지점을 발견합니다. 자신의 눈을 신뢰하는 대신, 책에 그렇게 쓰여 있으므로 왼쪽 귀로 "추측"을 이동시킵니다. 질환의 이름은 정확히 맞췄지만, 잘못된 장소를 가리킨 것입니다. 이는 AI 가 질환 이름을 알고 있는지 테스트하는 것만으로는 부족하며, 올바른 장소를 가리킬 수 있는지도 테스트해야 함을 증명합니다.
  • 참여가 핵심: 최고의 AI 모델 (Gemini 3 Flash 등) 은 단순히 도구를 사용한 것이 아니라, 그것을 사랑했습니다. 그들은 사례당 약 12 번의 도구 호출을 하며 반복적으로 확대하고 검색했습니다. 약한 모델들은 도구를 거의 전혀 사용하지 않았기 때문에 큰 개선이 없었습니다.

결론

GAZE 는 AI 를 의학, 특히 희귀 질환에 능숙하게 만들기 위해서는 단순히 이미지를 제공하고 답변을 요구해서는 안 된다는 것을 보여줍니다. 우리는 AI 가 더 가까이 보게하고, 답을 찾게하며, 단계별로 생각하게하는 시스템을 구축해야 합니다. 이는 인간 의사와 마찬가지입니다.

이 논문은 이 "에이전트" 접근 방식이 AI 가 길을 잃지 않도록 보장하는 엄격한 규칙과 결합될 때, AI 가 희귀 뇌 질환을 찾고 설명하는 능력을 크게 향상시킨다고 결론지었습니다. 다만, AI 가 자신의 연구에 속아 넘어가지 않도록 진단위치 모두를 확인해야 한다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →