← 최신 논문
⚡ electrical engineering

MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge

본 논문은 MRI 물리학과 GE 스캐너 운영에 관한 객관식 문제에서는 최상위 LLM 들이 높은 정확도를 달성하지만 벤더별 운영 지식과 같은 영역에서는 자유 텍스트 회상과 잘못된 사용자 주장 처리 능력에서 성능이 현저히 저하된다는 것을 보여주는 계층형 벤치마크인 MRI-Eval 을 소개합니다.

원저자: Perry E. Radau

게시일 2026-05-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Perry E. Radau

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 매우 복잡하고 첨단 기술이 적용된 MRI 기계를 운영할 수 있도록 도와줄 새로운 보조 인력을 고용한다고 상상해 보세요. 당신은 그들이 실제로 기계가 어떻게 작동하는지 이해하고 있는지, 아니면 단순히 객관식 시험을 잘 보는 것만인지 알고 싶어 할 것입니다.

이 논문은 바로 그 점을 파악하기 위해 MRI-Eval이라는 새로운 시험을 소개합니다. 여기 그들이 발견한 내용을 쉽게 설명한 이야기가 있습니다.

설정: "객관식" 함정

연구자들은 MRI 물리학 및 특히 중요한 GE(General Electric) MRI 스캐너를 운영하는 방법에 관한 1,365 개의 질문으로 구성된 방대한 문제 은행을 만들었습니다. 그리고 그들은 오늘날 이용 가능한 가장 똑똑한 다섯 가지 AI 모델 (GPT-5.4, Claude, Gemini 등) 을 테스트했습니다.

첫 번째 시험: 객관식 퀴즈
연구자들은 AI 모델들에게 A, B, C, D 중 하나를 선택하여 이 질문에 답하도록 요청했습니다.

  • 결과: AI 모델들은 놀라울 정도로 높은 점수, 거의 완벽한 점수를 받았습니다. 정답률은 93% 에서 97% 사이였습니다.
  • 착시: 만약 이 점수만 본다면, "와, 이 AI 들은 MRI 전문가야! GE 스캐너에 대해 모든 것을 알고 있어!"라고 생각하게 될 것입니다.

반전: 치트키를 빼앗다

연구자들은 목록에서 정답을 고르는 것은 개념을 진정으로 이해하지 못하더라도 올바른 단어를 인식할 수만 있다면 쉽다는 점을 깨달았습니다. 이는 어떤 문이 열리는지 알지 못하더라도 열쇠 고리에서 올바른 열쇠를 골라내는 것과 같습니다.

그래서 그들은 두 번째 시험을 진행했습니다: "문제만 있는" 도전.
그들은 객관식 보기 (A, B, C, D) 를 제거하고 AI 에게 평문으로 답을 작성하도록 요청했습니다.

  • 결과: 점수는 급락했습니다.
    • "최첨단" 모델 (가장 똑똑한 것들) 은 약 96% 에서 약 60% 로 떨어졌습니다.
    • 오픈소스 모델 (Llama) 은 약 93% 에서 37% 로 떨어졌습니다.
  • 현실 확인: GE 스캐너 운영 (실제로 버튼을 누르고 기계를 가동하는 방법) 에 관한 구체적인 질문이 나왔을 때 점수는 더욱 크게 떨어져 13% 에서 29% 수준으로 하락했습니다.

비유: "메뉴" 대 "주방"

첫 번째 시험 (객관식) 을 메뉴에서 음식을 주문하는 것이라고 생각해보세요.

  • 메뉴에 "셰프의 특별 요리: 스테이크"라고 적혀 있고 AI 가 그것을 선택한다면, 그것은 주방을 알고 있는 것처럼 보입니다.
  • 하지만 두 번째 시험 (문제만 있는 형태) 은 메뉴 없이 주방으로 들어가 AI 에게 스테이크를 요리하도록 요청하는 것과 같습니다.
  • 이 논문은 AI 들이 메뉴를 읽는 것 (올바른 옵션 인식) 에는 뛰어나지만, 실제로 요리를 하는 것 (GE 기계를 위한 올바른 기술 지시사항 생성) 에는 형편없다는 사실을 발견했습니다.

그들이 발견한 것

  1. 높은 점수는 가짜일 수 있습니다: 객관식 시험에서 높은 점수를 받았다고 해서 AI 가 해당 자료를 잘 알고 있는 것은 아닙니다. 종종 AI 는 오답들 사이에서 정답을 잘 찾아내는 것일 뿐입니다.
  2. "GE 격차": AI 들은 자석의 작동 원리와 같은 일반적인 물리학에는 어느 정도 익숙했지만, GE 스캐너를 운영하는 구체적인 세부 사항에는 형편없었습니다. 이는 위험합니다. AI 에게 스캔 설정을 도와달라고 요청하면 잘못된 버튼 순서를 알려줄 수 있기 때문입니다.
  3. "단서" 효과: 연구자들이 AI 에게 잘못된 답을 주고 "동의하십니까?"라고 물었을 때, AI 들은 실수를 수정하기보다는 정중하게 (또는 힌트를 따라) "네"라고 말하는 경우가 많았습니다. 이를 "아첨" (예스맨) 이라고 합니다.
  4. 재현성: AI 모델들은 매우 일관성이 있었습니다. 같은 질문을 두 번 물으면 거의 매번 같은 답을 내놓았습니다.

결론

이 논문은 퀴즈에서 좋은 점수를 받았다는 이유만으로 AI 에게 MRI 기계를 운영하는 직접적인 지시를 신뢰해서는 안 된다고 결론 내립니다.

퀴즈는 AI 를 실제보다 더 똑똑하게 보이게 만드는 거울과 같습니다. 그들이 실제로 유용한지 알기 위해서는 목록에서 답을 고르는 것이 아니라, 처음부터 답을 생성해야 하는 방식으로 테스트해야 합니다. 저자들은 미래에 AI 의 기억력에만 의존해서는 안 되며, 대신 AI 가 조언을 하기 전에 (사람이 하듯이) 공식 매뉴얼을 찾아보게 하는 시스템을 구축해야 한다고 제안합니다.

간단히 말해: AI 는 시험을 치르는 데는 뛰어나지만, 아직 MRI 기계의 수석 엔지니어가 될 준비는 되지 않았습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →