← 최신 논문
📊 statistics

Errors in AI-Assisted Retrieval of Medical Literature: A Comparative Study

이 연구는 5 가지 주요 LLM 플랫폼이 의학 문헌을 검색할 때 약 47.8% 의 확률로 완전히 잘못된 정보를 제공하며, 플랫폼과 저널에 따라 정확도에 큰 편차가 있음을 보여줌으로써 AI 기반 문헌 검색 시 참고문헌을 반드시 검증해야 함을 강조합니다.

원저자: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disi
게시일 2026-03-25
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jenny Gao (College of Arts and Science, New York University, New York, NY), Yongfeng Zhang (Department of Computer Sciences, School of Arts & Sciences, Rutgers University, Piscataway, NJ), Mary L Disis (UW Medicine Cancer Vaccine Institute University of Washington, Seattle, WA), Lanjing Zhang (Department of Chemical Biology, Ernest Mario School of Pharmacy, Rutgers University, Piscataway, NJ, Department of Pathology, Princeton Medical Center, Plainsboro, NJ, Rutgers Cancer Institute, New Brunswick, NJ)

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 의학 논문을 찾아줄 때 얼마나 자주 엉뚱한 답을 내놓는가?"**를 실험한 연구 결과입니다.

너무 어렵게 들리시나요? 쉽게 비유해서 설명해 드릴게요.

🍕 비유: "AI 는 요리사가 아니라, 기억력이 나쁜 요리 견습생"

이 연구를 한 과학자들은 AI(대형 언어 모델) 를 요리사로 생각했습니다. 우리는 AI 에게 "이 요리에 어울리는 레시피 10 가지를 찾아줘"라고 주문을 넣었습니다. 그런데 AI 가 찾아온 레시피를 보니, 제목은 비슷해 보이지만 재료 이름이 다르고, 레시피 번호 (DOI) 는 엉뚱한 곳으로 연결되어 있었습니다.

이 연구는 AI 가 찾아낸 레시피 2,000 개를 하나하나 손으로 확인해 보았습니다.

🔍 연구는 어떻게 진행되었나요?

  1. 재료 준비: 세계적으로 유명한 의학 저널 4 곳 (BMJ, JAMA, Lancet, NEJM) 에서 최신 논문 40 편을 무작위로 뽑았습니다.
  2. 주문하기: AI 5 종 (Grok, ChatGPT, Gemini, Perplexity, DeepSeek) 에게 "이 논문과 관련된 참고 문헌 10 개를 찾아줘"라고 시켰습니다.
  3. 검수: AI 가 찾아온 문헌들이 진짜인지, 번호가 맞는지, 제목이 같은지 사람이 직접 하나하나 확인했습니다.

📊 결과는 어땠나요? (놀라운 사실들)

1. "거의 절반은 엉터리" (47.8% 실패)
AI 가 찾아온 문헌 중 **거의 절반 (47.8%)**은 완전히 엉뚱한 것이거나, 아예 존재하지 않는 가짜 문헌이었습니다. 마치 주문한 피자가 반은 치즈가 없고, 반은 종이로 만든 것처럼 말이죠.

2. AI 브랜드마다 실력이 천차만별
모든 AI 가 똑같이 못 한 건 아닙니다.

  • 가장 잘한 AI (Grok): 10 개 중 5~6 개는 제대로 찾아냈습니다. (성적표 57 점)
  • 가장 못 한 AI (Gemini): 10 개 중 1 개도 제대로 못 찾아냈습니다. (성적표 11 점)
  • 평균: 5 개 AI 를 합쳐도 평균 점수는 29 점에 불과했습니다.

3. 논문이 나오는 잡지에 따라 난이도가 다름

  • NEJM이라는 잡지의 논문을 찾으려 할 때 AI 가 가장 많이 헷갈려 했습니다. (아마도 이 잡지의 논문 제목이 짧거나 복잡해서 AI 가 혼란을 느꼈을 것입니다.)
  • 반면 BMJ 잡지의 논문은 AI 가 상대적으로 잘 찾아냈습니다.

💡 이 연구가 우리에게 주는 교훈은?

1. "AI 가 찾아준 문헌은 절대 믿지 마세요."
AI 가 찾아온 문헌의 제목은 그럴듯해 보일지 몰라도, **저자 이름, 발행 연도, DOI(문서 고유 번호)**는 거의 틀리는 경우가 많습니다. 마치 친구가 "어제 봤던 영화 제목은 이거야"라고 말해주는데, 막상 가서 보니 다른 영화인 것과 같습니다.

2. "한 번에 하나만 믿지 말고, 여러 AI 를 비교하세요."
하나의 AI 만 믿으면 엉뚱한 길로 빠질 수 있습니다. 여러 AI 에게 물어보고, 그중에서 일치하는 부분을 찾아내는 것이 안전합니다.

3. "AI 는 '조언자'일 뿐, '전문가'가 아닙니다."
의학이나 과학 연구처럼 정확한 정보가 생명을 좌우할 수 있는 분야에서는, AI 가 찾아준 정보는 반드시 사람이 직접 다시 확인해야 합니다. AI 는 훌륭한 '도움말'을 줄 수는 있지만, 최종 결정을 내리는 '책임자'가 되어서는 안 됩니다.

🎯 한 줄 요약

"인공지능이 의학 논문을 찾아줄 때는, 마치 기억력이 나쁜 견습 요리사가 레시피를 대충 외워서 가져오는 것과 같습니다. 제목은 비슷해 보일지 몰라도 내용은 엉터리일 확률이 매우 높으니, 반드시 사람이 직접 다시 확인해야 합니다."

이 연구는 AI 기술이 발전했지만, 아직은 정확한 정보 검색에는 한계가 있음을 경고하고 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →