← 최신 논문
💬 NLP

Prompting language influences diagnostic reasoning and accuracy of large language models

본 연구는 임상 환경에서 대부분의 대규모 언어 모델의 진단 추론 및 정확도에 프롬프트 언어가 상당한 영향을 미치며, 평가된 다섯 개 모델 중 네 개에서 영어가 일반적으로 프랑스어보다 우수한 성과를 보여 글로벌 공정한 배포를 위한 중요한 장벽을 부각시켰음을 입증한다.

원저자: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

게시일 2026-05-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud

원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

5 명의 천재적인 의대생 팀이 있다고 상상해 보세요. 그들은 놀라울 정도로 똑똑하며, 수백만 권의 의학 서적을 읽었고 복잡한 퍼즐을 해결할 수 있습니다. 하지만 함정이 하나 있습니다. 그들은 모두 다른 국가의 학교를 다녔으며, 사고를 위한 '모국어'는 영어입니다.

이 논문은 이러한 학생들에게 영어프랑스어로 의료 사례를 해결하도록 요청했을 때 그들의 수행 능력이 얼마나 좋은지 평가하는 성적표와 같습니다. 연구자들은 질문을 할 때 사용된 언어가 답변의 질을 변화시키는지 확인하고자 했습니다.

다음은 그들이 발견한 내용을 간단한 비유로 정리한 것입니다:

1. 설정: "의료 퍼즐" 테스트

연구자들은 180 개의 의료 퍼즐(시나리오)을 만들었습니다. 이는 단순한 객관식 문제가 아니라, 실제 진료실에서 의사가 마주하는 증상과 환자에 대한 짧은 이야기였습니다.

  • 테스트: 이 퍼즐들을 o3, DeepSeek-R1, GPT-4-Turbo, Llama-3.1, BioMistral 등 5 개의 서로 다른 AI 모델(학생들) 에게 제공했습니다.
  • 반전: 각 학생에게 같은 퍼즐을 두 번 제시했습니다. 한 번은 영어로, 한 번은 프랑스어로요.
  • 채점자: 실제 의사 두 명이 교사 역할을 했습니다. 그들은 단순히 최종 답변이 맞는지 확인하는 것뿐만 아니라 전체 사고 과정(추론)을 0 점부터 18 점까지 척도로 채점했습니다. 그들은 다음과 같은 점들을 확인했습니다:
    • 학생이 모든 단서를 파악했는가?
    • 논리는 타당한가?
    • 다른 가능성들을 고려했는가?
    • 최종 진단이 정확한가?

2. 결과: "영어 우위"

5 명 중 4 명의 학생들에게서 결과는 명확했습니다: 그들은 영어로 말할 때 훨씬 더 잘 수행했습니다.

  • 격차: 비록 이 모델들이 프랑스어를 유창하게 구사할 수 있지만, 그들의 "뇌"는 영어로 작동할 때 더 잘 기능했습니다. 마치 프랑스어로 노래를 연주할 수 있는 음악가가 있지만, 영어로 연주할 때 손가락 움직임이 더 빠르고 리듬이 더 완벽해지는 것과 같습니다.
  • 점수: 평균적으로 영어 답변은 눈에 띄는 차이 (18 점 척도에서 0.37 점에서 0.91 점 사이) 로 더 좋았습니다.
  • 격차가 발생한 곳: 이 차이는 단순히 최종 답변에 국한되지 않았습니다. 학생들은 프랑스어로 사고하도록 강요받을 때 더 많은 논리적 실수를 범하고, 더 많은 단서를 놓치며, 더 약한 추론을 보였습니다.
    • 비유: 미스터리를 해결하는 탐정을 상상해 보세요. 영어로 할 때는 단서의 흔적을 완벽하게 따라갑니다. 하지만 프랑스어로 할 때는 산만해지거나, 단서를 놓치거나, 증거와 완전히 맞지 않는 결론에 서둘러 도달할 수 있습니다. 결국 올바른 이름을 맞힐지라도 말입니다.

3. 예외: "수퍼 학생"

o3라는 한 모델만이 영어와 프랑스어 사이에서 차이가 전혀 없는 유일한 모델이었습니다.

  • 왜? 논문은 이 모델이 고급 추론 능력이라는 특별한 "초능력"을 가지고 있다고 제안합니다. AI 가 단계별로 문제를 해결하는 능력 (머릿속으로 복잡한 수학 문제를 푸는 것) 이 향상됨에 따라 언어 장벽이 사라지기 시작하는 것 같습니다. 이는 퍼즐의 논리를 너무 잘 마스터한 학생이라서 지시사항이 어떤 언어로 쓰여 있는지 중요하지 않은 것과 같습니다.

4. 이것이 중요한 이유 (논문에 따르면)

이 논문은 언어가 AI 를 감싸는 단순한 껍질이 아니라, AI 가 사고하는 방식의 일부라고 주장합니다.

  • "학습 식단" 문제: 이 AI 들의 대부분은 거대한 영어 데이터 더미로 훈련되었습니다 (영어 교과서만 읽은 학생처럼). 프랑스어를 번역할 수 있더라도, 의료 추론에 대한 그들의 "근육 기억"은 영어 패턴 위에 구축되어 있습니다.
  • 위험: 프랑스어권 병원의 의사가 이러한 도구를 사용할 경우, AI 는 영어권 의사를 위한 경우보다 약간 덜 정확한 진단이나 더 엉성한 설명을 제공할 수 있습니다.
  • 결론: 이 논문은 AI 가 전 세계적으로 공정하고 유용하려면 영어에만 의존해서는 안 된다고 결론 내립니다. 우리는 이러한 모델들이 영어만큼 프랑스어 (및 기타 언어) 에서도 똑똑하도록 보장해야 합니다.

요약

이러한 AI 모델을 다국어 요리사로 생각하세요. 영어로 레시피를 주면 훌륭한 요리 (진단) 를 할 수 있습니다. 같은 레시피를 프랑스어로 주면, 5 명의 요리사 중 4 명은 여전히 좋은 요리를 하지만, 양념이 약간 부족하거나 플레이팅이 조금 어색할 수 있습니다. 오직 한 명의 요리사 (o3) 만 레시피의 언어와 관계없이 정확히 같은 완벽한 요리를 합니다.

이 논문은 이 "언어 편향"을 수정할 때까지 비영어권 환경에서 이러한 도구에 의존하는 것은 약간 낮은 품질의 결과를 의미할 수 있다고 경고합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →