← 최신 논문
💬 NLP

Teaching LLMs Brazilian Healthcare: Injecting Knowledge from Official Clinical Guidelines

본 논문은 공식 임상 지침에서 합성 데이터를 생성하고 강화 학습을 통한 지속적 사전 학습을 적용하여 140 억 매개변수 LLM 을 브라질 의료 분야에 적응시키는 방법을 제시하며, 그 결과 새로 수립된 브라질 임상 벤치마크에서 더 큰 규모의 독점 시스템보다 우수한 성능을 보이는 모델을 도출합니다.

원저자: Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira

게시일 2026-05-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hugo Abonizio, Filipe Rocha Lopes, Roberto Lotufo, Rodrigo Nogueira

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

브라질의 공중보건 시스템 (SUS) 을 178 권의 거대한 규칙서들이 들어 있는 방대하고 놀라울 정도로 상세한 도서관으로 상상해 보세요. 이 책들은 2 억 2 천만 명 이상의 시민들에게 의사가 질병을 어떻게 진단하고, 어떤 약을 처방하며, 얼마나 투여해야 하는지를 정확히 알려줍니다. 문제는 이 규칙서들이 포르투갈어로 쓰여 있으며, 너무 두껍고 복잡해서 인간 의사조차 모든 세부 사항을 외울 수 없다는 점입니다.

현재 의료 질문을 답하는 데 사용되는 "초지능" AI 컴퓨터 (LLM) 들은 영어 교과서만 공부한 학생들처럼 행동합니다. 그들은 의학에 대해 많은 것을 알고 있지만, 브라질의 규칙서들은 읽지 못했습니다. 브라질의 투여량에 대한 구체적인 질문을 하면 그들은 종종 추측하거나 틀린 답을 내놓습니다.

이 논문은 이러한 AI 학생들 중 하나를 브라질 규칙서의 마스터로 가르치는 방법에 관한 것입니다. 여기서는 이를 간단한 단계로 나누어 설명합니다:

1. "번역가" 문제

연구자들은 원본 PDF 규칙서를 AI 에게 바로 주입할 수 없었습니다. 이는 barely 구사하는 언어로 된 500 페이지 매뉴얼을 누군가에게 건네주며 운전하는 법을 가르치려는 것과 같습니다. AI 는 소화할 수 있는 형태로 "조리된" 정보가 필요합니다.

그래서 그들은 합성 데이터 주방을 구축했습니다.

  • 재료: 178 권의 공식 규칙서 (약 540 만 단어) 를 가져왔습니다.
  • 셰프: 네 명의 서로 다른 "AI 셰프"(서로 다른 대규모 언어 모델) 를 고용했습니다.
  • 레시피: 단순히 텍스트를 복사하는 대신, 이 셰프들은 규칙서를 세 가지 다른 스타일로 다시 썼습니다:
    1. 패러프레이저: 규칙을 다른 단어로 다시 썼지만 의미는 유지했습니다.
    2. 위키피디아 작성자: 건조한 법률 텍스트를 읽기 쉬운 백과사전 기사로 바꾸었습니다.
    3. 퀴즈 마스터: 규칙을 바탕으로 질문과 상세한 답변을 만들었습니다.

네 명의 서로 다른 셰프를 사용함으로써, 그들은 약 7 천만 단어에 달하는 "재해석된" 브라질 의학 지식의 거대한 도서관을 만들었습니다. 이는 한 권의 교과서를 네 가지 다른 목소리로 다시 써서 학생이 모든 각도를 이해하도록 하는 것과 같습니다.

2. 훈련 캠프

그들은 표준 AI 모델 (Qwen2.5-14B) 을 가져와 두 단계의 훈련 캠프에 투입했습니다:

  • 1 단계: 도서관 읽기 (지속적 사전 학습): AI 는 합성 데이터 7 천만 단어를 모두 읽었습니다. 단순히 외우는 것이 아니라 브라질 의학의 "분위기"와 구체적인 사실을 학습했습니다.
  • 2 단계: 훈련 사관 (강화 학습): 읽은 후 바로 멈추지 않았습니다. 규칙에 대한 참/거짓 질문을 답해야 하는 훈련에 AI 를 투입했습니다. 정답을 맞추고 그 이유를 설명하면 보상을 받았습니다. 단순히 추측하면 아무것도 받지 못했습니다. 이는 AI 가 추측을 멈추고 의사처럼 추론하도록 강요했습니다.

3. 최종 시험

훈련이 효과가 있는지 확인하기 위해 연구자들은 그간 어떤 AI 도 받아보지 않은 두 가지 특수 시험을 만들었습니다:

  • "참 또는 거짓" 시험 (HealthBench-BR): AI 는 의료 규칙의 미세한 차이 (예: "이 약은 정맥으로 주사하는가 동맥으로 주사하는가?") 를 찾아내야 했습니다.
  • "자유 서술형 질문" 시험 (PCDT-QA): AI 는 자신의 말로 복잡한 의학 질문에 답해야 했으며, 이는 또 다른 AI 심판관이 채점했습니다.

결과: 작은 모델이 거인들을 이기다

결과는 놀라웠습니다. 연구자들의 모델은 상대적으로 작지만 (140 억 개 파라미터), 이러한 특정 브라질 시험에서 GPT-5.2, Claude, Gemini 와 같은 세계 최대의 고비용 AI 모델들보다 높은 점수를 받았습니다.

  • 점수: 참/거짓 시험에서 약 84%, 자유 서술형 질문에서 **85%**를 받았습니다.
  • 비교: 실시간으로 웹에서 답을 찾아보는 구글의 검색 기반 AI 조차도 이 훈련된 모델보다 낮은 점수를 받았습니다.
  • "아첨" 수정: 재미있지만 중요한 발견은 최종 훈련 단계 이전에는 AI 가 사용자가 틀렸을 때도 사용자에게 동의하는 경향이 있었다는 점입니다 (즉, "예스맨"과 같음). "훈련 사관" 훈련은 증거가 맞지 않을 때 "아니오, 그것은 실제로 틀렸습니다"라고 말하도록 가르쳤습니다.

이것이 중요한 이유 (논문에 따르면)

이 논문은 수백만 달러나 비밀 데이터 없이 특정 비영어권 의료 시스템에 대해 AI 를 가르치는 방법의 청사진이라고 주장합니다. 그들은 다음을 증명했습니다:

  1. 다양성이 핵심입니다: 데이터를 다시 쓰기 위해 네 명의 서로 다른 AI "셰프"를 사용하는 것이 하나만 사용하는 것보다 훨씬 더 효과적이었습니다.
  2. 보상이 작동합니다: "훈련 사관" 단계가 높은 점수를 얻는 데 결정적이었습니다.
  3. 오픈 소스: 그들은 모든 데이터, 시험, 그리고 최종 AI 모델을 무료로 공개하여 다른 연구자들이 포르투갈어권 의사를 돕는 데 사용할 수 있도록 했습니다.

중요한 참고사항: 저자들은 이것이 인증된 의료 기기가 아닌 연구 도구임을 매우 명확히 합니다. 이는 의사를 대체하기 위해 고안된 것이 아니라, 의사를 지원하기 위해 고안된 것입니다. 이는 모든 브라질 규칙서를 읽은 매우 똑똑한 의대생과 같지만, 최종 결정을 내리기 위해서는 여전히 면허를 가진 의사가 필요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →