← 최신 논문
💬 NLP

FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts

이 논문은 스페인어 임상 텍스트에서 흡연, 음주, 대마, 약물 사용 등 4 가지 유해 습관을 식별하고 분류하는 ToxHabits 공유 과제에 참여하여 GPT-4.1 의 퓨샷 프롬프팅을 활용해 테스트 세트에서 0.65 의 F1 점수를 기록한 연구 결과를 제시합니다.

원저자: Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

게시일 2026-04-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🏥 배경: 혼란스러운 의료 기록의 도서관

병원에는 매일 수많은 환자의 기록 (진료 기록, 퇴원 요약 등) 이 쌓입니다. 문제는 이 기록들이 대부분 정리되지 않은 자유 형식의 글이라는 점입니다. 마치 도서관에 책이 아무렇게나 널려 있는 것과 같습니다.

특히 **'약물 남용'이나 '나쁜 습관'**에 대한 정보는 이 글들 속에 숨어 있습니다. 예를 들어, "환자는 과거에 담배를 피웠고, 지금은 술을 끊었다" 같은 문장이 섞여 있습니다. 컴퓨터가 이걸 자동으로 찾아내려면 매우 정교한 기술이 필요합니다.

🎯 목표: '나쁜 습관' 탐정 팀 (ToxHabits)

이 연구는 **'ToxHabits'**라는 국제 대회의 한 부분입니다. 참가자들은 스페인어로 된 의료 기록에서 다음 네 가지 나쁜 습관을 찾아내야 했습니다:

  1. 담배
  2. 대마초
  3. 약물

우리 연구팀은 이 대회에 참여하여, 최신 인공지능 기술인 LLM(대형 언어 모델)을 활용해 이 문제를 해결했습니다.

🤖 해결책: 초지능 보조 의사 (GPT-4.1)

과거에는 컴퓨터가 규칙을 일일이 입력하거나, 수많은 예시를 학습시켜야 했지만, 이번에는 GPT-4.1이라는 최신 AI 를 '보조 의사'로 고용했습니다.

이 보조 의사는 다음과 같은 방식으로 일합니다:

  1. **교과서 읽기 **(Few-shot Prompting)
    AI 에게 "이런 예시들이 정답이야"라고 5 개 정도의 사례를 보여줍니다. 마치 신입 의사가 선배의 진료 기록을 5 개 정도 보고 "아, 이런 패턴이 나쁜 습관이구나!"라고 배우는 것과 같습니다.
  2. 문장 나누기:
    긴 의료 기록을 잘게 쪼개서 AI 가 집중할 수 있게 합니다.
  3. 찾아내기:
    AI 가 "아, 여기 '술' 관련 내용이 있네!"라고 찾아낸 뒤, 정확한 위치를 표시합니다.

📊 실험 결과: AI 의 활약상

연구팀은 여러 가지 방법을 시도해 보았습니다.

  • **기존 방식 **(사전 기반) 단어 사전만 보고 찾는 방식. (찾아내는 건 잘하지만, 헷갈리는 게 많음)
  • **기존 AI **(BERT 모델) 스페인어 의료용 AI. (잘하지만 언어 제한이 있음)
  • **새로운 방식 **(GPT-4.1 + 5 개 예시) 이 방식이 가장 잘했습니다!

결과:

  • **정확도 **(F1 점수) 0.65 (만점 1.0 기준)
  • 의미: 스페인어라는 언어 장벽이 있음에도 불구하고, AI 가 나쁜 습관을 꽤 잘 찾아냈습니다. 특히 5 개의 예시를 보여주고 학습시키는 방식이 가장 효과적이었습니다.

⚠️ 문제점: AI 의 '과잉 해석' 버릇

하지만 AI 는 완벽하지 않았습니다. 몇 가지 재미있는 실수를 했습니다.

  • 너무 길게 잡기:
    • 정답: "담배" (tabaco)
    • AI 의 답: "과거에 담배를 많이 피웠다" (fumaba mucho)
    • 비유: 의사가 "환자가 담배를 피웠다"라고 말했을 때, AI 는 '담배'라는 단어만 찾는 게 아니라, 그 문장 전체를 다 찾아냅니다. 핵심 단어만 골라내야 하는데, 문맥까지 다 가져와 버린 것입니다.
  • 부정문 오해:
    • "담배를 피지 않는다"라고 썼는데, AI 가 "담배"를 나쁜 습관으로 잘못 찾아내는 경우가 있었습니다.
  • 너무 구체적인 것까지 찾아내기:
    • "맥주", "럼", "샷" 같은 구체적인 술 이름은 잘 찾지만, "흡연자"나 "양성" 같은 일반적인 단어는 놓치는 경우가 있었습니다.

💡 결론 및 미래 전망

이 연구는 **"최신 AI 가 스페인어 의료 기록에서도 나쁜 습관을 찾아낼 수 있다"**는 것을 증명했습니다.

  • 장점: 영어가 아닌 다른 언어에서도 적은 예시만으로도 잘 작동합니다.
  • 과제: AI 가 찾아낸 문장을 너무 길게 잡거나, 부정문을 잘못 이해하는 문제를 해결해야 합니다. 마치 **보조 의사가 찾아낸 메모를 최종 의사 **(사람)하는 과정이 필요합니다.

한 줄 요약:

"최신 AI 가 스페인어 의료 기록을 훑어보며 '술, 담배, 약물' 같은 나쁜 습관을 찾아냈는데, 아주 잘했지만 가끔은 문장 전체를 다 가져오는 '과잉 열성' 버릇이 있어, 사람이 마지막에 다듬어주면 완벽해질 것 같습니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →