← 최신 논문
💬 NLP

Leveraging Few-Shot Learning and Large Language Models for Analyzing Blood Pressure Variations Across Biological Sex from Scientific Literature

본 연구는 현재의 인구통계학적 특성을 고려하지 않는 진단 표준의 한계를 해결하기 위해, 과학 문헌으로부터 성별 특이적 혈압 통계치를 자동으로 추출하는 데 있어 거대 언어 모델(LLM)과 퓨샷 학습(few-shot learning)을 사용하는 것의 타당성을 평가한다.

원저자: Yuting Guo, Seyedeh Somayyeh Mousavi, Reza Sameni, Abeed Sarker

게시일 2026-08-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuting Guo, Seyedeh Somayyeh Mousavi, Reza Sameni, Abeed Sarker

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 대중을 위해 완벽한 케이크를 구우려 한다고 상상해 보세요. 하지만 당신의 레시피 북은 50년 전, 오직 자신들과 똑같이 생기고 똑같이 살아가는 사람들을 위해서만 케이크를 구웠던 아주 특정한 집단의 사람들에 의해 쓰였습니다. 당신이 다른 모든 사람들을 위해 그 오래된 레시피를 사용하려고 시도하지만, 결과적으로 어떤 이들에게는 너무 건조하고 어떤 이들에게는 너무 달콤한 케이크가 나옵니다. 이것이 본질적으로 우리가 현재 혈압을 측정하는 방식의 문제입니다. 수십 년 동안 의사들은 누군가의 심장이 과도한 스트레스를 받고 있는지 결정하기 위해 단 하나의 "정상" 수치 세트를 사용해 왔으며, 이는 사람의 생물학적 특성(예를 들어 남성인지 여성인지 여부)에 따라 다른 규칙이 필요할 수 있다는 점을 종종 간과하곤 합니다.

이를 해결하기 위해, 과학자들은 새로운 종류의 디지털 탐정인 거대 언어 모델(LLM)로 눈을 돌리고 있습니다. 이 모델들을 인터넷에 쓰인 거의 모든 것을 읽은 매우 똑똑한 로봇이라고 생각해 보세요. 이들은 세상의 모든 도서관을 암기한 학생과 같아서, 백만 페이지짜리 책에서 특정 사실을 지치지도 않고 즉각적으로 찾아낼 수 있습니다. 연구자들이 답을 찾고자 했던 큰 질문은 이것이었습니다: "이 AI 로봇들이 수천 편의 오래된 의학 연구를 읽고, 남성과 여성의 특정 혈압 수치를 찾아내어, 기존의 '일률적인' 레시 recipe가 실제로 망가졌는지 알려줄 수 있을까?"


위대한 혈압 보물 찾기

이 연구에서 연구진은 이 AI 로봇들을 테스트해 보기로 했습니다. 그들은 로봇이 방대한 양의 과학 논문을 뒤져서 매우 구체적인 보물, 즉 생물학적 성별(남성 대 여성)에 따라 구분된 평균 혈압 수치와 그 수치가 얼마나 변동하는지를 찾아낼 수 있는지 확인하고 싶었습니다.

설정: 디지털 골드러시
연구진은 거대한 데이터 더미에서 시작했습니다. 그들은 PubMed Central라는 거대한 온라인 도서관에서 560만 개 이상의 과학 논문 원고를 가져왔습니다. 도시 크기만 한 건초더미에서 몇 개의 특정 바늘을 찾는 장면을 상상해 보세요. 이를 더 쉽게 만들기 위해, 그들은 논문을 혈압에 대해 다루는 약 113,000개로 걸러내는 특수 검색 엔진(과학자들을 위한 초강력 구글 같은 것)을 구축했습니다. 그런 다음, 그 논문들을 더 작은 덩어리(문단)로 나누고 다시 필터링하여, 최종적으로 약 50,000개의 관련 문단을 얻었습니다.

이 거대한 더미에서, 그들은 AI 도구를 테스트할 수 있는 더 작고 관리 가능한 그룹인 213개의 기사를 선정했습니다. 심지-않은 전문가들이 이 기사들을 직접 읽고 정답으로 사용할 수 있는 수치를 작성하게 하여 "정답지"를 만들기도 했습니다.

경연: 세 명의 서로 다른 탐정
연구진은 어떤 방식이 정답을 가장 잘 찾아내는지 보기 위해 세 가지 방법 간의 경주를 설정했습니다.

  1. 올드 스쿨 루키 (DANN): 이것은 전통적인 컴퓨터 프로그램으로, 나머지를 추측하기 전에 몇 가지 예시를 보여줘야 합니다(이것을 "퓨샷 러닝(few-shot learning)"이라고 합니다). 이는 마치 시험을 보기 전에 몇 장의 플래시카드를 공부해야 하는 학생과 같습니다.
  2. 유명한 챗봇 (GPT-3.5): 이것은 대화를 나누고 이야기를 쓸 수 있는 잘 알려진 AI입니다. 연구진은 이 AI에게 특별한 훈련을 먼저 시키지 않고(이것을 "제로샷(zero-shot)"이라고 합니다), 그냥 텍스트를 읽고 숫자를 찾으라고 요청했습니다.
  3. 오픈 소스 거인 (LLaMA3): 이것은 또 다른 강력한 AI로, 챗봇과 비슷하지만 다른 집단에 의해 만들어졌습니다. 챗봇과 마찬가지로, 이 역시 일반적인 지식을 사용하여 특별한 훈련 없이 임무를 수행하도록 요청되었습니다.

결과: 누가 경주에서 승리했나?
결과는 꽤 명확했습니다. "올드 스쿨 루키" (DANN)는 몹시 고전했습니다. 정답률은 약 30%에 불과했습니다. 그것은 마치 시험 문제를 무작위로 찍는 학생 같았습니다.

"유명한 챗봇" (GPT-3.5)은 더 나은 성적을 거두며 약 67%의 정답을 맞혔습니다. 중간 정도의 성과를 낸 견실한 수행자였지만, 가끔 찾아내야 할 것을 놓치기도 했습니다.

승자는 "오픈 소스 거인" (LLaMA3)이었습니다. 이 모델은 정확도 척도에서 인상적인 0.85(또는 85%)를 기록했습니다. 이 모델은 가장 신뢰할 수 있는 탐정이었으며, 높은 정밀도로 남성과 여성을 위한 올바른 숫자를 찾아냈고 단서를 놓치는 일이 거의 없었습니다. 연구진은 이 AI가 매우 일관적이어서 테스트를 여러 번 실행해도 점수가 크게 흔들리지 않는다는 것을 발견했습니다.

보물 속에서 무엇을 발견했나?
승리한 AI (LLаMA3)가 논문에서 성공적으로 숫자를 추출하자, 연구진은 그 패턴을 살펴보았습니다. 그들은 데이터를 시각화하기 위해 색채가 풍부한 지도(히트맵 및 등고선 플롯이라 불리는 것)를 만들었습니다. 이 지도들은 일반적으로 남성이 여성보다 높은 혈압 수치를 갖는 경향이 있음을 보여주었습니다.

이것은 그 자체로 놀라운 발견은 아닙니다. 이전 연구들도 이를 암시해 왔습니다. 하지만 멋진 점은 어떻게 그것을 찾아냈느냐 하는 것입니다. 그들은 인간에게 수천 편의 논문을 읽게 한 것이 아니라, AI를 사용하여 이를 자동으로 수행했습니다. 이는 우리가 단순히 추측하거나 오래된 일반적인 규칙을 사용하는 대신, 강력한 로봇을 사용하여 전체 의료 문헌을 스캔함으로써 서로 다른 집단의 사람들이 실제로 어떻게 지내고 있는지 확인할 수 있음을 시사합니다.

핵식 결론
이 연구는 이러한 AI 로봇들이 메이저 리그에 나설 준비가 되었음을 결론짓습니다. 이들은 과학 문헌을 읽고, 성별에 따라 데이터를 분리하며, 단순히 추측하거나 오래된 방법을 사용하는 것보다 더 명확한 혈압 추세를 우리에게 보여줄 수 있습니다. 연구진은 이번 실행에서 성별만을 살펴보았으며 연령이나 인종과 같은 다른 요인들은 확인하지 않았음을 인정하지만, 이 방법은 작동합니다. 이는 마침내 수백만 개의 계약서 세부 내용을 읽어 규칙이 원래 만들어진 대상뿐만 아니라 모두에게 공정한지 알려줄 수 있는 도구를 갖게 된 것과 같습니다.

이 논서는 우리가 이러한 도구들을 사용함으로써, 결국 모든 사람을 맞지 않는 상자에 억지로 밀어 넣는 대신, 실제 사람들에게 적합한 더 개인화되고 정확한 건강 가이드라인을 만들 수 있을지도 모른다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →