← 최신 논문
💬 NLP

How much of an LLM-generated clinical corpus is actually new? A production-scale measurement of content redundancy for provenance classification

이 연구는 LLM이 생성한 임상 코퍼스에 최대 79.4%의 중복된 콘텐츠가 포함되어 있음을 밝혀냈으며, 이는 중복 제거를 통해 해결될 때 왜곡된 학습 분포를 교정하고 정보 밀도를 극대화함으로써 다운스트림 임상 모델의 성능을 유의미하게 향상시킨다.

원저자: Ali H. Lazem, William J. Teahan

게시일 2026-06-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ali H. Lazem, William J. Teahan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 엄청나게 똑똑한 로봇(거대 언어 모델, LLM)이 쓴 방대한 의학 이야기 도서관이 있다고 상상해 보세요. 이 도서관은 25억 1천만 단어를 담고 있다고 광고됩니다. 정말 엄청나 보이죠, 그렇지 않나요? 마치 로봇이 의학에 대해 알고 있는 거의 모든 것을 읽고 이해한 것처럼 들립니다.

하지만 이 논문은 마치 그 도서관으로 걸어 들어가는 탐정처럼 이렇게 말합니다. "잠깐만요. '실제로' 새로운 정보가 얼마나 되는지 직접 세어봅시다."

그들이 수학적 계산을 해냈을 때, 충격적인 비밀을 발견했습니다. 그 단어들 중 단 10.9%만이 실제로 새로운 정보였습니다. 나머지 **79.4%**는 로봇이 똑같은 이야기를 반복하거나 똑같은 내용을 계속해서 복사하여 붙여넣은 것에 불과했습니다.

그들이 발견한 내용을 일상적인 비유를 사용하여 간단히 정리해 드립니다.

1. "복사기" 문제 (문맥-복사 중복성)

당신이 100명의 학생에게 퀴즈를 내는 선생님이라고 상상해 보세요. 매 질문마다, 당신은 학생들이 "참고할 수 있도록" 10페이지짜리 교과서 전체를 복사해서 퀴즈 용지 맨 위에 스테이플러로 찍어서 줍니다.

  • 결과: 당신은 총 1,000페이지의 종이를 갖게 됩니다 (100개의 퀴즈 × 10페이지).
  • 실제: 당신에게 필요한 것은 10페이지의 새로운 질문뿐입니다. 나머지 990페이지는 그냥 교과서를 복사한 것일 뿐입니다.

논문에서 로봇은 정확히 이와 같은 행동을 했습니다. 하나의 의학적 사실을 추출할 때마다, 로봇은 원본 환자 이야기를 파일 안에 통째로 다시 붙여넣었습니다.

  • 비용: 이 "복사하기" 작업이 도서관 공간의 **67.5%**를 차지했습니다.
  • 해결책: 이것은 고치기 쉽습니다! 정보를 버릴 필요 없이, 그냥 "페이지 1 참조"라고 쓰기만 하면 됩니다. 만약 이렇게 했다면, 단 하나의 사실도 놓치지 않고도 도서관의 크기를 4분의 3으로 줄일 수 있었을 것입니다.

2. "고장 난 레코드" 문제 (생성-중복 문제)

이제 로봇이 DJ가 되어 음악을 틀고 있다고 상상해 보세요. 로봇은 환자마다 고유한 노래를 틀어야 합니다. 하지만 로봇이 매우 일관되게 동작하도록 훈련되었기 때문에, 모든 노래에서 똑같은 10초짜리 후렴구를 계속해서 재생합니다.

  • 결과: 당신은 똑같은 후렴구를 수천 번 듣게 됩니다.
  • 실제: 이번에는 로봇이 파일을 "복사"하는 것이 아니라, 엄격한 템플릿을 따르느라 똑같은 텍스트를 계속 생성하고 있는 것입니다.

논문에서 이 현상은 약 **11.9%**의 비율로 발생했습니다. 로봇은 서로 다른 환자에 대해 똑같은 추론이나 답변을 작성했는데, 이는 마치 고장 난 레코드처럼 똑같은 말을 반복하는 것과 같았습니다.

  • 비용: 이것은 고치기가 더 어렵습니다. 왜냐하면 로봇이 이 단어들을 생각하느라 실제로 시간과 전기를 이미 써버렸기 때문입니다. 그 에너지를 되돌릴 수는 없지만, 다음번에는 중복되는 내용을 삭제할 수 있습니다.

3. "가짜 규모"의 환상

이 두 가지 문제 때문에, 도서관은 실제보다 9배나 더 커 보입니다.

  • 광고: "우리는 25억 1천만 단어의 의료 데이터를 보유하고 있습니다!"
  • 진실: "우리는 실제로 약 2억 7,200만 단어의 고유하고 유용한 정보를 가지고 있습니다."

만약 연구자가 이 25억 1천만 단어 전체를 사용하여 새로운 의료 AI를 훈련시키려 한다면, 그들은 그 모든 노이즈에 시간과 컴퓨터 자원을 낭비하게 될 것입니다. 이는 사전의 80%가 그냥 "the"라는 단어가 반복되는 페이지들로 채워진 사전을 읽으며 언어를 배우려는 것과 같습니다.

4. 증명: 이것이 정말 중요한가?

저자들은 단순히 단어 수를 센 것이 아닙니다. 그들은 이 "노이즈"가 실제로 로봇의 뇌에 해를 끼치는지 테스트했습니다.

  • 실험: 그들은 의료 AI를 가져와서, 지저式한(중복된) 버전의 도서관과 깨끗한(중복이 제거된) 버전의 도서관 두 가지 버전으로 훈련시켰습니다. 두 버전 모두 동일한 양의 "읽기 시간"(토큰 예산)을 할당받았습니다.
  • 결과: 깨끗한 버전으로 훈련된 AI가 더 똑똑했습니다. 질병을 인식하는 능력이 더 좋아졌습니다.
  • 교훈: 중복된 단어에 시간을 낭비하는 것은 AI가 고유한 것들을 배우는 데 방해가 됩니다.

5. 하나의 깨끗한 방

흥미롭게도, 그들은 거의 완벽하게 깨끗한 하나의 파이프라인( "요약" 채널)을 발견했습니다. 왜일까요? 설계자들이 로봇에게 "환자 한 명당 요약을 하나만 작성하고, 그 안에 전체 이야기를 붙여넣지 마라"고 지시했기 때문입니다.
이는 이 지저분함이 로봇의 잘못이 아니라, 시스템의 설계 문제였음을 증명합니다. 시스템을 다르게 구축한다면, 쓰레기는 생기지 않습니다.

결론

이 논문은 미래를 위한 간단한 체크리스트를 제공합니다:

  1. 단순히 단어 수만 세지 마십시오. 데이터가 실제로 얼마나 고유한지 보고하십시오.
  2. 복사하기를 멈추십시오. 모든 파일에 원본 이야기를 통째로 붙여넣지 말고, 그냥 링크를 거십시오.
  3. 중복을 제거하십시오. 새로운 AI를 훈련시키기 전에 로봇이 생성하는 중복 텍스트를 제거하십시오.

이렇게 함으로써, 우리는 수십억 개의 새로운 단어를 생성할 필요 없이, 의료 AI를 더 저렴하게 운영하고, 더 빠르게 훈련하며, 실제로 더 똑똑하게 만들 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →