← 최신 논문
💬 NLP

Characterizing Narrative Content in Web-scale LLM Pretraining Data

이 논문은 웹 규모의 LLM 사전 학습 데이터의 미세한 서사 구조를 특징짓기 위한 새로운 프레임워크와 데이터셋인 NarraDolma를 소개하며, 서사적 품질이 측정 가능한 수준으로 존재하지만 현재의 큐레이션 관행이 간과하고 있는 방식대로 출처와 주제에 따라 불균등하게 분포되어 있음을 밝힌다.

원저자: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

게시일 2026-06-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 파티를 위해 아주 큰 케이크를 굽고 있다고 상상해 보세요. 레시피에는 "밀가루"가 필요하다고 적혀 있지만, 당신은 자신이 가진 밀가루가 어떤 종류인지 모릅로 있습니다. 곱고 부드러운 케이크용 밀가루인가요? 거친 통밀인가요? 아니면 모래가 섞여 있나요?

오랫동안 "대규모 언어 모델(LLM)"—챗봇 같은 도구 뒤에 있는 초지능적 AI 브레인—을 만드는 과학자들은 자신들의 "밀가루"(학습에 사용하는 인터넷 텍스트)가 구체적으로 어떤 성분인지 제대로 알지 못한 채 섞어왔습니다. 그들은 어떤 부분이 "유해"하거나 "수학에 관한 것"이라는 점은 알고 있었지만, 그 혼합물 안에 들어있는 **이야기(stories)**에 대해서는 잘 알지 못했습니다.

이 논문은 마치 이 거대한 밀가루 더미를 현미경으로 들여다보기로 결심한 식품 과학자 팀과 같습니다. 그들은 다음과 같은 질문에 답하고자 했습니다: 실제로 그 안에 얼마나 많은 스토리텔링이 들어 있으며, 그것은 어떤 모습인가?

다음은 그들의 조사 내용에 대한 요약입니다:

1. 레시피 북 (프레임워크)

연구진은 단순히 "이것이 이야기인가?"(예/아니오)라고 묻는 데 그치지 않았습니다. 대신, 그들은 인간이 이야기를 구성하는 방식에 기반하여 상세한 **풍미 프로필(flavor profile)**을 만들었습니다. 그들은 "스토리텔링"을 세 가지 주요 성분으로 나누었습니다:

  • 행위자 (Agency): 누가 행동하고 있는가? 우리가 그들의 눈을 통해 세상을 보고 있는가? 우리는 그들의 감정을 느끼거나 생각을 듣고 있는가? (이것을 이야기의 "심장"이라고 생각하세요.)
  • 무대 (Setting): 이곳은 어디이며 언제인가? 막연한 "어딘가"인가, 아니면 1920년대 파리의 먼지 쌓인 어느 방인가? (이것을 "배경"이라고 생각하세요.)
  • 플롯 (Events): 실제로 무슨 일이 일어나는가? 변화가 생기는가? 인과관계의 사슬이 존재하는가, 아니면 단순히 나열된 목록인가? (이것을 "액션"이라고 생각하세요.)

그들은 이를 1부터 5까지 점수를 매길 수 있는 11개의 구체적인 "다이얼" 또는 슬라이더로 변환했습니다.

2. 맛 테스트 (데이터)

그들은 DOLMA라고 불리는 거대한 인터넷 텍스트 라이브러리를 가져왔습니다(이는 3조 단어에 달하며, 평생을 읽어도 다 못 읽을 정도의 거대한 도서관과 같습니다).

  • 1단계: 이 모든 것을 다 읽을 수는 없었습니다. 그래서 그들은 그들을 도울 로봇 조수(NARRABERT라는 모델)를 만들었습니다.
  • 2단계: 먼저, 전문가들을 고용하여 무작위로 추출된 400개의 짧은 글을 읽게 하고 11개의 다이얼에 따라 점수를 매기게 했습니다. 이것이 "골드 스탠다드(표준)"가 되었습니다.
  • 3단계: 그 후, 로봇 조수가 인간을 흉내 내도록 가르쳤습니다.
  • 4단계: 로봇은 300만 개의 짧은 글을 훑으며 모두 점수를 매겼습니다. 그리고 그들은 NARRADOLMA라는 새로운 지도를 만들어냈습니다.

3. 놀라운 발견들

그들이 지도를 살펴보았을 때, 세 가지 큰 사실을 발견했습니다:

A. 이야기는 단순히 "켜짐" 또는 "꺼짐" 상태가 아닙니다.
이것은 텍스트가 이야기냐 아니냐를 결정하는 전등 스위치 같은 것이 아닙니다. 그것은 **조광기(dimmer switch)**와 같습니다. 어떤 텍스트는 매우 어둡고(지루한 사실들), 어떤 것은 매우 밝습니다(극적인 소설). 그리고 대부분은 그 중간 어디쯤에 있습니다. 연구진은 인터넷 속의 "스토리텔링"이 단순한 카테고리가 아니라, 연속적이고 다차원적인 풍경이라는 것을 발견했습니다.

B. "밀가루"는 고르게 섞여 있지 않습니다.
만약 여러분이 "레딧(Reddit)"은 이야기로 가득 차 있고 "위키피디아(Wikipedia)"는 사실로 가득 차 있다고 생각한다면, 대체로 맞습니다. 하지만 그 구조는 더 복잡합니다.

  • 레딧과 책은 "내면의 감정"과 "캐릭터의 생각"이 가득한 향신료 선반과 같습니다. 이들은 "행위자(Actor)" 다이얼 수치가 높습니다.
  • 위키피디아와 뉴스는 지도와 같습니다. 이들은 "사건(Events)"과 "시간/장소" 수치는 높지만, "감정"은 낮습니다.
  • 여행 및 음식 블로그는 그림과 같습니다. 이들은 "감각적 세부 사항"(냄로, 시각)은 높지만, "갈등(Conflict)"은 낮습니다.

C. 책을 더 추가한다고 해서 단순히 "이야기를 더 많이 추가"할 수는 없습니다.
연구진은 단일 출처(예: 레딧) 내에서도 "스토리텔링"의 정도가 크게 달라진다는 것을 발견했습니다. 어떤 레딧 게시물은 순수한 드라마이지만, 다른 게시물은 단순한 기술적 질문일 뿐입니다.

  • 비유하자면: 만약 여러분이 케이크를 더 "폭신하게" 만들고 싶다면, "케이크용 밀가루를 더 넣으면 되겠지!"라고 생각할 수도 있습니다. 하지만 그 밀가루 봉지 안에 케이크용 밀가루, 모래, 자갈이 섞여 있다면, 그 봉지를 더 추가한다고 해서 반드시 더 폭신한 케이크가 보장되지는 않습니다. 여러분은 그 봉지의 어느 부분이 진짜 좋은 밀가루인지 알아야 합니다.

4. 이것이 왜 중요한가

이 논문은 AI 모델을 만드는 사람들이 그들의 데이터 소스(예: "레딧" 또는 "뉴스")를 모두 동일한 종류의 스토리텔러로 취급해 왔다고 결론짓습니다. 하지만 그들은 그렇지 않습니다.

만로 AI가 주로 "뉴스"(사건은 많고 감정은 낮은 데이터)로 학습된다면, 사실을 보고하는 데는 능숙할지 몰라도 인간의 감정을 이해하는 데는 서툴 수 있습니다. 반대로 "레딧"(감정은 높고 구조는 낮은 데이터)으로 주로 학습된다면, 공감 능력은 좋아질 수 있지만 논리적인 인과관계에는 약할 수 있습니다.

핵টি 요점:
이 논문은 새로운 AI를 발명하거나 고장 난 것을 고친 것이 아닙니다. 대신, 인터넷의 이야기들을 측정할 수 있는 측정 테이프를 만들었습니다. 이 논문은 우리 데이터 속의 "이야기" 부분이 무질서하고, 다양하며, 불균형하게 분포되어 있다는 것을 보여주었습니다. 우리가 AI에게 더 나은 이야기를 들려주는 법을 가르치기 전에, 먼저 현재 혼합물 안에 정확히 어떤 종류의 이야기가 들어있는지 이해해야 합니다.

연구진은 누구나 사용할 수 있도록 그들의 측정 테이프(모델)와 지도(데이터셋)를 공개했습니다. 이를 통해 우리 모두가 미래에 더 나은 케이크를 구울 수 있게 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →