← 최신 논문
💬 NLP

Pretraining Language Models on Historical Text

이 논문은 데이터 품질, 시간적 누출, 그리고 역사적 언어 모델을 위한 평가 문제를 해결하기 위해, 1913년 이전의 영어 텍스트로만 학습된 7.24B 규모의 언어 모델인 TypewriterLM과 그와 관련된 54B 토큰 규모의 TypewriterCorpus, 어휘적으로 근거가 명확한 사후 학습 데이터셋, 그리고 History-Event 벤치마크를 소개한다.

원저자: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

게시일 2026-06-03
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 1912년에 살고 있는 사람처럼 정확하게 말하고 생각하도록 시간 여행자를 가르치려 한다고 상상해 보십시오. 만약 당신이 그에게 현대의 교과서를 주거나 인터넷을 검색하게 한다면, 그는 실수로 비행기, 인터넷, 그리고 아인슈타인의 상대성 이론에 대해 배우게 될 것입니다. 그러면 그는 자신 있게 당신에게 "컴퓨터"란 당신의 지하실에 있는 커다란 기계라고 말하겠지만, 1912년에는 "컴퓨터"가 손으로 수학 계산을 하는 '사람'을 의미했다는 사실은 깨닫지 못할 것입니다.

이것이 바로 이 논문의 저자들이 해결하고자 하는 문제입니다. 그들은 1913년 이후에 일어난 일에 대해서는 철저히 알지 못하도록 제한된 특별한 AI, 즉 TYPEWRITERLM을 구축했습니다.

이 과정을 쉬운 비유를 통해 설명하면 다음과 같습니다.

1. "타임캡슐" 도서관 (데이터)

이 AI를 훈련시키기 위해 연구진은 현대의 인터넷을 사용할 수 없었습니다. 대신 그들은 TYPEWRITERCORPUS라는 거대한 디지털 도서관을 구축했습니다.

  • 출처: 그들은 1700년부터 1913년 사이의 고서, 의회 기록, 과학 논문, 법정 기록에서 540억 개의 단어를 수집했습니다.
  • 정제 작업: 컴퓨터로 스캔한 오래된 책에는 종종 "Digitized by Google"이나 현대적인 페이지 번호와 같은 "글리치(오류)"가 나타납니다. 연구팀은 엄격한 사서처럼 행동하여, 도서관이 순수하게 역사적인 상태를 유지할 수 있도록 모든 현대적 흔적, URL, 또는 시대착오적인 메모를 깨끗이 제거했습니다.
  • 결과: 제1차 세계 대전 이전의 세상을 정확하게 나타내는 방대한 텍스트 더미가 완성되었습니다.

2. "엄격한 사서" 규칙 (지시어 튜닝)

보통 우리가 AI에게 지시를 따르는 법을 가르칠 때는 현대적인 예시를 사용하거나, 매우 똑똑한 현대 AI에게 정답을 쓰게 합니다. 하지만 그렇게 하면 "시대적 정확성"을 망치게 됩니다.

그래서 연구진은 **어휘적 근거를 둔 지시어 튜닝(Lexically Grounded Instruction Tuning)**이라는 새로운 방법을 발명했습니다.

  • 비유: 당신이 특정 오래된 책에 등장하는 단어들만 사용하여 질문에 답해야 하는 게임을 하고 있다고 상상해 보십시오. 당신은 새로운 단어를 만들어내거나 현대적인 속어를 사용할 수 없습니다.
  • 과정: 그들은 두 가지 새로운 데이터셋(HISTORY-LIMAHISTORY-SELFINSTRUCT)을 만들었습니다. AI가 질문을 받을 때마다, 그 답변은 1913년 시대의 문서 텍스트로부터 직접 구성됩니다. 만약 원본 텍스트에 "비행기(airplane)"라는 단어가 없다면, AI는 그 단어를 사용할 수 없습니다. 이는 AI가 자신의 답변에 현대적 지식을 실수로 "유출"하지 않도록 보장합니다.

3. "깜짝 테스트" (평가)

AI가 정말로 미래에 대해 모르는지 어떻게 알 수 있을까요? 그들은 "깜짝 테스트"인 HISTORY-EVENT로 이를 테스트했습니다.

  • 테스트: 그들은 AI에게 역사적 사건들에 대한 설명을 보여주었습니다.
    • 사건 A: 1850년 발생 (차단 시점 이전).
    • 사건 B: 1950년 발생 (차단 시점 이후).
  • 반응: 그들은 AI가 텍스트를 읽을 때 얼마나 "놀랐는지"를 측정했습니다.
    • AI(TYPEWRITERLM)가 1950년의 사건을 읽었을 때, 마치 한 번도 들어본 적 없는 것처럼 진심으로 혼란스러워하고 놀라워했습니다.
    • 반면, 일반적인 현대 AI(Llama 등)는 전혀 놀라지 않았습니다. 그들은 훈련 과정에서 해당 사실들을 읽었기 때문에 이미 알고 있었습니다.
  • 유출 확인: 그들은 또한 AI가 알아서는 안 될 사실을 혹시라도 알고 있는지 확인했습니다. 그 결과, AI가 과거의 상태를 유지하는 데 매우 뛰어났지만, 아주 미세한 양의 현대 정보(1% 미만)가 여전히 "유출"되었다는 것을 발견했습니다. 이는 타임머신을 완벽하게 밀봉하는 것이 얼마나 어려운지를 증명합니다.

4. 결과

  • 시간 여행자: 그 결과물인 TYPEWRITERLM은 1913년의 사람처럼 말하고 추론하는 72.4억 파라미터 규모의 모델입니다.
  • 비교: 일반적인 논리 퍼즐을 테스트했을 때, 이 모델은 현대적인 모델들보다 훨씬 적은 데이터로 훈련되었음에도 불구하고 다른 역사적 AI들과 대등한 성능을 보였습니다.
  • 교훈: 이 논문은 데이터에 매우 주의를 기울이고 질문에 답하는 법을 가르친다면, 미래에 대해 "눈이 먼" 똑똑한 AI를 구축할 수 있다는 것을 증명합니다.

요약하자면: 저자들은 디지털 타임머신을 만들었습니다. 그들은 오직 오래된 책들만을 입력했고, 그 책들에 담긴 단어들만을 사용하여 질문에 답하도록 가르쳤으며, 이 AI가 정말로 1913년 이후의 일들을 모른다는 것을 입증했습니다. 이를 통해 역사학자와 연구자들은 AI가 현대의 지식으로 "스포일러"를 하지 않는 상태에서 과거를 연구할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →