← 最新の論文
💬 NLP

Pretraining Language Models on Historical Text

本論文は、データの質、時間的リーク、および歴史的な言語モデルの評価における課題に対処するために、1913年以前の英語テキストのみで学習された7.24Bの言語モデルであるTypewriterLMと、それに付随する54BトークンのTypewriterCorpus、語彙に基づいた事後学習データセット、およびHistory-Eventベンチマークを紹介するものである。

原著者: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、1912年に生きていた人と同じように話し、考えさせようとしているタイムトラベラーに、その時代の教え方を教えているところだと想像してください。もしあなたが現代の教科書を与えたり、インターネットを閲覧させたりすれば、彼らは誤って、飛行機やインターネット、あるいはアインシュタインの相対性理論について学んでしまうでしょう。すると彼らは自信満々に、「コンピューター」とはあなたの家の地下室にある大きな機械のことだ、とあなたに告げるかもしれません。しかし、1912年において「コンピューター」とは、手計算を行う人間のことを指していたという事実に気づかないのです。

これが、この論文の著者たちが解決しようとしている問題です。彼らは、1913年以降に起きたことを一切知らないことが厳格に定められた、TYPEWRITERLMと呼ばれる特別なAIを構築しました。

その手法を、分かりやすい比喩を用いて説明します。

1. 「タイムカプセル」ライブラリ(データ)

このAIを訓練するために、研究者たちは現代のインターネットを使用することはできませんでした。代わりに、彼らはTYPEWRITERCORPUSと呼ばれる巨大なデジタル・ライブラリを構築しました。

  • 情報源: 彼らは、1700年から1913年までの古い書籍、議事録、科学論文、裁判の記録から、540億語を集めました。
  • クリーニング: コンピュータでスキャンされた古い書籍には、「Googleによるデジタル化」や現代のページ番号といった「グリッチ(不具合)」が含まれていることがよくあります。チームは厳格な司書のように振る舞い、歴史的な純粋さを保つために、あらゆる現代的な痕跡、URL、あるいは時代錯誤な注釈をすべて取り除きました。
  • 結果: 第一次世界大戦が始まる前の世界を正確に表す、膨大なテキストの集まりが完成しました。

2. 「厳格な司書」のルール(指示チューニング)

通常、AIに指示に従うよう教える際は、現代的な例を用いたり、非常に賢い現代のAIに回答を書かせたりします。しかし、それではタイムトラベラーの「時代考証の正確さ」を台無しにしてしまいます。

そこで、研究者たちは**語彙に基づいた指示チューニング(Lexically Grounded Instruction Tuning)**と呼ばれる新しい手法を考案しました。

  • 比喩: 特定の古い本の中に存在する言葉「のみ」を使って質問に答えなければならないゲームをしていると想像してください。新しい言葉を作ったり、現代のスラングを使ったりしてはいけません。
  • プロセス: 彼らは2つの新しいデータセット(HISTORY-LIMAおよびHISTORY-SELFINSTRUCT)を作成しました。AIが投げかけられるすべての質問に対し、その回答は1913年当時の文書から直接構成されます。もしソーステキストに「飛行機(airplane)」という言葉がなければ、AIはその言葉を使うことは許されません。これにより、AIが回答の中に現代の知識を誤って「漏洩」させることを防いでいます。

3. 「サプライズ・テスト」(評価)

AIが本当に未来を知らないことを、どうやって証明するのでしょうか? 彼らは「HISTORY-EVENT」と呼ばれる「サプライズ・テスト」を用いて検証を行いました。

  • テスト: 彼らはAIに、歴史的な出来事の記述を見せました。
    • 事象A: 1850年に発生(カットオフの前)。
    • 事象B: 1950年に発生(カットオフの後)。
  • 反応: AIがテキストを読んだ際の「驚き」の度合いを測定しました。
    • AI(TYPEWRITERLM)が1950年の出来事を読んだとき、それはまるで一度も聞いたことがないかのように、心底困惑し、驚いていました。
    • 対照的に、標準的な現代のAI(Llamaなど)は、全く驚きませんでした。学習過程でそれらの事実を読み込んでいたため、事実を知っていたのです。
  • 漏洩チェック: また、AIが知るべきではない事実を誤って知っていないかをチェックしました。その結果、AIは過去の状態を維持することに非常に長けていたものの、ごくわずかな(1%未満の)現代の情報が「漏洩」していることが判明しました。これは、タイムマシンを完全に密閉しておくことがいかに困難であるかを証明しています。

4. 結果

  • タイムトラベラー: 完成したAI(TYPEWRITERLM)は、72.4億パラメータを持つモデルであり、1913年の人物のように話し、思考します。
  • 比較: 一般的な論理パズルに関するテストにおいて、このモデルは、現代のモデルよりもはるかに少ないデータで訓練されているにもかかわらず、他の歴史的AIと同等の競争力を持つパフォーマンスを示しました。
  • 教訓: この論文は、データに対して極めて慎重であれば、未来に対して「盲目」であるスマートなAIを構築できることを証明しています。

要約すると: 著者たちはデジタル・タイムマシンを構築しました。彼らは古い本だけをAIに与え、それらの本の中にある言葉のみを使って質問に答えるよう教え、そのAIが本当に1913年以降のことを知らないことを証明しました。これにより、歴史家や研究者は、AIが現代の知識で「ネタバレ」をしてしまう心配をすることなく、過去の研究を行うことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →