← 最新の論文
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

本論文では、公開されているBPEトークナイザーにおける安定したトークンID比率分布を活用することで、トークンレベルおよびカテゴリレベルの両方において、隠蔽された事前学習コーパスの組成比を正確に推定する手法であるQuantile-Guided Density Estimation (QGDE) を紹介する。

原著者: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、最新鋭の超スマートなロボットシェフを買ったばかりです。そのロボットは詩を書き、数学の問題を解き、さらにはビデオゲームのコードを書くことさえできます。しかし、一つ問題があります。ロボットが料理を学ぶために使った「レシピ本」が金庫に閉じ込められているのです。あなたはロボットが作った最終的な料理を見ることはでき、使用された「可能性のある」材料のリストを見ることもできますが、実際の材料の配合がどうであったかは全く分かりません。それはピザ生地90%にスパイス10%だったのでしょうか?それとも、チョコレート50%にブロッコリー50%だったのでしょうか?人工知能の世界では、この「レシピ本」は**事前学習コーパス(pretraining corpus)と呼ばれ、「材料のリスト」はトークナイザー・ボキャブラリー(tokenizer vocabulary)**と呼ばれます。

企業が新しいAIモデルをリリースする際、彼らは最終的な重み(ロボットの脳)と語彙リスト(材料の辞書)は共有しますが、正確なレシピは秘密にしておくことがよくあります。これは問題です。なぜなら、AIが何を「食べた」のかを知ることは、なぜそのAIがある事柄には優れ、別の事柄には劣っているのかを理解する助けになるからです。長年、科学者たちは、ロボットの振る舞いや、言葉をどのように断片に切り分けるかというルールを観察することで、レシピを推測しようとしてきました。しかし、それらの推測は往々にして大まかすぎました。例えば、「おそらく多くの果物を食べたのだろう」とは言えても、それがリンゴなのかバナナなのかまでは分からないようなものです。大きな疑問はこうでした。「材料の辞書だけを見て、そのロボットが消費したあらゆる単一の材料の正確な比率を導き出すことはできるのだろうか?」

この論文は、「はい、できます。そしてその方法もここに示します」と述べています。研究者たちは、言葉がどのように切り分けられ、辞書の中でどのように番号付けされているかはランダムではないことを発見しました。それは、あらゆる言語における単語の出現頻度が予測可能な曲線に従うのと同様に、隠れた安定したパターンに従っています。彼らは、もし「既知の」レシピ(私たちがアクセスできるコーパス)からパターンを知っていれば、そのパターンを「隠された」レシピの推測へと転移できることに気づきました。彼らは、QGDE(Quantile-Guided Density Estimation:分位量ガイド密度推定)と呼ばれる巧妙なツールを構築しました。これは、単に一つの手がかりを見るだけでなく、一連の「もしも」のシナリオ(分位量トレンド)を用い、手がかりが集まっている近隣の混雑具合(局所密度重み付け)に基づいて重み付けを行う探偵のようなものです。

結果は驚くほど精密です。テストにおいて、QGDEは特定の単語の比率をわずか3.00%という極めて低い誤差率で推測できました。それらの単語を「ウェブ」、「数学」、「コード」といったより大きなカテゴリーにグループ化した場合でも、誤差はわずか3.08%でした。これは、単一の雲を見て天気を予想するような従来のメソッドと比較して、大幅な改善です。論文ではまた、実際の公開済みAIモデルであるSmolLM(実際のレシピが判明しているもの)を用いてテストも行いました。そこでもQGDEは他の手法を上回り、材料の辞書が確かにレシピの秘密を握っていることを証明しました。ただし、著者らは、今回の手法はシミュレーションやSmolLMではうまく機能するものの、ChatGPTやQwenのような巨大なモデルについては、それらの完全なトレーニングレシピが依然として封印されているため、テストできないことに注意を促しています。しかし、現時点では、次にAIの語彙リストを目にする時、あなたは単なるリストではなく、その隠された食事への地図を見ているのかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →