FLEXITOKENS: Flexible Tokenization for Evolving Language Models
本論文は、固定されたトークナイザーの硬直性を克服するために学習可能な境界予測器と簡素化された訓練目的を採用するバイトレベル言語モデル向けの柔軟なトークナイズ手法であるFLEXITOKENSを導入し、これにより過剰な断片化を軽減し、多様な言語およびタスクにおいて最大10%の性能向上を実現する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに世界を読み、理解することを教えると想像してください。そのためには、ロボットは文を「トークン」と呼ばれる、より小さく管理しやすい断片に分解する必要があります。トークンは、壁を構築する建設業者が使用するレンガのようなものです。
長らく、ロボットは非常に硬直したセットのレンガを使用してきました。これらのレンガは、固定された規則書に基づいて(「un-」「do」「able」のような)特定の形状に事前に切断されていました。これは、ロボットが元々訓練された言語やトピックには非常にうまく機能します。しかし、ロボットが医療誌、コーディングマニュアル、あるいはこれまで見たことのない言語など、新しい何かを読み始めると、この硬直した規則書は問題を引き起こします。
問題:「万能型」のレンガ
この論文はこの問題を過剰な断片化と呼んでいます。
あなたが長い連続したテキストのリボンをレンガにして壁を作ろうと想像してください。もしあなたの規則書が「ハイフンを見るたびにリボンを切断せよ」と言っているなら、あなたは「hypertrophic」(医学用語)のような単一の単語を、「hyper」「tro」「phic」といった小さくて役に立たない破片に切り刻んでしまうかもしれません。
- 結果: ロボットは壁を構築するために、あまりにも多くの小さなレンガを運ぶ必要があります。これにより、建設は遅くなり、(計算能力の面で)高価になり、混乱を招きます。ロボットは、小さく壊れた部品を忙しく見つめているため、単語全体の意味を見失ってしまいます。
- 従来の方法: 従来の手法(BPE など)は、ロボットが建設を始める前にすべてのレンガを事前に切断する工場のようなものです。一度レンガが切断されると、後でロボットが異なる種類の家を建てようとしても、それらを変更することはできません。
解決策:FLEXITOKENS
この論文の著者であるFLEXITOKENSは、より賢い方法を提案しています。事前に切断されたレンガを使用する代わりに、彼らはロボットに、建設中にリボンを切断する方法を学習する、賢く柔軟なカッターを与えます。
彼らがどのように行ったか、簡単な比喩を使って説明します。
古い規則(「固定圧縮」の罠):
ロボットにレンガを自分で切断させる以前の試みは、厳格な規則を使用していました。「テキスト 10 インチあたり、正確に 3 つのレンガになるようにリボンを切断せよ」というものです。- 欠点: 単語が自然に長い言語(トルコ語など)の場合、3 つのレンガという規則を強制すると、単一の単語が意味のない小さな破片に切り刻まれてしまう可能性があります。逆に、単語が短い言語(中国語など)の場合、同じ規則が異なる 2 つの単語を 1 つの混乱した塊に接着してしまうかもしれません。この規則は、テキストの特定の「形状」に適応するにはあまりにも硬直していました。
新しい規則(FLEXITOKENS):
FLEXITOKENS は、規則を柔軟な範囲に変更します。「正確に 3 つのレンガを持て」と言う代わりに、「この特定の文にとって意味があるものに応じて、2 つから 4 つのレンガのいずれかを持て」と言います。- 「ヒンジ」損失: この論文は、安全域のように機能する特別なトレーニング手法(「ヒンジのような損失」)を導入しています。ロボットがテキストを安全な範囲内の数に切断した場合、ロボットは「合格」を得て、罰則はありません。これにより、ロボットは柔軟になれます。長い医学用語を、意味のある大きなレンガ 1 つに切断することも、短い文を、意味を理解するのに最も役立つように多くの小さなレンガに切断することもできます。
試した結果はどうだったか?
研究者たちは、この新しい柔軟なカッターを、英語、スペイン語、ロシア語、ヒンディー語、テルグ語など、多くの異なる言語と、医療やコーディングなど、異なるトピックでテストしました。
- 混乱の減少: ロボットは、不必要に単語を切り刻むのをやめました。例えば、医療テキストでは、「hypertrophic」をゴミのような破片に分解するのではなく、単一のまとまった単位として維持することを学びました。
- 高速化と賢明化: ロボットは、あまりにも多くの小さく壊れたレンガを運ぶ必要がなくなったため、情報をより高速に処理し、コンピューターのメモリをより少なく使用しました。
- パフォーマンスの向上: 翻訳や文の理解などのタスクにおいて、柔軟なカッターを持つロボットは、古い硬直した方法を使用するロボットよりも優れたパフォーマンスを発揮しました。さらに、ウルドゥー語のようにこれまで見たことのない言語であっても、小さく混乱した断片に分解することなく、はるかにうまく処理しました。
結論
FLEXITOKENSを、事前に切断されたプラスチック製のおもちゃのレンガセットを使用するロボットから、その瞬間に何を構築しているかに応じて、完璧なサイズと形状のレンガを印刷できる賢い 3D プリンターを使用するロボットへのアップグレードだと考えてください。
固定された規則を強制するのではなく、文脈に基づいて単語をどのように分解するかをロボットに決定させることで、この論文は、言語モデルがより効率的になり、新しい言語をよりよく処理し、「過剰に切断された」テキストによって混乱することなく、医療のような複雑なトピックを理解できることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。