Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems
本論文は、現代のAIシステムにおいてウクライナ語やその他のキリル文字言語が英語と比較して直面している著しいトークン化のオーバーヘッドを定量化し、この格差が学習データの割り当てに起因することを示すとともに、推論時の圧縮技術やバランスの取れたバイトレベルBPEトークナイザーの学習を通じて、それが効果的に軽減できることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが文章を読み取る際、人間のように単語として認識しているわけではありません。その代わりに、テキストを「トークン」と呼ばれる小さな塊に分解します。これが、機械が意味を理解し、コストを計算するために使用する基本単位です。英語のようなラテン文字で書かれた言語の場合、文字自体がコンピュータのメモリ内で占めるスペースが非常に小さいため、これらの塊は効率的であることが多いです。しかし、ウクライナ語のようなキリル文字で書かれた言語では状況が異なります。これらのスクリプトで使用される文字は、デジタル上の保存スペースをより多く必要とします。そして、人工知能の学習に使用されるデータの大部分が英語であるため、コンピュータは英語のテキストを非常に効率的に扱うことを学習した一方で、キリル文字の処理には苦戦しています。これは「隠れた税金」を生み出しています。つまり、同じ量の情報を処理するために、コンピュータは英語よりも倍近い数の破片にウクライナ語の文章を分解しなければならない場合があり、そのプロセスをより遅く、より高価なものにしているのです。
独立研究者であるイヴァン・ドブロヴォルスキーによる最近の研究は、この格差を調査しており、特にウクライナ語に焦点を当てつつも、多くの他のキリル文字を使用する言語にも適用できる結論を導き出しています。この研究は、単純ながらも極めて重要な問いを投げかけています。それは、「なぜコンピュータはこれらの言語に対してこれほど苦戦するのか、そして技術の完全な刷新を待たずにこれを修正することはできるのか?」という問いです。研究によれば、問題は文字の形状や占有するスペースにあるのではなく、コンピュータがそれらをどのように「読み取るよう教えられたか」にあるといいます。現代の様々なシステムがどのようにテキストを分解しているかを分析することで、研究者は、この不均衡が学習データそのものに起因していることを発見しました。コンピュータはウクライナ語よりもはるかに多くの英語のテキストを見てきたため、ウクライナ語のためのショートカット(近道)をより少なく学習してしまったのです。
問題の規模を測定するために、研究者は主要なテクノロジー企業が使用している9つの異なる商用システムをテストしました。これらのシステムに数百万語のウクライナ語のテキストを入力し、それぞれのシステムが作成した「破片」の数を、英語のテキストに対して作成された破片の数と比較しました。その結果、大きな隔たりがあることが示されました。最も最新のシステムでは、ウキナ語のテキストは英語のテキストよりも68パーセントから121パーセント多くの破片を必要としました。古いシステムでは、その差はさらに大きく、220パーセントも多くの破片が必要となりました。これは、英語のテキストを処理するために費やされる1ドルにつき、ユーザーはウクライナ語のテキストを処理する際に、コンピュータが単語を分解するために多くの作業を必要とするという理由だけで、実質的にその倍近い金額を支払う可能性があることを意味します。
また、研究では、ラテン文字への移行(ローマ字化として知られるプロセス)が問題を解決するかどうかについても調査しました。ウクライナ語をラテン文字で書けば、コンピュータにとってより安価で高速になると提案する人々もいます。しかし、研究の結果、現代のシステムにおいてはむしろ逆であることが判明しました。これらのシステムは、ウクライナのウェブ上にある固有のキリル文字を扱う効率的な方法をすでに学習しているため、テキストをラテン文字に強制すると、コンピュータを混乱させてしまうのです。これにより、テキストがさらに多くの破片に分解され、一部のシステムではコストが最大19パーセント上昇しました。コンピュータは、その学習データの中で最も頻繁に目にしたスクリプトで最もよく機能します。そして、ウクライナ語にとってそれは、固有のキリル文字なのです。
問題が根本的な部分で解決できるかどうかを理解するために、研究者は英語とウクライナ語を平等に扱うように設計された新しいカスタムシステムを作成しました。この新しいシステムは、英語が圧倒的に多い広大なインターネットから学習するのではなく、英語とウクライナ語を完全にバランスさせた混合データを用いて学習させました。結果は驚くべきものでした。このバランスの取れたシステムを使用した際、効率性の格差は劇的に縮小しました。ウクライナ語のテキストはもはや2倍の破片を必要としなくなり、代わりに英語よりもわずか30パーセント多い破片で済むようになりました。これは、高いコストが文字自体の避けられない物理的限界ではなく、コンピュータがどのように学習したかの結果であることを証明しています。学習データがバランスの取れたものであれば、コンピュータは両方の言語に対して効率的に機能することを学習できるのです。
研究ではさらに、コンピュータの学習内容を変更せずにコストを削減する方法についても探求しました。テキストから不要な単語をインテリジェントに削除する手法を用いることで、研究者たちはウクライナ語のテキスト量をほぼ半分に減らすことに成功しました。決定的なのは、この圧縮を行っても、数千の実際の製品や顧客の質問を含むテストにおいて、コンピュータが正しい答えを見つける能力を損なわなかったことです。システムは、圧縮されていないフルテキストを用いた場合と同様に、正確に価格、評価、詳細を検索できました。これは、学習の不均衡が根深い問題である一方で、テクノロジーが追いつくのを待つ間にも、コストを下げるための実用的な方法が存在することを示唆しています。
結局のところ、この研究は、キリル文字の言語における非効率性は、スクリプト自体の固有の欠陥ではなく、データの割り当てによる解決可能な問題であることを明らかにしています。コンピュータが壊れているのではなく、単に最も多く見たデータに対して偏っているだけなのです。学習データにこれらの過小評価されている言語をより多く含めるように調整するか、あるいはスマートな圧縮ツールを使用することで、コストと速度におけるデジタル格差を縮めることができます。これらの知見は、人工知能をより公平なものにし、これらの強力なツールの恩益が、最も一般的なスクリプトで書く人々に限定されないようにするための、明確な道筋を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。