Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
本研究は、Byte-Pair Encoding (BPE) と Unigram-LM が、化学構造式(SMILES)に対して根本的に異なり、かつほぼ互いに排他的なサブワード語彙を生成することを示しており、トークナイゼーション・アルゴリズムの選択が中立的なデフォルト設定ではなく、極めて重要なモデリング上の決定であることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
大きな問い:コンピュータに化学式を読ませるにはどうすればよいのか?
あなたが、コンピュータに化学の言語を理解させようとしていると想像してみてください。化学者は、SMILES(CC(=O)Oc1ccccc1 のような文字と記号の羅列)と呼ばれるコードを使って分子を記述します。
コンピュータが何かを学習する前に、**トークナイザー(tokenizer)**が必要です。トークナイザーとは、長い文章を、コンピュータが理解できる小さな、扱いやすい塊(単語やサブ単語)に分解する「翻訳者」のようなものだと考えてください。
長年、化学の分野では、自然言語処理(コンピュータが英語を読む方法など)から**BPE(Byte-Pair Encoding)**という手法を盲目的にコピーしてきました。この論文の研究者たちは、次のような単純な問いを投げかけました。「これは化学式を切り分けるための最善の方法なのだろうか? それとも、もっと良い方法があるのだろうか?」
彼らは、標準的な手法であるBBPEと、Unigram-LMと呼ばれる異なる手法を比較しました。
実験:2種類の異なるハサミ
色とりどりのビーズで作られた、長く複雑なネックレス(化学式)があると想像してください。あなたは、このネックレスを研究するために、小さなパーツに切り分ける必要があります。あなたには2種類の異なるハサミがあります。
- 強欲なハサミ(BPE): このハサミは、ネックレス全体の集まりの中で、隣り合わせに最も頻繁に現れる2つのビーズを探し出します。そして、その2つを1つの「スーパービーズ」として結合させ、このプロセスを繰り返します。これらは攻撃的で強欲であり、頻出するパターンから大きな塊を作ろうとします。
- 確率的なハサミ(Unigram-LM): このハサミは、大量の小さなビーズの山からスタートし、「もしこの特定のビーズを取り除いたら、全体のイメージにどれほど影響が出るか?」と問いかけます。彼らは、本質的ではない部分を慎重に削ぎ落とし、より粒度の細かい、詳細な視点を維持します。
驚きの発見:両者は一致しない
研究者たちは、化学式は非常に厳格なルール(原子は特定の 방식으로結合しなければならない)を持っているため、両方のハサミは結局のところ、ほぼ同じ場所でネックレスを切り分けることになるだろうと考えていました。化学のルールによって、2つの手法は収束するはずだと予想したのです。
しかし、彼らは間違っていました。
全く同じ化学データ、全く同じ開始ルール、そして全く同じ語彙サイズ(ボキャブラリーサイズ)を使用した場合でも、これら2つの手法は全く異なる「単語」のセットを生み出したのです。
- 重なりは極めて小さい: BPEによって作成された「スーパービーズ」のリストと、Unigram-LMによって作成されたリストを比較すると、共通点はほとんどありませんでした。最悪の場合、それらが共有するパーツは16%未満でした。最も重要な高頻度のパーツに絞った場合でも、共有するのは5%未満でした。
- 「切り込み」の深さ: 2つの手法は、どこで「カット」するか(分子の骨格)については一致していましたが、どの程度「深く」切るかについては意見が分かれました。
- BPEは、より**粗い(coarser)**カットを行う傾向がありました。原子の環(リング)全体を一つの大きなトークンとして結合させてしまいます。
- Unigram-LMは、より**細かい(finer)**カットを行いました。環を、原子に近い小さなパーツへと分解したままにしました。
- 結果: Unigram-LMは、同じ分子を記述するために、BPEよりも29%から41%多いトークン(パーツ)を使用することになりました。
視覚的な比喩:地図 vs 街路ビュー
あなたが街の地図を見ていると想像してください。
- BPEは、近隣地域を一つのブロックとしてグループ化する地図のようなものです。「このエリア全体が『ダウンタウン』である」と言います。効率的であり、より少ない言葉を使います。
- Unigram-LMは、すべての建物や街角をリストアップするストリートビューのようなものです。「ここにパン屋があり、ここに公園があり、ここに家がある」と言います。より多くの言葉を使いますが、より詳細な内訳を提供します。
論文では、これら2つの地図は互換性がないことが示されました。一方から他方へ切り替えると、コンピュータはデータの根本的に異なる構造を見ることになります。
平易な言葉による主要な知見
- それはデフォルト設定ではなく、設計上の選択である: この分野では、自然言語モデルが使用しているため、デフォルトとしてBPEが使われてきました。この論文は、化学においては、その選択を単にコピー&ペーストすることはできないことを証明しています。2つの手法は異なる結果をもたらすため、どちらの「ハサミ」を使うかを能動的に決定しなければなりません。
- その相違は安定している: この不一致は、偶然起きたものではありません。これは、さまざまな種類の化学物質(一般的な薬物、希少な天然物、多様な分子)において、また複雑な原子の扱い方に関するルールを変更した場合でも発生しました。
- 規模(スケール)では解決しない: 通常、より多くのデータを与えたり、語彙を大きくしたりすれば、事態は平準化されることがあります。研究者たちは、語彙を8倍にすることでこれをテストしましたが、2つの手法は依然として一致しませんでした。彼らは依然として別個のままでした。
- 「入れ子(ネスト)」効果: 異なる言葉を使っているとはいえ、彼らは互いに衝突することはありません。Unigram-LMのカットは、ほとんどの場合、BPEのカットの「内部」に位置しています。それは、BPEが「ピザを丸ごと切りなさい」と言い、Unigram-LMが「ピザを切り、さらにそのスライスも切りなさい」と言うようなものです。これらは互換性がありますが、詳細度のレベルが異なります。
これが読者に意味すること
論文は、**「どのアルゴリズムを選択するかは、主要なモデリング上の決定事項である」**と結論付けています。
- もしBPEを選べば、シーケンスは短くなり(トークン数が少なくなる)、コンピュータの処理コストは下がりますが、分子の構造に関する粒度の高い詳細を失うことになります。
- もしUnigram-LMを選べば、分子のより詳細で微細な視点が得られますが、より多くのトークンを処理する必要があります。
著者らは、どちらの手法が化学反応や薬物の特性を予測する上でコンピュータをより賢くするかどうかについては、まだテストしていません。彼らはただ、2つの手法が**「異なる言語」を作成する**ということを証明したのです。したがって、化学コミュニティはこれらが同じものであると仮定することはできず、自らの「ハサミ」を慎重に選ばなければなりません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。