← 最新の論文
📄 chemistry

Evaluating the Impact of Tokenization Schemes on the Performance of Chemical Language Models

本研究は、3つのモデルスケールにわたる9種類のSMILESトークン化戦略の初の系統的な評価を提示しており、ルールベースのトークナイザーは生成の妥当性において優れている一方で、コーパスベースおよびハイブリッドのアプローチは下流の特性予測においてより優れた性能を示すことを明らかにし、最終的に汎用的な化学言語モデルにはハイブリッド戦略を推奨している。

原著者: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の研究所において、化学の言語は試験管やビーカーの中だけでなく、テキストの行の中にもますます書き込まれるようになっています。科学者たちは古くから、複雑な分子を単純な文字の列として表現するために、SMILESと呼ばれる略記法を使用してきました。それは、まるで文章が物語を記述するのと似ています。この形式により、もともとは人間の言語を読み取るために設計された強力なコンピュータプログラムが、化学構造を分析できるようになりました。化学言語モデルとして知られるこれらのプログラムは、新しい薬がどのように振る舞うかを予測したり、あるいは全く新しい分子をゼロから発明したりすることさえできます。しかし、コンピュータが化学的な文字列を理解するためには、まずその文字列をより小さく扱いやすい断片に分解しなければなりません。これはトークン化と呼ばれるプロセスです。読者が意味を理解するために文章を単語に区切るように、コンピュータは分子の構造を把握するために化学的な文字列をトークンへと分解します。研究者たちが直面している重要な問いは、この分解をどのように行うのが最善かということです。コンピュータは、何が化学的な構成要素であるかについての厳格で既定のルールに従うべきでしょうか、それとも何百万もの例を読み込むことで、自らパターンを見つけ出すことを学ぶべきでしょうか。

カイザースラウテルン=ランダウ大学とドイツ人工知能研究センターの研究チームは、包括的な研究を通じてこの問いに答えるべく着手しました。彼らはこの分野の歴史を調査し、200以上の研究論文をレビューして、科学者がコンピュータに化学的な文字列を読み取らせるためのさまざまな方法を特定しました。この膨大な調査から、彼らは9つの異なる手法を選び出し、それらを3つのグループに整理しました。すなわち、固定された化学ルールに依存するもの、完全にデータから学習するもの、そして両方のアプローチを組み合わせたものです。これらの手法を公平にテストするために、研究者たちは小規模なものから非常に大規模なものまで、さまざまなサイズのコンピュータモデルを構築し、約200万個の化学的文字列を含む同じ大規模なデータセットを用いてそれらを訓練しました。次に、彼らはこれらのモデルに対して2種類のテストを行いました。第一に、化学の基本的な文法をコンピュータがいかに学習したかの指標として、一部を隠した後の元の化学的文字列をどれだけ正確に再構成できるかを確認しました。第二に、彼らはモデルを実世界のタスクに投入し、薬がどれほど水に溶けやすいか、あるいは血液脳関門を通過する可能性がどの程度あるかといった、分子の特定の特性を予測させました。

結果は、新しい分子を生成する能力と、その特性を予測する能力との間に、明確かつ驚くすべきトレードオフがあることを明らかにしました。化学的な定義に厳格に従うルールベースのトークナイザーを用いて訓練されたモデルは、再構成において最も優れた性能を示しました。それらは隠された化学的文字列の断片を高い精度でつなぎ合わせることができ、最も重要な点として、生成された分子が化学的に妥当であり、物理的に可能であることを保証しました。このことは、新しい化合物を発明することを目的とするタスクにおいて、これらが優れた選択肢であることを示しています。なぜなら、これらは不可能または無意味な結果を生み出すことがほとんどないからです。しかし、研究者が分子の特性を予測するというタスクに目を向けると、話は変わりました。データ駆動型またはハイブリッド型のアプローチを用いたモデル、つまりコンピュータがデータ自体から柔軟なパターンを学習することを許容したモデルは、一貫して厳格なルールベースのモデルを上回りました。これらの柔軟なモデルは、厳格なルールが見逃してしまうような、化学的文字列内の微妙な関係性を認識することを学習し、それが現実世界における分子の挙動のより正確な予測につながりました。

また、この研究では、単にコンピュータモデルを大型化することが問題を解決するかどうかも探求されました。彼らは、計算能力の増大によって不適切なトークン化の問題を克服できるかどうかを確認するために、700万、5000万、1億5000万のパラメータを持つモデルをテストしました。その結果、モデルが大きくなるにつれて、一般的には性能が向上するものの、5000万から1億5000万のパラメータへと成長するにつれて、その利得は著しく減少することを発見しました。これは、化学データの分解方法が、単にコンピュータモデルの規模を大きくすることよりも重要である場合が多いことを示唆しています。適切に選ばれたトークン化戦略は、単に計算容量を追加することよりも優れた結果をもたらすことができます。最終的に、研究者たちは、あらゆる状況において単一の最善の方法は存在しないと結論付けました。もし目標が新しい分子を設計することであれば、ルールベースのアプローチが最も安全で効果的な道です。しかし、もし目標が分子がどのように作用するかを予測することであれば、化学的知識とデータ駆動型の柔軟性を組み合わせたハイブリッドなアプローチが最も強力な解決策を提供します。この研究は、コンピュータに化学をどのように教えるかという選択が、コンピュータそのものと同じくらい重要であることを示し、科学者に明確な指針を与えるものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →