PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models
本論文は、多様なマルチテーブル・リレーショナルデータベースを合成するための軽量なフレームワークであるPLuRelを紹介しており、合成データのスケーリングが、リレーショナル・ファンデーションモデルに対して予測可能な性能向上と強力な汎化性能をもたらすことを初めて実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、超スマートなロボットに、ビジネスデータの乱雑で相互に連結した世界を理解させる方法を教えようとしているところだと想像してください。現実の世界では、企業はその秘密を巨大な「リレーショナル・データベース」の中に保管しています。これは、巨大な多室構造の図書館のようなものです。そこでは、すべての本(テーブル)は特定の糸(例えば、顧客のIDが名前と注文履歴を結びつけるようなもの)によって他の本とつながっています。ロボットがこの図書館を読み解く真の知能を持つためには、何百万もの異なる例を見せる必要があります。しかし、問題があります。現実の企業のデータはプライバシーによって守られています。それはプライバシー法や営業秘密という壁の向後に閉じ込められており、私たちはロボットに直接データを手渡すことはできません。
ここで「合成データ(synthetic data)」という概念が登場します。それは、本物のライブラリを一度も見ることなく、数学を用いて、本や糸がどのように見えるべきかを推測することで、ゼロから完璧な偽物のライブラリを構築するようなものです。科学者たちは、単一のテーブル(名前の単純なリストなど)についてはこれを行ってきましたが、複数の部屋がある偽のライブラリを作り、その部屋同士の接続が意味を成すようにすることは、非常に困難でした。もしロボットが、接続が壊れていたり奇妙だったりする偽のライブラリから学習してしまったら、後で現実の問題を解決することができなくなります。この論文は、まさにそのパズルに取り組んでいます。どうすれば、AIが現実のデータを見る前にゲームのルールを学べるよう、エンドレスで多様かつ完璧に接続された偽のデータベースを量産できる工場を構築できるのか?という問いです。
PLURELファクトリー:AIのための偽の世界を構築する
PLURELをご紹介しましょう。これは、マスター建築家であり、同時にクリエイティブな作家でもある役割を果たす新しいフレームワークです。その仕事は、合成リレーショナル・データベースをゼロから構築し、AIモデルが練習するための「偽の世界」を作り出すことです。PLURELの開発者たちは、これらのAIモデルに対して、ある秘密の力を解放できるのではないかと考えました。それは、「より多く、より多様な」例を見るだけで賢くなれるという能力、すなわち「スケーリング則(scaling laws)」と呼ばれる概念です。
AIのトレーニングを、ティーンエイジャーに運転を教えることに例えてみましょう。もし彼を一つの空き駐車場(単一の小さなデータベース)だけで練習させたとしたら、その特定の駐車場については上手くなるかもしれませんが、混雑した市街地(現実世界のデータベース)に出た瞬間に衝突してしまうでしょう。PLURELは、これによって何千もの異なる「ドライビングコース」を生成することでこの問題を解決します。狭い道があったり、ラウンドアバウトがあったり、交通量が多くあったり、霧がかかっていたりするコースです。それぞれのコースは、独自のテーブル(「ユーザー」、「アイテム」、「トランザクション」など)と、それらの間の複雑な接続網を持つ、ユニークなデータベースなのです。
PLURELがいかにしてこれらの「偽の世界」を構築するか
PLURELは単に既存のデータをコピー&ペーストするのではなく、3つのクリエイティブなステップを経て、すべてをゼロから構築します。
- 設計図(スキーマ): まず、図書館の地図を描きます。いくつの部屋(テーブル)があり、それらがどのように接続されるかを決定します。それは「有向グラフ(矢印付きの地図という専門用語)」を使用して、どの部屋がどの部屋につながるかを決定します。例えば、「ユーザー」の部屋は「注文」の部屋にはつながりますが、「出荷」の部屋には直接はつながらない、といった具合です。
- 糸(接続性): 次に、部屋同士を結びつける糸を織り込みます。現実のデータベースでは、特定の発注は特定のユーザーに属しています。PLURELは、どのユーザーがどの注文を受け取るかを決定するために、巧妙な「二部グラフ(2つのグループをマッチングさせる方法)」を使用します。単にランダムに選ぶのではなく、「階層的」なパターン、つまり家系図のようなものを使用して、接続が自然に感じられるようにします。例えば、「VIP」ユーザーはより多くの注文を受け取ったり、特定の地域の注文がクラスター化したりするように設定されます。
- コンテンツ(特徴量): 最後に、部屋の中にデータを充填します。システムは、セルの中に何が入るべきかを決定するために「構造的因果モデル(論理エンジンと考えてください)」を使用します。もしユーザーが冬用コートを購入した場合、システムは「日付」が冬であるべきであり、「価格」が高くなる可能性があることを理解します。さらに、「時間的パターン」も追加します。つまり、データは現実の世界と同じように、時間の経過とともに変化します(例:ブラックフライデーの期間中に売上が急増するなど)。
大きな発見:多様性 = より賢いAI
この論文の最もエキサイティングな部分は、Relational Transformer (RT) というモデルを、PLURELが生成したデータベースでトレーニングし始めた時に起こったことです。
研究者たちは2つのことをテストしました。
- サイズ: モデルがどれだけのデータを見たか?(総トークン数、またはデータの「単語」数)。
- 多様性: モデルがどれほど多くの「異なる」偽のデータベースを見たか?(ユニークな「世界」の数)。
彼らは、美しい予測可能なパターンを発見しました。トレーニングデータの多様性が高ければ高いほど、モデルはより賢くなるのです。
言語を学んでいる場面を想像してみてください。もしあなたが同じ本を1万ページ読んだとしたら、その本を完璧に暗記するかもしれませんが、知らない人と会話する方法は学べません。しかし、もし1万ページの内容が1,000冊の異なる本(異なるジャンル、異なる著者、異なるスタイル)に分散していたら、あなたは言語の「ルール」を学ぶことができます。PLURELは、よりユニークなデータベース(多様性の増加)をAIが見ることで、現実のデータに対する予測能力が滑らかで予測可能な曲線を描いて向上することを示しました。これは「パワーロー(冪乗則)」であり、改善がランダムではなく、一定の数学的な規則に従っていることを意味します。
現実の世界でも通用するか?
究極のテストは、「この偽のトレーニングは現実の問題に役立つか?」でした。
研究者たちは、PLUREлоの膨大な偽のデータでトレーニングされたAIを取り出し、現実世界のデータ(RelBenchと呼ばれるベンチマークから取得)を用いて、短い「仕上げの学校(ファニッシング・スクール)」を与えました。結果は目覚ましいものでした。
- ハイブリッド・アプローチの勝利: PLURELの偽のデータで学習し、その後に現実のデータで微調整(ファインチューニング)を行ったAIは、現実のデータのみで学習したAIよりも大幅に優れたパフォーマンスを示しました。
- 獲得した成果: 平均して、この「合成 + 現実」のアプローチは、分類タスク(ユーザーが離脱するかどうかを推測するなど)において1.2%、回帰タスク(売上数などを予測するなど)において3.0%、精度を向上させました。
- 最高値: 特定のタスクでは、その向上は非常に大きく、ユーザーエンゲージメントの予測において最大7.4%、顧客生涯価値(LTV)の予測において最大**5.2%**向上しました。
しかし、論文は、合成データだけでは魔法の杖ではないことも注意深く述べています。もし現実のデータを一度も見ることなく、偽のデータのみを使用しようとした場合、モデルは苦戦しました。偽のデータは一般的なルールを学ぶのには適していますが、現実世界の特有の癖に合わせるためには、現実のデータが必要です。
これが意味すること
PLURELは、AIをより良くするために、企業が秘密のプライベートデータを共有してくれるのを待つ必要はないということを示唆しています。代わりに、合成データを使用して、独自の「トレーニングジム」を構築することができるのです。数学的に妥当で多様な偽のデータベースを生成することで、AIモデルにデータの根本的な接続ルールを教えることができます。これにより、モデルは「汎化(generalize)」できるようになります。つまり、偽の世界で学んだことを、複雑で混沌とした現実の世界にうまく適用できるようになるのです。
この論文は、これが有望な新しい道であることを結論づけています。それは単に「より多くのデータ」を作ることではなく、「より良く、より多様なデータ」を作ることについてです。トレーニングデータの多様性を拡大する能力を解き放つことで、PLURELは、現実世界のプライバシーを安全に保ちながら、将来の複雑で相互に連結したデータ課題に取り組む準備ができている「リレーショナル・ファンデーション・モデル」の構築を支援するのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。