← 最新の論文
🤖 machine learning

Do Tabular Foundation Models Agree with Themselves?

本論文は、表形式基盤モデル(TFM)が、評価されたすべてのデータセットおよびタスクにおいて周辺化および因子分解の整合性要件の両方を満たしていないことから、忠実な結合分布を生成できていないことを明らかにしている。

原著者: Christian Klötergens, Vijaya Krishna Yalavarthi, Lars Schmidt-Thieme, Tom Hanika

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Christian Klötergens, Vijaya Krishna Yalavarthi, Lars Schmidt-Thieme, Tom Hanika

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ミステリーを解決しようとしている探偵だと想像してください。ただし、犯罪現場で手がかりを探すのではなく、巨大なスプレッドシートの中に手がかりを探しているのです。これが、**表形式基盤モデル(Tabular Foundation Models)**の世界です。これは、コンピュータがデータの行と列に基づいて物事を予測することを学ぶ、AIの最新かつ非常に注目されている分野です。例えば、ローンが返済されるかどうかや、住宅価格がいくらになるかなどを予測するようなものです。これらのモデルは、**ベイズ推論(Bayesian inference)**という巧妙なアイデアに基づいて構築されています。これは、簡単に言えば、「新しい証拠に基づいて、自分の信念を更新する」という方法です。天気予報士が、最初は雨についての一般的な予想を持っていますが、暗い雲が見えた瞬間に、「よし、これは間違いなく雨が降る」と予測を更新するようなものです。

長い間、科学者たちは、これらのAIモデルがデータに対する完璧な「天気予報士」であることを期待してきました。もしモデルに何かを予測させ、その予測を使って別のことを推測させた場合、その物語全体が完璧に整合しているはずだと彼らは信じていました。まるで、すべての章が論理的に次の章へとつながる、よく書かれた小説のように。しかし、ここに落とし穴があります。現実の世界では、正解を確認するための「真の答え」を知らないことがよくあります。それは、解答解説がない状態で学生のエッセイを採点しようとするようなものです。そこで、研究者たちは「このモデルは正しいか?」と問う代わりに、もっと単純で、かつ厄介な問いを投げかけました。「このモデルは、自分自身に対して一貫した物語を語っているだろうか?」と。彼らは、AIが単に見た目だけが良いランダムな数字を作り出しているのか、それとも実際に論理と確率の厳格なルールに従っているのかを知りたかったのです。

これからお話しする論文のタイトルは、**『Tabular Foundation Modelsは、自分自身と一致しているか?(Do Tabular Foundation Models Agree with Themselves?)』**です。クリスティアン・クレーターゲンス氏率いる研究チームは、表形式データ向けの最も人気のあるAIモデル(TabPFN、TabICL、TabFMなど)を、厳格な「論理テスト」にかけました。彼らは単に予測を求めたのではありません。モデルに同じ物語を二通りの方法で語らせ、その物語が一致するかどうかをチェックしたのです。

あなたが、謎のスムージーの味を当てようとしている場面を想像してみてください。

  • テスト1(周辺化の一貫性 / Marginalization Consistency): あなたはAIに「このスムージーは何味ですか?」と尋ねます。次に、「もしこのスムージーが赤色なら、何味ですか? そして、もし青色なら、何味ですか?」と尋ねます。最後に、そのスムージーが赤である確率と青である確率に基づいて、その二つの答えを混ぜ合わせます。もしAIが一貫していれば、この「混ぜ合わせた」答えは、最初の直接的な答えと全く同じになるはずです。
  • テスト2(分解の一貫性 / Factorization Consistency): あなたはAIに、スムージーの材料について二つの異なる順序で物語を語らせます。まず、フルーツの味を推測してから、甘味料を推測させます。次に、甘味料を推測してから、フルーツを推測させます。もしAIがデータを真に理解していれば、最終的なスムージーの姿は、どちらの材料を先に推測したとしても同一になるはずです。

研究者たちは、ワインの品質評価から車の価格、医療記録に至るまで、多種多様な実世界のデータセットを用いてこれらのテストを実施しました。彼らは、**全変動距離(Total Variation Distance)**という数学的な定規を使用して、答えがどれくらい離れているかを測定しました。スコアが0であればモデルは完全に一貫しており、スコアが高ければモデルは矛盾していることを意味します。

結果は衝撃的なものでした。テストされたすべてのモデルが、両方のテストに失敗しました。 すべてのデータセットにおいて、単純な「はい/いいえ」の質問(分類)であっても、数値を予測する質問(回帰)であっても、モデルはどのように質問したかによって異なる答えを出しました。まるで、直接聞かれたときはスムージーは「ストロベリー」だと言ったのに、色について先に聞かれた途端、色が同じであるにもかかわらず、突然「ブルーベリー」だと判断してしまうかのようです。

論文によると、一部のモデルは他のモデルよりも一貫した物語を語るのがわずかに得意であるものの(例えば、TabFMは最も一貫性のある分類器であり、TabPFNv3は回帰において一貫性に最も近い結果を示しました)、どのモデルも真の意味で一貫しているわけではありませんでした。 事実、これらの不一致は非常に広範囲に及んでおり、研究者たちは、これらのモデルはデータの単一の統合された「結合分布(joint distribution)」を表現していないと結論付けました。平たく言えば、これらのモデルは、本来模倣しているはずの確率の厳格な法則に従っていないのです。彼らは、質問の仕方によって異なる現実を「幻覚(ハルシネーション)」として作り出しているのです。

著者たちはまた、興味深い発見もしました。つまり、「優れた予測器」であること(正解を導き出す確率が高いこと)は、「一貫した予測器」であること(論理的に整合していること)を意味しないということです。あるモデルは、住宅価格を当てることには非常に正確かもしれませんが、推論の順序を変えて説明を求めたときに、自分自身と矛盾してしまう可能性があります。これは、一貫性が、現在のベンチマークが見逃している隠れた欠陥であることを示唆しています。

では、これは将来にとって何を意味するのでしょうか? この論文は、これらのモデルが無用であると言っているわけではありません。彼らは依然として多くのタスクにおいて、私たちが持つ最良のツールです。しかし、複雑な変数間の関係について知りたい場合、これらのモデルが論理的に一貫していることを盲信してはならない、という強い警告を発しています。研究者たちは、将来のモデルは、単に最終的な答えを出すことに集中するのではなく、こうした矛盾に対してペナルティを与えるように訓練するなど、「一貫性」を核となる機能として組み込む必要があると示唆しています。それまでは、これら強力なAI「探偵」たちは、手がかりを見つけることには長けているものの、誰に聞くかによって異なるバージョンの物語を語ることもあるのだということを、私たちは覚えておく必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →