← 最新の論文
💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

本論文は、Snowflakeプラットフォーム上でのAIネイティブなSQLクエリ生成における大規模言語モデルの能力を評価するために設計された、125の現実世界のデータベースにわたる465の検証済みインスタンスからなる新しいベンチマークであるSpider 2.0-AIFuncを紹介し、トップクラスのプロプライエタリなモデルが67〜70%の精度を達成している一方で、従来のテキスト・トゥ・SQLタスクに最適化された現在のエージェントフレームワークはこの新たな設定には効果的に転用できないことを明らかにしている。

原著者: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、顧客のレビューから売上記録まで、あらゆるものを保管できる巨大でハイテクな図書館(クラウドデータベース)を所有しています。長年、この図書館について質問するには、SQLと呼ばれる非常に厳格でロボット的な言語を使う必要がありました。それはまるで、複雑な料理を注文するのに、数字と記号のコードだけで話さなければならないレストランのようなものでした。

最近、図書館のオーナーたち(Snowflakeなど)は、新しい機能であるAI関数(AI Functions)を追加しました。これは、注文システムに組み込まれた「スマート・アシスタント」のようなものです。今では、「赤いリンゴをすべて見せて」と頼む代わりに、「これらのリンゴのレビューを読んで、人々が喜んでいるか怒っているかを教えて」や、「これに似た内容のレビューを見つけて」と頼むことができます。これにより、データベースはAIネイティブなシステムへと進化しました。つまり、標準的なデータコマンドと、言語ベースのスマートな思考を一つの文章の中で組み合わせることができるようになったのです。

問題点:古い地図は通用しない

研究者たちは、これらの新しい「スマート・アシスタント」は強力である一方で、AIモデル(コンピュータの脳)を訓練し検証するために使われてきたテストが時代遅れであることに気づきました。古いテストは、コンピュータが厳格なロボット言語を話せるかどうかしかチェックしていませんでした。コンピュータが新しい「スマート・アシスタント」を使えるかどうかはチェックしていなかったのです。それは、現実の世界には交通量、歩行者、工事現場があるにもかかわらず、ドライバーを直線のみの空っぽの道路だけでテストしているようなものでした。

解決策:Spider 2.0-AIFunc

この問題を解決するために、チームはより手強い運転試験であるSpider 2.0-AIFuncを作成しました。

  1. 変革(The Transformation): 彼らは既存の513個の「運転テスト」(データに関する質問)を取り上げ、それらを書き換えました。彼らは、質問に対して新しい「スマート・アシスタント」の使用を強制するようにしました。
    • 古い質問: 「否定的なレビューをすべて表示して。」(人間が先に読む必要がある)
    • 新しい質問: 「AIアシスタントが『ネガティブ』であると判断したレビューをすべて表示して。」(データベース内でAIが読み取りを行う)
  2. 建設作業員(The Construction Crew): 彼らは、AIエージェント(デジタル作業員)のチームを使って、これらの質問を書き換えました。これらのエージェントは、エディターやメカニックのような役割を果たしました。
    • 指示が明確であるかを確認しました(例:「『ネガティブ』とは正確に何を意味するか?」)。
    • 「スマート・アシスタント」が仕事を遂行するために必要なすべての道具(パラメータ)を備えていることを確認しました。
    • 回答が安定しており、AIアシスタントの機嫌によって答えが変わることがないよう、テストを何度も繰り返し実行しました。
  3. 最終試験(The Final Exam): その結果、125種類の異なるデータベースにわたる465個の検証済み質問からなるベンチマークが完成しました。これには、感情によるレビューの分類や、テキストの類似検索、段落からの特定情報の抽出など、6種類の「スマート・アシスタント」タスクが含まれています。

結果:誰が合格したのか?

研究者たちは、10種類のAIモデル(「ドライバー」)をこの新しい試験にかけ、彼らがこれら複雑なAI搭載クエリをどれだけ書けるかをテストしました。

  • トップ・ドライバー(プロプライエタリ・モデル): 大手のクローズドソース・モデル(Claude OpusやGeminiなど)が最も優れた成績を収めました。彼らは約**67%から70%**の正解率を記録しました。彼らは、どの「スマート・アシスタント」を使い、どのように適切な質問を投げかけるかを理解することに長けていました。
  • オープンソース・ドライバー: 最も優れたオープンソース・モデル(Kimi K2.5など)は、約**58%**のスコアでした。彼らはまずまずの成績でしたが、ミスも多く見られました。
  • 格差: オープンソース・モデルが苦戦した主な理由は、基本的なコードを書けなかったことではありません。彼らは「スマート」な部分でつまずいたのです。
    • ルールの誤解: 誤ったテーブルやカラムを選択した。
    • 不適切な指示: AIアシスタントに探すべき対象を正確に伝えていなかった(例:分類タスクにおいて、起こりうるすべてのカテゴリをリストアップしていなかった)。
    • 論理エラー: 処理の順序を間違えた(例:AIに依頼するにデータをフィルタリングするのではなく、依頼したにフィルタリングしてしまう)。

驚きの発見:少ないことは、多いこと(Less is More)

研究者たちは、複雑な「エージェント・フレームワーク」(AIが手順を計画するのを助ける精巧なツールキット)を使用することが役立つかどうかについてもテストしました。

  • 発見: 驚くべきことに、最も複雑なツールキットはあまり役に立ちませんでした。実際には、最小限のセットアップ(データベースを見るための単純なツールと、クエリを実行するためのツールだけを持つ構成)が、派手なフレームワークと同等、あるいはそれ以上のパフォーマンスを発揮しました。
  • 比喩: それは、熟練のシェフに、巨大で複雑なスイスアーミーナイフではなく、小さくてシンプルなナイフを渡すようなものです。この特定の料理(AIネイティブSQL)において、熟練のシェフは余計な道具を必要としていませんでした。ただ、ナイフの使い方を知っていれば十分だったのです。従来のデータタスク向けに設計された複雑なフレームワークは、これら新しいスマートなタスクにおいては、邪魔になったり、価値を加えなかったりしました。

まとめ

この論文は、AIモデルが現代的な「AI搭載型」のデータベース機能を使いこなせるかをチェックする、新しい現実的なテストを紹介しています。調査の結果、最高のAIモデルはこれらに習熟しつつあるものの、トップティアのモデルとオープンソースのモデルとの間には依然として格差があることが分かりました。成功の鍵は、より複雑な計画ツールを使うことではなく、AI関数の基本的な指示とパラメータを正確に設定することにあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →