← 最新の論文
🤖 machine learning

Online Conformal Prediction Beyond Feedback

本論文は、ラベルを戦略的にクエリすることで、展開された予測からの直接的なフィードバックなしに動作し、サブリニアな後悔(regret)と高い被覆保証を達成しつつクエリコストを最小化する、非独立同一分布(non-i.i.d.)データストリームにおける不確実性定量化のための新しいフレームワークである、Queriesを用いたオンライン・コンフォーマル予測(Online Conformal Prediction with Queries: OCPQ)を導入するものである。

原著者: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、暗くて霧の深い迷路をナビゲートする方法を教えようとしていると想像してみてください。あなたは、ロボットが前進するのに十分な自信を持ちつつも、壁にぶつからないように慎重であるようにしたいと考えています。人工知能の世界では、これは「不確実性の定量化(uncertainty quantification)」と呼ばれます。それは、ロボットが「あれは壁だとかなり確信している」と言うのか、「全くわからないけれど、とりあえず推測してみる」と言うのかの違いです。この慎重さを教えるための人気のある方法の一つが「共形予測(conformal prediction)」です。これは、単一の答え(例えば「あれは猫だ」)を出すのではなく、数学的にほとんどの場合で真実を含むことが保証された、可能性のある答えのセーフティネット(例えば「あれは猫か、犬か、あるいはキツネだ」)を提供する手法です。

通常、これに習熟するために、ロボットはフィードバックを受け取ります。ロボットが推測を行い、誰か(あるいはセンサー)が「その通りだ」あるいは「間違いだ」と教えてくれるのです。ロボットはこのフィードバックを利用して、次のラウンドに向けてセーフティネットを調整します。しかし、もしロボットが、自分の推測に対して決してフィードバックを得られない状況に置かれたらどうなるでしょうか? 例えば、ある人物が脅威であるかどうかを判断しなければならない警備員を想像してみてください。もし警備員が「脅威である」と推測したとしても、それは間違っている可能性がありますが、その人物に対して「あなたは本当に脅威でしたか?」と尋ねることはできません。なぜなら、それではセキュリティチェックの目的自体が台無しになってしまうからです。警備員は、判断を下してバックアップを要請することに決めた場合にのみ、「正解」を求めることができますが、毎回それを行うことはできません。これが、難しい「フィードバックを超えた(beyond feedback)」問題です。つまり、自分の間違いを確認できない状況で、どのようにして安全性を学ぶかという問題です。

この論文は、まさにこのパズルを解くための、OCPQ(Online Conformal Prediction with Queries)と呼ばれる巧妙な新しい手法を紹介しています。研究者たちは、この問題を、プレイヤーが毎ターン2つの選択肢を持つハイステークスなゲームとして扱っています。それは、「予測を行う(そしてフィードバックを一切得ない)」か、あるいは「クエリ(問い合わせ)を行い、正しい答えを確認する(ただし、そのターンでは予測を行わない)」かのどちらかです。これは、ビデオゲームにおいて、「ショットを打ってターゲットに当たることを祈る」か、「ゲームを一時停止してマップを見る」かのどちらかを選べるようなものです。ただし、両方を同時に行うことはできません。

チームは、ごくわずかな割合、具体的には全ラウンド数を TT としたとき、T1/3T^{1/3} ラウンドに一度だけ「一時停止してマップを見る(クエリ)」という選択をすることで、依然として驚くほど正確に学習できることを発見しました。彼らは、このわずかな「覗き見」によって、ユーザーが望む頻度(ユーザー定義の頻度 β\beta)で、真実がロボットのセーフティネットに含まれることが数学的に保証されることを証明しました。「コスト」として、この戦略ではセーフティネットが完璧なフィードバックがある場合よりもわずかに大きくなる可能性がありますが、その差はゲームが進むにつれて縮小していきます。

実験において、研究者たちは、手書き数字の画像や大規模言語モデルのテキストプロンプトを含む、現実世界のデータを用いてこの手法をテストしました。彼らは、データが予期せず変化した場合(例えば、晴れた日に訓練されたロボットが雨の中をナビゲートしようとする場合)や、データが意図的にトリッキーな場合(敵対的攻撃)であっても、OCPQがセーフティネットの信頼性を維持することを発見しました。彼らは、β\beta という単一のノブを調整することで、ユーザーが「安全性」と「精密さ」のどちらを優先するかを決定できることを示しました。これらの結果は、安全であるために常に自分の間違いを確認する必要はないことを示唆しています。時には、時折確認するだけで、世界があなたを欺こうとしている時でも、システム全体の誠実さを保つのに十分なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →