← 最新の論文
📊 statistics

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

本研究は、マルチモーダルLLMは、信頼性の低いラベルに対する共通のバイアスがあるためにスクリーンショットのみから実際のA/Bテストの結果を確実に予測することはできないものの、予測を校正して不確実なケースを特定し回避することで意味のある精度を達成できることを示しており、この限界は、高い評価者間一致度にもかかわらず人間が偶然性を上回ることができない状況を反映している。

原著者: Tyler Dooskin, Squoosh Technical Staff

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Tyler Dooskin, Squoosh Technical Staff

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ある謎を解こうとしている探偵だと想像してください。「この2人の容疑者のうち、どちらが真犯人か?」という謎です。ウェブサイトの世界では、「容疑者」とは、わずかに異なる2つのバージョンのページのことです。そして「真犯人」とは、より多くの人に何かを購入させたり、登録させたりすることに成功した方のバージョンです。これはA/Bテストと呼ばれます。通常、勝者を特定するには、数日から数週間、実際の人間がサイトと対話するのを待って観察しなければなりません。しかし最近、新しい種類の探偵が登場しました。それが人工知能(AI)です。誰もが抱いている大きな疑問は、「AIは2つのウェブサイトの画像を見て、待ち時間をすべて省いて、瞬時にどちらが勝つかを教えてくれるのだろうか?」ということです。

この論文を理解するには、科学における「良さ」の測定方法について、いくつかのことを知っておく必要があります。まず、「運による正解」と「スキルによる正解」の違いです。コイン投げで「表」と予想した場合、運だけで50%の確率で当たります。もし、ある探偵が天才だと自称しているのに、的中率がわずか51%しかなければ、その人は本当に特別なことをしているとは言えません。科学者は、「コーエンのカッパ係数」(これを「スキル・スコア」と呼びましょう)という特別なスコアを使用して、運の要素を取り除き、その探偵に本当に知能があるのかどうかを見極めます。次に、「共通のバイアス」の問題があります。例えば、同じ町で育った教師と生徒を想像してみてください。彼らが意見を一致させるのは、生徒が賢いからではなく、二人とも親から同じ間違った知識を教わったからかもしれません。もしAIとテストデータを作成した人々が同じ「俗説」を学んでいたとしたら、彼らは答えを一致させることはできても、それはAIが未来を予測できることを意味しません。

この論文は、Squooshというチームによる、非常に正直で、非常に厳格な報告書です。彼らは、先ほどの大きな疑問に答えるために実験を行いました。彼らは単にAIに推測させたのではありません。科学者が料理のレシピを書く前に書き留めるように、事前にルールを確定させ、後からAIを良く見せるためにルールを変更できないようにしたのです。彼らは、AIが実際に勝者を予測できるかどうかを確認するために、現実世界のウェブサイトテストの膨大なライブラリを使用しました。

ここでひねりがあります。AIは、その本来の仕事において、ほとんど失敗に終わっているのです。チームがAIに対し、330件の実際のテストを見て、毎回勝者を予測するように求めたところ、AIはランダムな推測とほとんど変わらない結果しか出せませんでした。実際、AIは「信頼できない」テスト(結果が明確でないもの)に対して、より強く同意しているようでした。つまり、AIもテストデータを作成した人々も、何がウェブサイトを良くするかという古い神話を繰り返していただけであり、実際に何が起こるかを予測していたわけではなかったのです。よりスマートで高価なAIを使っても状況は変わりませんでした。それもまた、同様にダメだったのです。「スクリーンショットさえあれば、ウェブサイトの勝者を予測できる魔法の水晶玉」のようなものは存在しない、とこの論文は明確に否定しています。

しかし、この論文はAIが役に立たないと言っているわけではありません。AIは「正直な」探偵であると言っています。チームはある特別なトリックを発見しました。もしAIに、「絶対に確信がある時だけ推測し、そうでなければ『わからない』と言いなさい」と指示すれば、AIが発言する時には驚くほど優れた能力を発揮するというのです。AIの内部にある審判チームが、ある答えに対して強く同意した場合、信頼できるテストにおいて約31%の確率で正しい勝者を当てました。これは低く聞こえるかもしれませんが、覚えておいてください。何年も経験を積んだ人間の専門家であっても、平均して約29%しか的中させられないのです。AIは超天才ではありません。自分がいつ推測しており、いつそうでないのかを知っているツールなのです。

最も重要な発見は、信頼に関するものです。この論文は、一連のAIたちが互いに同意しているとしても、それは彼らが正しいことを意味するのではなく、しばしば全員が同じ「共通のバイアス」を繰り返しているだけであることを示しています。それは、全員が親戚同士である陪審員のようなものです。彼らは皆同じ投票をしますが、それは判決が正しいことを意味しません。この論文は、この「共通のバイアス」が人間にも起こることを証明しています。15人の実際の人間による専門家に勝者を予想させたところ、専門家たちは互いに強く同意しましたが、的中率はAIと同じくらい低いものでした。

では、最終的な教訓は何でしょうか? 論文は、100%の確実性を持ってウェブサイトの勝者を予測できるツールを構築することはできない、と結論づけています。代わりに、最適なツールは「較正されたスクリーニング・インストゥルメント(校正された選別器)」です。それは、「私はこれに自信があります」と言うか、「わかりません、私に聞かないでください」と言うか、自分の限界について正直であるシステムです。論文はまた、これを行うために超高価で巨大なAIは必要なく、「正直さ」のトリックを使えば、より小さく安価なバージョンでも十分に機能することを示しています。本当の価値は、毎回答えを得ることではなく、いつ答えを信じるべきではないかを正確に知ることにあります。論文は、自身のデータ、失敗した実験、そしてルールをすべて公開することで、時には「魔法のトリックはうまくいかない」と認めることこそが、最も重要な発見になることもあるのだと証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →