← 最新の論文
🤖 machine learning

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

本論文では、品質の向上とトークンコストの比率に基づいて探索リソースを動的に割り当てることで、既存の手法と比較して大幅に削減された予算で、同等またはそれ以上の優れた結果を達成する、LLMの探索を最適化するコスト校正型適応制御器である**CostAda**を提案する。

原著者: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

極めて複雑なパズルを解こうと奮闘する、天才的な探偵チームを想像してみてください。彼らには「思考トークン」と呼ばれる、限られた供給量の「魔法の通貨」があります。このトークンは、彼らが書くすべての言葉、探すすべての手がかり、そして立てるすべての仮説に対して支払われる対価です。人工知能の世界において、これらのトークンは、新しい科学的公式の発見、より優れたアルゴリズムの設計、あるいは完璧なコンピュータコードの記述といった作業を行う際の、実際のコストとなります。長い間、これら探偵チームの「管理者(マネージャー)」が関心を寄せていたのは、ただ一つのことでした。「スコアが上がったかどうか」です。もし探偵が小さな手がかりを解いた場合でも、巨大な謎を解いた場合でも、どちらも同じスコアの上昇をもたらしたならば、管理者はそれらを全く同じものとして扱いました。しかし、ここに落とし穴がありました。小さな手がかりを解くには1トークンしかかからなかった一方で、巨大な謎を解くには6トークンが必要だったのです。もし管理者が、スコアが上がったという理由だけで、高価な動きに対して支払いを続けていたら、チームは最高の解決策を見つけ出すずっと前に、資金を使い果たしてしまったでしょう。科学者たちの大きな問いはこうです。「すべての動きに異なるコストがかかり、厳格な予算内に収まっていなければならないとき、どのようにチームを管理すればよいのか?」

本論文は、よりスマートな新しい管理者であるCostAdaを紹介します。研究者たちは、従来の管理手法——動きに実際にどれだけのコストがかかったかを無視すること——が、破滅へのレシピであることを発見しました。彼らは、コストの価格設定に基づいてクレジットを調整しなければ、探索が複雑になるにつれて進捗がほぼゼロになってしまうことを数学的に証明しました。CostAdaはゲームのルールを変えます。それは「コストパフォーマンス(投資に対する効果)」に着目します。CostAdaはこう問いかけます。「このスコアの向上は、今費やしたトークンに見合う価値があるのか?」もしある動きが高価であれば、CostAdaは次のステップを承認する前に、より大きな報酬を要求します。また、残りの予算も厳重に監視します。ゲームの序盤、資金が豊富なときは、新しい経路を見つけるために、少々高価なリスクを取ることも許容されます。しかし、予算が少なくなってくると、管理者は厳格になり、安価で確実な動きのみを承認するか、あるいは最後の大逆転となるガイドのために、最後の数トークンを温存するようにします。

チームはこの新しい管理者を、2つの異なるAIの脳(GLM-5とGPT-5.4)を用い、12種類の異なるパズルセット(ベンチマーク)でテストしました。その結果は目覚ましいものでした。16件のテストケースのうち12件において、CostAdaは従来最高の手法と同等の解決策を見つけ出しましたが、それを最大でも半分の予算で行いました。言い換えれば、以前と同じ高品質な結果を、50%のコストで達成したのです。8つの主要な課題すべてにおいて、CostAdaは一貫して最も高い平均最終品質を達成しました。研究者たちは、あらゆる行動のコストを、単に後で見返すためのレシートとしてではなく、意思決定プロセスにおける重要な要素として扱うことで、AIがより効率的に探索し、行き止まりに資金を浪費することを避け、より速く、より賢くゴールに到達できることを示しました。それは、時には高価な高速道路を利用することがガスの無駄遣いであると気づきつつ、「いつその料金を支払って先に目的地に着くべきか」を正確に知ることこそが、レースに勝つ鍵であると理解することに似ています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →