MARS: Multi-Specialist LLM Relay System for Competitive Programming
MARSは、トピックに特化したLLMをリレー方式で用いて競技プログラミングの解法を反復的に洗練させる、プロンプトのみの検索拡張型マルチエージェントフレームワークであり、既存の手法と比較してコストと分散を大幅に抑えつつ、CodeContestsにおいて0.624のパス率を達成しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
競技プログラミングという高レベルな世界において、計算機科学者や学生は、厳格な制限時間の中で複雑な論理パズルを解くという独特の課題に直面している。これらの問題は、単に動作するコードを書くだけでは済まない。最短経路の探索方法やデータの効率的な整理方法といった、特定の数学的戦略への深い理解を必要とするものである。長年、人工知能の研究者たちは、コンピュータにこれらのパズルを習得させる方法を模索してきた。彼らは、一つの強力なプログラムが問題全体を一気に解決しようとするシステムや、汎用的なデジタルアシスタントのチームが計画、コーディング、検証へと作業を分割して行うシステムを構築してきた。これらの手法は改善されてきたものの、汎用的なモデルでは見落としてしまうような、特定の深い洞察を必要とする場面では、しば々に躓いてしまう。核心的な困難は、大工が木を切る前に適切な鋸を選ぶ必要があるのと同様に、コンピュータプログラムが解決策の構築を開始する前に、どの数学的ツールを使うべきかを正確に知る必要があるという点にある。
新しい研究は、この問題を汎用的なモデルのためのタスクとしてではなく、専門家によるリレーレースとして扱う、異なるアプローチを紹介している。研究者たちは「MARS」と呼ばれるシステムを用いて、コンピュータが一つの脳にすべてを解決させるのではなく、専門家のチームとして機能するフレームワークを設計した。その代わりに、困難なプログラミング問題が現れた際、システムはまず、幾何学、グラフ理論、動的計画法といった特定の分野に特化したデジタル専門家のライブラリに照会を行う。システムは各専門家に対し、その問題が自身の専門領域に合致するかどうかを問いかける。これらの回答に基づき、システムは関連する2、3人のスペシャリストによる小規模でカスタムされたチームを編成し、課題に取り組ませる。この手法により、汎用モデルが偶然正しい戦略に辿り着くことを期待するのではなく、最初から適切な種類の知識が適用されることが保証される。
チームが結成されると、構造化された順序で作業が始まる。最初のスペシャリストが、標準的なプログラミング言語で解決策の初稿を作成する。このドラフトは、直ちに問題と共に提供されている一連の公開サンプルに対してテストされる。このテストの結果は同じスペシャリストにフィードバックされ、そのスペシャリストは、コードをそのままにするか、エラーを修正するか、あるいは次のスペシャリストにドラフトを渡すかを決定する。このプロセスは、各専門家がテストからの具体的なフィードバックに基づいて作業を洗練させていくことで繰り返される。もしスペシャリストがコードを改善できない場合、あるいは解決策が完成した場合、彼らは次の担当者に作業を引き継ぐ。システムには、チームが進展のないループに陥った場合にプロセスを停止させる安全メカニズムが含まれており、コンピュータが無駄な試行錯誤に時間を費やすことを防いでいる。最後に、提出前にコードが正しくフォーマットされているかを確認する。
この実験の結果は、165個の難易度の高いプログラミング問題のコレクションを用いて測定された。新しいシステムであるMARSは、単一のモデルや汎用的なアシスタントのチームに依存する従来の手法と比較して、有意に高い割合の問題を解決した。具体的には、専門家チームによるアプローチは約62パーセントの問題を解決し、これは標準的な単一モデルの手法が達成した48パーセントを大きく上回る数値である。研究者たちは、この向上が最も困難な問題において最も劇的であり、専門家チームはベースラインと比較して2倍以上の数のタスクを解決したことを発見した。CodeSIMとして知られる別の高度なシステムは依然として最高の成功率を達成しているものの、新手法ははるかに少ない計算時間とリソースを使用して、同等のパフォーマンスレベルに到達した。この研究は、人工知能をトピックに特化した専門家のチームとして組織し、互いにリアルタイムでチェックし合い、修正させることで、コンピュータは複雑な論理パズルを解く上でより効果的になれることを示唆している。
研究者たちはまた、このシステムが異なる基盤となるコンピュータの脳(モデル)やプログラミング言語に対してどの程度うまく機能するかについてもテストを行った。彼らは、この専門家チームのアプローチが様々なモデルにおいて一貫して他の手法を上回ったことを発見し、トピック特化型の専門家を用いる戦略が堅牢であることを証明した。しかし、このシステムは、テスト結果を得るためにコードを安全に隔離された環境で実行できる能力に依然として依存していることも指摘している。コードの即時的な結果を見る能力がなければ、スペシャリストは修正を行うためのフィードバックを得ることができない。研究は、最も困難な階層の問題についてはまだ改善の余地があるものの、汎用的なチームから、専門化された自己修正型のリレーへの移行は、機械に専門的な問題解決者として思考させるための有意義な一歩を象意していると結論づけている。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。