KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant
KISS Sorcar は、5 層の階層構造、テストによる自己検証、git による隔離を採用した最小限の 1,850 行のエージェントフレームワークを基盤とした無料のオープンソース VS Code 拡張機能であり、Terminal Bench 2.0 で 62.2% の合格率达到を達成し、長期のソフトウェアエンジニアリングタスクにおいて Claude Code や Cursor Composer といった既存のツールを上回ります。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してください。ソルカー(Sorcar)という、非常に優秀で超知的なインターンがいます。このインターンはコードの作成、パズルの解決、コンピュータツールの活用において驚くほど才能に恵まれています。しかし、どんなインターンと同様に、いくつかの癖があります:すぐに疲れてしまう(「脳の容量」が尽きてしまう)、些細なミスをしてその日の全てを台無しにしてしまう、そして混乱のループに陥ってしまうことです。
この論文は、このインターンを管理し、崩壊することなく本格的なソフトウェアエンジニアリング作業を行えるように設計された「KISS Sorcar」というシステムを紹介しています。「KISS」という名前は「Keep It Simple, Stupid(シンプルに保て、バカ)」を意味し、これが中核となる哲学です:巨大で複雑なロボットの頭脳を構築する代わりに、非常にシンプルで階層化された管理システムを構築しました。
以下に、このシステムの仕組みを簡単な比喩を用いて説明します。
1. 5 層の管理チーム
すべてを一度に行おうとする巨大な頭脳一つではなく、このシステムはそれぞれが特定の役割を持つ 5 人の管理者のチームを使用します。指揮系統の鎖を伝ってバトンが渡されるリレー競争のように考えてください。
- 第 1 層:ランナー(KISS エージェント)
これは基本的な作業者です。そのルールはシンプルです。「考え、実行し、再び考える」。これは厳格な予算(財布のようなもの)を持っており、お金が尽きたり、ステップ数が尽きたりすると停止します。これが実際に AI モデルと対話するエンジンです。 - 第 2 層:メモ取り係(Relentless エージェント)
ランナーは短い記憶(小さなメモ帳)しか持っていません。一つのページに収まらないほどタスクが大きい場合、メモ取り係が介入します。ランナーがページを埋め尽くすと、メモ取り係はこれまでの出来事の詳しい要約を書き、ページをクリアにして、新しいセッションを開始します。これにより、インターンは冒頭を忘れることなく、何日もプロジェクトに取り組むことができます。 - 第 3 層:ツール使用者(Sorcar エージェント)
この層はインターンに工具箱を与えます。ファイルを開き、コマンドを入力し、インターネットを閲覧し、さらにはウェブブラウザを制御することもできます。これはシステムの「手」です。 - 第 4 層:会話パートナー(Chat Sorcar エージェント)
この層は会話を記憶します。今日インターンと話して、明日戻ってきた場合、この層はインターンが昨日何を話し合ったかを思い出させるため、最初からやり直す必要はありません。 - 第 5 層:安全ガード(Worktree Sorcar エージェント)
これが最も重要な安全機能です。インターンが絵を描いていると想像してください。この層は、元のキャンバスに直接描くのではなく、練習用の完全に同一の別コピー(「ワークツリー」)を与えます。- もし失敗しても、そのコピーを捨てれば済みます。元の絵は安全です。
- もしうまくいけば、その変更点だけを慎重に元のキャンバスにコピーできます。
- これにより、インターンが誤ってコードベース全体を壊すことを防ぎます。
2. 「厳格な教師」(システムプロンプト)
この論文は、AI モデル自体は賢いものの、プロフェッショナルなエンジニアのように振る舞うためには厳格なルールが必要だと主張しています。作成者たちは、厳格な教師のような役割を果たす巨大な「規則書」(システムプロンプト)を書きました。
単に「コードを書け」と言うのではなく、規則は次のように述べています。
- 「書く前に読む」: 最初にファイルを読まない限り、決してファイルを触ってはいけない。
- 「修正する前にテストする」: バグを見つけたら、それが壊れていることを証明するテストを書き、その後修正する。
- 「AI の無駄話禁止」: 中身のない無駄な文章は書かないこと。直接的かつ正確であること。
- 「自分の作業を確認する」: 「終わった」と言う前に、それが機能していることを証明するためにチェックリスト(リンター、テスト、型チェック)を実行しなければならない。
この論文は、AI に工程習慣に従ってゆっくりと行動させることで、多少時間がかかってもコードの品質が劇的に向上すると主張しています。
3. 結果:奇術か?
作成者たちは、複雑なコーディングパズルの連続のような難しいベンチマーク「Terminal Bench 2.0」で KISS Sorcar をテストしました。
- スコア: KISS Sorcar はタスクの 62.2% を解決しました。
- 競合: 同じ基盤となる AI モデルを使用しながら、他の有名な AI コーディングツール(58% の Claude Code や 61.7% の Cursor Composer 2)を打ち破りました。
この論文は、これが**「より賢い」モデルを持つことよりも、組織化と規律の方が重要である**ことを証明していると主張しています。シンプルでよく管理されたシステムは、より複雑なシステムを上回るパフォーマンスを発揮し得ます。
4. 「自己学習」機能
素晴らしい機能の一つとして、システムがあなたから学習することが挙げられます。もしインターンに「変数名に camelCase を使うのが嫌いだ」と伝えれば、システムはこれを特別なファイル(USER_PREFS.md)に記録します。次回助けを求めた際、インターンはこのルールを自動的に思い出します。まるでインターンが徐々にあなたの個人的なコーディングスタイルの完璧なクローンになっていくかのようです。
5. 大きな結論
この論文は、「専門家たちの黄金時代」に入っていると述べる大胆な観察で締めくくられています。
- あなたがこれらの高度な AI モデル(Claude Opus 4.6 のようなもの)と対話する方法を知っている専門家であれば、驚くべきものを構築できます。
- AI は非常に賢いため、人間が実際にはプロセスの「遅い部分」になっているかもしれません。
- 著者たちは、将来の人々が巨大なソフトウェア企業に依存するのをやめ、これらの AI アシスタントを使用して自分自身のカスタムソフトウェアツールを構築するようになるだろうと提案しています。
要約すると: KISS Sorcar は、強力な AI を厳格な一連のエンジニアリングルールと安全網で包み込んだ、シンプルでオープンソースのツールです。これは AI を魔法の杖として扱うのではなく、最善の成果を出すために良い管理者、清潔な作業スペース、そしてチェックリストを必要とする、高度に熟練した労働者として扱います。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。