← 最新の論文
💻 computer science

In-IDE Toolkit for Developers of AI-Based Features

本論文は、トレースと評価を開発ワークフローに直接統合する JetBrains IDE 向けの AI ツールキットプラグインを紹介し、ユーザー中心かつ IDE 原生のアプローチを通じて、非機械学習ソフトウェアエンジニアが AI ベースの機能を効果的にテスト、デバッグ、再現できるようにするものである。

原著者: Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov, Andrei Gasparian, Parth Tiwary, Artem Trofimov

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov, Andrei Gasparian, Parth Tiwary, Artem Trofimov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、謎めいた超賢いシェフ見習い(AI エージェント)を使って、新しい複雑な料理を作ろうとしている料理人だと想像してください。あなたは見習いに指示を出し、彼が野菜を刻み、炒め、盛り付けを始めます。しかし、料理が絶品になることもあれば、大惨事になることもあります。問題は何でしょうか?見習いはいつも同じやり方で作業するとは限らず、料理がまずくなった場合、その「なぜ」が全くわからないのです。塩のせいでしょうか?温度のせいでしょうか?それとも見習いが特定の食材に混乱したのでしょうか?

これは、AI 機能を開発するソフトウェアエンジニアの毎日の葛藤です。彼らが料理人であり、AI が予測不能な見習いシェフなのです。

問題点:「ブラックボックス」キッチン

現在、開発者が自分の AI が何をしているかを確認したい場合、料理を中断し、キッチン(コードエディタ)を出て、インターネット上の別々の複雑なダッシュボードに行く必要があります。オーブンの温度を確認するために、キッチンを出て別の建物に行くようなものです。それは面倒で混乱を招き、ほとんどの開発者はそれをスキップしてしまいます。結果として、何が間違っていたのかを推測するか、顧客から苦情が来るまで待ってから原因を突き止めることになります。

解決策:「スマートエプロン」(AI ツールキット)

この論文の著者である JetBrains(PyCharm などの人気コーディングツールを開発する会社)のチームは、「AI ツールキット」というプラグインを開発しました。これは、あなたが自分のキッチンで料理をしている間に身につける「スマートエプロン」のようなものです。作業スペースから出ることを求めません。

以下に、簡単な比喩を用いてその仕組みを説明します。

1. 「インスタントリプレイ」カメラ(トレーシング)
コードを実行するために「実行」をクリックすると、ツールキットは自動的にカメラをオンにします。完成した料理だけでなく、AI が取ったすべてのステップを記録します。

  • 比喩: 「塩を加えている」「タイマーを確認している」「この野菜に混乱している」といった見習いの発言を記録するカメラを想像してください。
  • メリット: 動画一時停止や巻き戻しをして、IDE(コーディング環境)から出ることなく、間違いがどこで起きたかを正確に確認できます。これにより、「ブラックボックス」の謎が、明確なステップバイステップの映像に変わります。

2. 「レシピテスター」(評価)
従来の方法では、AI が機能するかテストすることは、スープを一度味わってうまくいくことを願うようなものでした。ツールキットはこれを、プロのレシピテスターのようなものに変えます。

  • 比喩: 「インスタントリプレイ」動画から特定の例(例:「AI が野菜を失敗した時」)を取り出し、「テストケース」として保存できます。これで、レシピを変更するたびに、ツールキットが自動的にその特定のテストケースを実行し、問題を修正したか、悪化させたかをチェックします。
  • メリット: AI テストを標準的なソフトウェアテストと同じように扱います。数学の天才や AI の専門家である必要はありません。ボタンを押すだけで、一連のチェックが実行されます。

3. 「ワンクリック」ワークフロー
最大の革新は、これが開発者がすでに使用しているツールの内部で起こる点です。

  • 比喩: 料理をテストするために新しい実験室を設立し、新しいチームを雇い、新しい言語を学ぶ代わりに、ツールキットは既存のキッチンカウンターにいくつかの新しいボタンを追加するだけです。
  • メリット: 開発者はコンテキストを切り替える必要がありません。コードを実行し、何が起きたかの「映像」を確認し、テストケースを保存するまで、ウェブブラウザを開くことなくすべてを完結させられます。

発見されたこと

チームは、この新しい「スマートエプロン」を実際の開発者でテストしました。

  • 高い関心: 開発者が「実行」をクリックした直後にインストールを提案するポップアップが表示された際、約 58% がすぐにインストールしました。
  • 実際の使用: インストール後、そのユーザーの約 40% が実際に最初の「映像」(トレース)を記録するために使用しました。
  • 定着率: 使用した人々は使い続け、アンインストールしませんでした。これは、これらのツールを作業場所のすぐそばに置くことが大きな違いを生むことを示唆しています。

注意点(限界)

この論文は、現在この「スマートエプロン」は特定の種類の「見習い」(LangGraph というフレームワーク)にしか適合しないことを認めています。開発者が異なる種類の AI フレームワークを使用している場合、ツールキットはまだそれらを見ることはできません。チームは近々、より多くのフレームワークとの互換性を持たせる計画です。

結論

この論文は、AI 開発を信頼できるものにするためには、別の実験室で起こる謎めいた科学実験として扱うのをやめる必要があると主張しています。その代わりに、観察とテストのためのツールを、開発者の日常的な作業スペースに直接持ち込む必要があります。コードが書かれている場所で AI を「観察」し、そのレシピを「テスト」することを容易にすることで、AI の専門家ではない開発者さえも、より良く、より信頼性の高い AI 機能を開発できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →