Guidelines for Empirical Studies in Software Engineering involving Large Language Models
この論文は、22 名の研究者が共同で、大規模言語モデル(LLM)を用いたソフトウェア工学の実証研究における再現性と再現性の課題に対処するため、研究類型の分類と 8 つのガイドライン(必須事項と推奨事項を含む)を提案し、これらをオンラインで公開する生きたリソースとして提供しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、**「ソフトウェア工学(SE)の研究において、AI(特に大規模言語モデル:LLM)を使うときの『正しい使い方と報告のルール』」**を定めたガイドラインです。
2022 年のチャットボットブーム以降、AI は研究や開発に欠かせない存在になりました。しかし、AI は**「答えが毎回少し違う(確率的)」、「中身がブラックボックス」、「モデルが勝手に進化して消えてしまう」**という性質を持っています。そのため、同じ実験をしても結果が再現できず、研究の信頼性が揺らぐという問題が起きています。
この論文は、22 人の研究者が力を合わせて、**「どうすれば AI を使った研究を、誰が見ても信用でき、再現できるようにできるか?」**という答えを 8 つの指針(ガイドライン)としてまとめました。
以下に、難しい専門用語を避け、日常の比喩を使って解説します。
🎭 7 つの「役柄」と 8 つの「ルール」
まず、AI が研究の中でどんな「役」を演じているかを 7 つに分類しました。
- データ整理係(アノテーター): 大量の文章を分類する。
- 審査員(ジャッジ): コードの質や回答の良し悪しを採点する。
- まとめ屋(シンセシス): 複数の情報をまとめて要約する。
- 役者(被験者): 人間の代わりにアンケートに答える。
- 使い手(利用者): 実際のエンジニアがどう AI を使っているか調べる。
- 道具(ツール): AI を組み込んだ新しいソフトウェアを作る。
- テスト対象(ベンチマーク): AI の性能そのものをテストする。
そして、これらの役柄に関わらず、すべての研究に適用される**「8 つの黄金ルール」**があります。
📜 8 つの黄金ルール(比喩付き解説)
1. 🗣️「誰が、何をしたか」を正直に告白する(G1)
- ルール: AI を使ったこと、その役割を論文に明記する。
- 比喩: 料理番組で「シェフが料理しました」と言うとき、もし「実は助手が下ごしらえを全部やって、シェフは味見しただけ」なら、それは嘘になります。AI を使ったなら、「誰(どの AI)」が「何(どの作業)」をしたかを、料理のレシピ(論文)の冒頭で正直に書く必要があります。
2. 📅「使った道具のバージョンと設定」を記録する(G2)
- ルール: 使った AI の名前、バージョン、日付、設定(温度など)を詳しく書く。
- 比喩: 「美味しいコーヒーが淹れられた!」と言っても、豆の銘柄、焙煎度、お湯の温度、抽出時間が書かれていなければ、誰にも再現できません。AI はバージョンが少し変わるだけで味が(結果が)全く変わります。「2025 年 1 月 10 日の、バージョン 0125 の、温度 0.7 で」というように、**「レシピの完全なメモ」**を残す必要があります。
3. 🏗️「AI 以外の仕組み」も図解する(G3)
- ルール: AI 単体だけでなく、AI を囲むシステム全体の設計図を書く。
- 比喩: AI は「エンジン」のようなものです。しかし、車(ツール)が速く走るかどうかは、エンジンだけでなく、タイヤ、ブレーキ、車体の空気抵抗にも左右されます。「AI だけ」ではなく、**「AI をどう組み込んで、どんな車を作ったか」**という全体の設計図(アーキテクチャ)も公開する必要があります。
4. 📝「AI への指示文(プロンプト)」をすべて公開する(G4)
- ルール: AI に何と言ったか(プロンプト)や、その会話履歴をすべて公開する。
- 比喩: 魔法の杖(AI)で何かを実現するには、**「どんな呪文(指示文)」を唱えたかが重要です。「『コードを書いて』と言っただけ」では、誰がやっても同じ結果になりません。「『Java で、バグを直して、コメントもつけて』と、このように詳しく指示した」という「呪文の全文と、その会話の録音」**を公開して、誰でも同じ呪文を唱えられるようにします。
5. 👨🏫「人間の先生にチェックさせる」(G5)
- ルール: AI の答えが正しいか、人間が確認する。
- 比喩: 優秀な生徒(AI)がテスト答案を作っても、先生(人間)が採点しないと、本当に正解かどうかは分かりません。特に「主観的な評価(このコードは読みやすいか?)」が必要な場合は、**「AI の答えを人間がチェックして、合っているか確認する」**プロセスが必要です。AI 同士で「いいね」し合うだけでは不十分です。
6. 🆓「誰でも使える無料の AI」も比較対象に入れる(G6)
- ルール: 有料の AI だけでなく、誰でも使えるオープンな AI もテストに使う。
- 比喩: 「この高級スポーツカー(有料 AI)は速い!」と言うとき、**「同じ条件で、誰でも買える普通の車(オープン AI)」**も走らせて比較しないと、本当に速いのか分かりません。また、有料の AI は明日突然仕様が変わったり消えたりする可能性があります。誰でも再現できる「普通の車」の結果も残しておくことで、研究の土台を安定させます。
7. 📏「正しいものさし」を使う(G7)
- ルール: 評価に使った基準(メトリクス)が適切か、理由を説明する。
- 比喩: 「この料理は美味しかった」と言うとき、「味」を測るのに「重さ」のメジャーを使っても意味がありません(例:コードの行数が多い=良い、というのは誤り)。研究で使った評価基準が、本当に測りたいこと(機能性、安全性など)を正しく測れているか、その理由を説明する必要があります。また、AI は確率的なので、**「1 回だけ」ではなく「何度も試して、平均値を出す」**必要があります。
8. ⚠️「限界とリスク」を隠さず語る(G8)
- ルール: 研究の弱点や、AI の限界を正直に書く。
- 比喩: 「この薬は 100% 効きます!」と言うのは危険です。「この薬は、特定の症状には効くが、副作用があるかもしれないし、他の人にも効くとは限らない」と**「限界とリスク」**を正直に書くことで、読者はその研究を正しく評価できます。「AI は時々嘘をつく」「データが漏れる可能性がある」といった弱点を隠さず、どう対策したかを報告します。
🌟 まとめ:なぜこれが重要なのか?
このガイドラインの目的は、**「AI を使った研究を、誰が読んでも『あ、なるほど!再現できるな』と思えるようにすること」**です。
AI は魔法のように見えますが、実は**「確率の箱」です。箱を開けるたびに中身が少し変わってしまうため、「どの箱を開けたか(バージョン)」、「どう開けたか(設定)」、「誰が中身を確認したか(人間)」**をすべて記録・公開しないと、科学としての信頼性が保てません。
この論文は、AI という新しい「魔法」を、**「誰にでも再現可能な科学」として正しく使いこなすための、「魔法使いの心得」**のようなものです。研究者も、開発者も、そして AI を使うすべての人が、このルールを守ることで、より信頼できる未来のソフトウェアを作れるようになります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。