← 最新の論文
🤖 AI

To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

本論文は、主要な大規模言語モデルにおいて、編集時にコードを削除せずに保持させてしまう系統的な「削除回避」バイアスを特定および定量化し、この挙動がコードの保守性を著しく低下させること、および標的を絞った事後学習を通じてこれを軽減できることを示す。

原著者: Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Amir M. Ebrahimi, Mohammed Mehedi Hasan, Aaditya Bhatia, Gopi Krishnan Rajbahadur, Ahmed E. Hassan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、コードの執筆や修正を助けてくれる、非常に賢いロボット・アシスタントを雇うことを想像してみてください。あなたは「このボタンが動かない」といった問題を提示し、ロボットはそれを直そうと試みます。ソフトウェアエンジニアリングの世界では、このロボットは大規模言語モデル(LLM)と呼ばれています。これらのモデルは、図書館にあるすべての料理本を読み終えたデジタル・シェフのようなものです。彼らは、ゼロから複雑なレシピ(コード)を素早く作り出すことができます。しかし、ここには厄介な点があります。レシピを修正するということは、単に新しい材料を加えることだけではなく、古くなって台無しになった材料を「捨てる」ことを意味する場合があるのです。もしロボットが物を捨てることを恐れすぎていると、古い材料を実際に取り除く代わりに、「これは食べないでください」という立派な注釈を添えるだけで、そのまま残してしまうかもしれません。この論文は、これらのAIロボットが、実は「捨てる」という仕事において本当に優れているのか、それとも単に何かを削除することを遠慮しすぎているだけなのかを調査しています。

クイーンズ大学の研究者たちは、これらのAIコーディング・アシスタントに対して、非常に具体的なテストを行うことにしました。彼らは、モデルが「削除回避(deletion avoidance)」に苦しんでいるのではないかと考えました。これは、リフォームの際に、部屋を広くするために壁を取り壊す場面を想像してみてください。優れた請負業者なら、その壁をぶち壊すでしょう。しかし、質の悪い業者は、壁の前にカーテンを設置して、「はい、これで壁はなくなりました」と言うだけかもしれません。実際には、レンガはまだそこに残っているというのに。研究チームは、トップクラスのAIモデルが、確かに「壁をぶち壊す」ことが非常に苦手であることを見出しました。たとえ「部屋は直った」というテストに合格したとしても、彼らはしばれた新しい指示という名のカーテンの背後に、古いコードを置き去りにしていることがよくあるのです。

この論文は、これらのロボットのための「削除専用」のジムのような、新しいベンチマークであるCanItDeleteを紹介しています。彼らは他の紛らわしいタスクをすべて取り除き、ただ特定の行のコードを削除することだけをモデルに求めました。結果は驚くべきものでした。最高峰のAIモデルでさえ、5回に1回の割合でコードを正しく削除できずに失敗したのです。削除しようとした際、彼らは多くの場合、削除しすぎてしまったり、余計なジャンクコードを追加してしまったりしました。また、研究者たちは**「ガード・アンド・ゴー(Guard-and-Go)」**と呼ばれる巧妙なパターンを発見しました。壊れたコードを取り除く代わりに、AIはそれを保持したまま、「もしあなたがこの特定のタイプのユーザーであれば、壊れたコードを無視してください」という「ガード(警備員)」を追加するのです。これにより、壊れたコードは使用されなくなるためテストには合格しますが、乱雑なコードは依然としてプロジェクトの中に散乱したままとなります。

これを解決するために、チームは小さな実験を行いました。彼らは、コードが削除される数千もの例を見せることで、AIモデルの一つに「削除する方法」を特別に教え込みました。この「トレーニング」によって、モデルは削除が非常に上手くなり、ミスを約14%減少させることができました。このことは、ロボットが削除を「できない」のではなく、単に「練習不足」であることを示唆しています。論文は、AIが新しいコードを書くことには長けてきている一方で、まだ「手放す技術」を学ぶ必要があると結論づけています。それまでは、人間によるレビュー担当者が、ロボットが残していくデジタルのゴミを掃除し続けなければならないでしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →