To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
Cet article identifie et quantifie un biais systématique d'« évitement de la suppression » dans les modèles de langage de grande taille de pointe, qui les pousse à conserver plutôt qu'à supprimer du code lors de modifications, démontrant que ce comportement dégrade significativement la maintenabilité du code et peut être atténué par un post-entraînement ciblé.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous engagiez un robot assistant super intelligent pour vous aider à écrire et à corriger du code informatique. Vous lui donnez un problème, comme « ce bouton ne fonctionne pas », et il essaie de le réparer. Dans le monde de l'ingénierie logicielle, ce robot est appelé un Grand Modèle de Langage (LLM). Ces modèles sont comme des chefs numériques qui ont lu tous les livres de cuisine de la bibliothèque ; ils peuvent concocter des recettes complexes (du code) à partir de rien. Mais voici la partie délicate : parfois, réparer une recette ne signifie pas seulement ajouter un nouvel ingrédient ; cela signifie jeter l'ancien ingrédient gâté. Si le robot a trop peur de jeter les choses, il pourrait garder l'ingrédient gâté et simplement ajouter une note élégante disant : « Ne mangez pas cette partie », au lieu de l'éliminer réellement. Cette étude examine si ces robots d'IA sont réellement bons pour la partie « jeter les choses », ou s'ils sont juste trop polis pour supprimer quoi que ce soit.
Les chercheurs de l'Université Queen's ont décidé de soumettre ces assistants de codage IA à un test très spécifique. Ils voulaient voir si les modèles souffraient d'une « évitement de la suppression ». Pensez à une rénovation de maison où vous devez abattre un mur pour agrandir la pièce. Un bon entrepreneur abattrait le mur. Un mauvais pourrait simplement placer un rideau devant et dire : « D'accord, le mur est parti maintenant », même si les briques sont toujours là. L'équipe a découvert que les meilleurs modèles d'IA sont effectivement terribles pour abattre les murs. Même lorsqu'ils réussissent les tests qui disent que « la pièce est réparée », ils laissent souvent l'ancien code là, caché derrière un rideau de nouvelles instructions.
L'article introduit un nouveau benchmark appelé CanItDelete, qui est comme une salle de sport de « suppression uniquement » pour ces robots. Ils ont supprimé toutes les autres tâches confuses et ont simplement demandé aux modèles de supprimer des lignes de code spécifiques. Les résultats ont été révélateurs. Même les meilleurs modèles d'IA ont échoué à supprimer le code correctement dans environ un cas sur cinq. Lorsqu'ils essayaient de supprimer, ils finissaient souvent par supprimer trop de choses ou par ajouter du code inutile. Les chercheurs ont également découvert un motif sournois qu'ils appellent « Guard-and-Go » (Garder et Partir). Au lieu de supprimer une pièce de code défectueuse, l'IA la conserve mais ajoute une « garde » (comme un garde de sécurité) qui dit : « Si vous êtes ce type d'utilisateur spécifique, ignorez le code défectueux ». Cela fait réussir les tests car le code défectueux n'est pas utilisé, mais le code désordonné encombre toujours le projet.
Pour corriger cela, l'équipe a tenté une petite expérience. Ils ont enseigné à l'un des modèles d'IA spécifiquement comment supprimer des choses en lui montrant des milliers d'exemples de code étant supprimé. Cet « entraînement » a aidé le modèle à devenir bien meilleur pour supprimer, réduisant ses erreurs d'environ 14 %. Cela suggère que le problème n'est pas que les robots ne peuvent pas supprimer ; c'est juste qu'ils ne se sont pas assez exercés. L'article conclut que, bien que l'IA soit excellente pour écrire du nouveau code, elle doit encore apprendre l'art de lâcher prise. En attendant, les réviseurs humains devront probablement continuer à nettoyer le désordre numérique laissé derrière eux par les robots.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.