← Derniers articles
💬 NLP

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

L'équipe Dream propose un cadre de classification autorégressif à passage unique de type SALSA, combinant un échantillonnage équilibré et un ajustement fin conservateur pour parvenir à une détection robuste hors distribution du code généré par machine, surpassant de manière significative la référence CodeBERT sur le classement du SemEval-2026 Task 13.

Auteurs originaux : Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

Publié 2026-06-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un enseignant essayant de déterminer si le devoir d'un élève a été écrit par l'élève lui-même ou s'il a été copié d'une IA super intelligente. Voici le défi que les auteurs de ce papier ont relevé pour une compétition appelée SemEval-2026 Task 13.

Voici l'histoire de la façon dont ils l'ont résolu, en utilisant des analogies simples :

Le Problème : Le Code « Caméléon »

Par le passé, détecter du code écrit par une IA revenait à essayer de repérer un caméléon dans une forêt. L'IA pouvait écrire du code dans de nombreux langages différents (comme Python, Java ou C++) et pour de nombreuses tâches différentes. Si vous entraîniez un détecteur pour repérer le code IA en Python, il échouait souvent lorsque l'IA passait au Java. Le détecteur était trop « spécialisé » et ne pouvait pas gérer de nouvelles situations inédites.

La Solution : Le Jeu de la « Réponse en un Mot »

L'équipe de Dream Security Ltd. a proposé une nouvelle façon de jouer au jeu, qu'ils appellent SALSA (Single-pass Autoregressive LLM Structured Classification).

Pensez à un chatbot IA normal comme à un perroquet bavard. Si vous lui demandez : « Est-ce que ce code est écrit par une IA ? », il pourrait répondre : « Eh bien, en regardant la syntaxe et les noms de variables, je pense que c'est probablement une IA parce que... » et écrire ensuite tout un paragraphe. C'est désordonné et difficile à noter.

SALSA change les règles :

  1. Le Prompt : Ils donnent un extrait de code à l'IA et lui posent une question très spécifique : « Est-ce généré par une machine ? »
  2. La Contrainte : Ils disent à l'IA : « Tu n'as le droit de répondre qu'avec un seul mot : soit '0' (Non), soit '1' (Oui). »
  3. Le Résultat : Au lieu d'un long essai, l'IA est forcée de faire un choix rapide et décisif. C'est comme demander à un juge de laisser tomber un seul coup de marteau au lieu d'écrire un avis juridique de 10 pages.

L'Entraînement : « Moins, c'est Plus »

Habituellement, quand vous apprenez à un modèle informatique une nouvelle tâche, vous pouvez le faire réviser pendant longtemps jusqu'à ce qu'il mémorise les exemples spécifiques que vous lui avez donnés. Mais les auteurs ont réalisé que si vous faites réviser un modèle trop intensément sur des exemples spécifiques, il oublie comment gérer de nouvelles situations (c'est ce qu'on appelle le « surapprentissage » ou overfitting).

Ils ont utilisé une approche d'« Entraînement Conservateur » :

  • Le Taux d'Apprentissage : Imaginez que le taux d'apprentissage est le bouton de volume d'une radio. Ils ont baissé le volume très bas. Cela a permis au modèle d'apprendre la nouvelle tâche sans couvrir ses propres connaissances existantes.
  • La Durée : Ils n'ont laissé le modèle étudier les exemples qu'une seule fois (une époque/epoch). Ils ont constaté qu'étudier trop longtemps rendait le modèle incapable d'être un généraliste et le rendait trop spécialisé dans les données d'entraînement uniquement.
  • Régime Équilibré : Les données d'entraînement contenaient beaucoup plus de code Python que de Java ou C++. Pour empêcher le modèle de devenir un expert « uniquement en Python », ils l'ont forcé à consommer une quantité égale de chaque langage, même s'il fallait jeter une partie de l'excédent de données Python.

Les Résultats : Battre la Référence

La compétition avait un détecteur de « référence » (CodeBERT) qui était comme un vieux détecteur de métaux rouillé. Il n'obtenait qu'un score de 0,305 (très médiocre) lorsqu'il était testé sur de nouveaux langages inconnus.

Le système SALSA de l'équipe Dream Security était comme un scanner haute technologie et adaptatif.

  • Zero-Shot (Sans entraînement) : Même sans entraînement spécial, leur IA était correcte (autour de 0,5).
  • Avec Entraînement : Après leur entraînement minutieux d'« une seule époque », leur meilleur système a atteint un score de 0,789.

C'est un bond massif. Cela signifie que leur système est bien meilleur pour repérer le code généré par l'IA, même lorsque le code est écrit dans un langage ou un style qu'il n'a jamais vu auparavant.

Le Piège

Le papier note une curiosité amusante : avant l'entraînement, l'IA était très timide. Elle avait tellement peur de faire une erreur qu'elle devinait presque toujours « Écrit par un humain » (0), même quand c'était une IA. Cela la faisait paraître très performante en « précision » (quand elle disait que c'était une IA, elle avait raison), mais avec un très mauvais « rappel » (elle passait à côté de presque tout le code IA). L'entraînement a aidé à corriger cette timidité, apprenant au modèle à être assez courageux pour dire « Oui » lorsqu'il voit du code IA.

En bref : Ils ont construit un détecteur qui n'écrit pas d'essais, qui ne mémorise pas le manuel scolaire et qui ne se laisse pas submerger par de nouveaux langages. Il regarde simplement le code, réfléchit une fraction de seconde, et lâche un seul « Oui » ou « Non » précis.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →