DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance
Le papier propose DUET, une méthode de distillation on-policy sélective par jeton qui exploite le désaccord par jeton entre deux enseignants aux poids identiques (l'un avec et l'autre sans contexte de prohibition) pour générer un signal de supervision propre afin d'entraîner des modèles à se conformer à des interdictions dynamiques et spécifiques à chaque requête tout en préservant l'utilité générale.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les grands modèles de langage sont les moteurs de nombreux assistants numériques modernes, capables de générer du texte semblable à celui de l'humain, de résoudre des problèmes et de répondre à des questions. Cependant, dans le monde réel, ces modèles opèrent souvent sous des règles strictes et changeantes qui ne sont pas codées en dur dans leur cerveau, mais sont plutôt injectées dans leurs instructions au moment où ils sont utilisés. Une entreprise pourrait dire à un modèle de ne jamais révéler ses outils internes, tandis qu'un hôpital pourrait exiger qu'il ne mentionne jamais de noms de patients. Ces règles changent selon qui pose la question et quelle est la situation. Le défi pour les développeurs est d'apprendre au modèle à obéir à ces interdictions spécifiques et temporaires sans le rendre si prudent qu'il refuse de répondre à des questions inoffensives, ou si confiant qu'il enfreigne accidentellement les règles. Si un modèle ne parvient pas à suivre ces instructions, cela peut entraîner des fuites de données ou des incidents de sécurité de marque ; s'il devient trop craintif pour parler, il devient inutile.
Des chercheurs de Tencent ont développé une nouvelle méthode appelée DUET pour résoudre ce problème spécifique consistant à apprendre aux modèles à suivre des règles d'exécution. Au lieu d'essayer de réentraîner le modèle de zéro ou de simplement lui montrer des exemples de bonnes et de mauvaises réponses, ils ont créé un système qui agit comme une paire de jumeaux identiques. Un jumeau voit la règle interdite dans ses instructions, tandis que l'autre jumeau, qui possède exactement les mêmes connaissances et capacités, ne voit pas la règle. Parce que ces deux « enseignants » sont par ailleurs identiques, toute différence dans ce qu'ils disent doit être causée uniquement par la présence ou l'absence de cette règle spécifique. Les chercheurs utilisent ce désaccord pour identifier précisément l'endroit où le modèle est susceptible de commettre une erreur.
Le processus fonctionne en demandant au modèle étudiant de générer une réponse pendant que les deux jumeaux enseignants regardent. Lorsque les deux enseignants sont d'accord sur le mot suivant qui devrait être utilisé, le système ignore cette partie de la conversation, supposant qu'elle est sûre et sans importance. Cependant, lorsqu'ils sont en désaccord — l'un suggérant un mot qui révèle un secret et l'autre suggérant une alternative sûre — le système signale ce moment précis comme une opportunité d'apprentissage critique. Cela permet au modèle étudiant de concentrer son attention uniquement sur les quelques mots où la règle importe réellement, plutôt que de gaspiller des efforts sur les milliers de mots qui sont parfaitement corrects. L'étudiant est ensuite doucement éloigné de l'enseignant qui ignore la règle et attiré vers celui qui la respecte, apprenant ainsi efficacement à naviguer entre l'utilité et la conformité.
Cette approche remédie à une faille des anciennes méthodes où les modèles étaient entraînés sur des conversations entières. Dans ces anciens systèmes, si un modèle commettait une seule erreur dans une longue réponse, toute la réponse était souvent considérée comme mauvaise, ce qui laissait le modèle confus quant aux mots spécifiques qui posaient problème. En isolant le désaccord au jeton exact, ou unité de mot, où la violation se produit, la nouvelle méthode fournit un signal beaucoup plus clair. Les chercheurs ont testé cela sur diverses tâches, notamment la protection des informations personnelles, le respect des consignes de sécurité et l'adhésion aux définitions d'outils commerciaux. Ils ont constaté que les modèles entraînés avec cette méthode de double enseignant étaient nettement plus performants pour refuser de transgresser les règles tout en restant utiles pour les questions légitimes.
Les résultats ont montré que la nouvelle méthode surpassait les techniques existantes sur différentes tailles de modèles, des plus petits avec 1,5 milliard de paramètres aux plus grands avec 8 milliards. Dans leurs tests, les modèles ont atteint un taux de conformité de plus de 72 % à 85 % sur les requêtes de violation, ce qui signifie qu'ils ont réussi à refuser de transgresser les règles, tout en conservant un haut niveau d'utilité pour les questions normales, préservant entre 88 % et 93 % de leur capacité à répondre correctement. Crucialement, les modèles n'ont pas perdu leur intelligence générale ; ils sont restés tout aussi bons en mathématiques et en logique qu'auparavant. L'étude suggère qu'en utilisant deux modèles identiques pour trouver l'endroit exact où une règle compte, les développeurs peuvent créer des assistants IA qui sont à la fois sûrs et utiles, naviguant à travers des instructions complexes et changeantes sans avoir besoin de quantités massives de nouvelles données ou sans perdre leurs capacités fondamentales.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.