Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation
Cet article propose une méthode rentable qui améliore les modèles de langage de raisonnement tant dans les domaines vérifiables qu'invérifiables en appliquant d'abord l'ajustement d'instructions classique à des solutions écrites par des humains, puis en fusionnant le modèle résultant avec le modèle de raisonnement original pour récupérer les capacités de raisonnement spécifiques au domaine.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'enseigner à un étudiant brillant et suranalyste comment résoudre un nouveau type de puzzle. Cet étudiant, un « Modèle de Langage de Raisonnement », est un programme informatique spécial formé pour montrer son travail. Avant de donner la réponse finale à un problème mathématique ou à un défi de codage, il écrit un long processus de pensée étape par étape, comme un détective résolvant un mystère. Cette habitude de « penser à voix haute » est ce qui le rend si doué pour les tâches complexes.
Cependant, il y a un piège. Pour enseigner de nouvelles compétences à cet étudiant, vous avez généralement besoin d'un moyen de vérifier instantanément si sa réponse est correcte (comme un corrigé de mathématiques) ou d'un professeur super intelligent pour lui montrer la bonne façon de réfléchir. Mais que faire si vous voulez lui enseigner quelque chose où il n'y a pas de corrigé, comme écrire le résumé d'une histoire drôle ou corriger un bug spécifique dans un programme informatique qui n'a pas de test ? Vous disposez de nombreux exemples des bonnes réponses écrites par des humains, mais aucun d'entre eux ne montre la partie « réflexion ». Si vous forcez simplement l'étudiant à mémoriser ces réponses sans les étapes de réflexion, il pourrait obtenir la bonne réponse pour ce puzzle spécifique, mais il oublierait comment réfléchir en général. Il devient un perroquet qui répète des réponses au lieu d'un détective qui résout des problèmes.
C'est le puzzle que les chercheurs de l'ETH Zurich ont abordé dans leur nouvel article. Ils ont découvert une astuce ingénieuse en deux étapes pour enseigner de nouvelles compétences à ces modèles de « réflexion » sans qu'ils oublient comment réfléchir. Premièrement, ils laissent le modèle apprendre à partir des exemples simples de type « réponse uniquement », tout comme un étudiant qui révise intensément pour un examen. Cela rend le modèle meilleur pour la tâche spécifique, mais il commence à perdre son habitude de montrer son raisonnement. Ensuite, ils effectuent un « mélange » magique. Ils prennent ce nouveau modèle ainsi entraîné et le fusionnent avec le modèle original, celui qui réfléchit intelligemment. C'est comme mélanger une tasse de café frais spécifique à une tâche avec une tasse de l'espresso original, très fort. En ajustant soigneusement le ratio du mélange, ils ont trouvé un « point d'équilibre » où le modèle conserve ses nouvelles compétences tout en se souvenant de comment réfléchir aux problèmes.
Les chercheurs ont testé cela sur quatre modèles intelligents différents et deux tâches très différentes : écrire du code dans le langage de programmation Rust et résumer de longs articles de presse. Ils ont constaté que leur méthode fonctionnait à merveille. Les modèles sont devenus bien meilleurs dans les tâches spécifiques (améliorant les scores de codage jusqu'à 12 points et les scores de résumé légèrement) tout en récupérant presque totalement leur capacité de raisonnement, qui est habituellement détruite par l'entraînement standard. Mieux encore, tout ce processus était incroyablement peu coûteux et rapide. Les chercheurs ont calculé qu'ils pouvaient adapter un modèle pour moins de 3 $ et en moins d'une heure, alors que d'autres méthodes qui tentent de résoudre le même problème coûtent nettement plus cher et prennent plus de temps.
En bref, l'article suggère que vous n'avez pas besoin d'un système de « vérification de réponses » super coûteux ou d'un génie enseignant pour mettre à niveau ces modèles de raisonnement. Vous pouvez utiliser les masses de données simples de type « question-réponse » qui existent déjà, et avec un peu de mélange mathématique, vous pouvez donner de nouvelles compétences à ces modèles sans casser leur cerveau. C'est une façon à faible coût et à haut rendement de garder nos détectives IA affûtés, même lorsqu'ils apprennent à résoudre des mystères qui n'ont pas de solutions évidentes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.