← Derniers articles
💬 NLP

HAL: Inducing Human-likeness in LLMs with Alignment

L'article présente HAL, un cadre qui aligne les modèles de langage sur des traits conversationnels semblables à ceux de l'humain en dérivant une récompense interprétable et basée sur les données à partir de données de dialogue contrastives, permettant une optimisation ciblée qui améliore la perception de l'humanité sans compromettre la performance globale.

Auteurs originaux : Masum Hasan, Junjie Zhao, Ehsan Hoque

Publié 2026-07-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Masum Hasan, Junjie Zhao, Ehsan Hoque

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot comment discuter comme un véritable humain. Le problème, c'est que « être humain » est un concept flou. Ce n'est pas une équation mathématique que l'on peut résoudre ; c'est un sentiment. On le reconnaît quand on l'entend, mais on ne peut pas facilement en écrire la règle. Habituellement, pour rendre une IA plus humaine, les développeurs se contentent de jeter plus d'argent et de puissance de calcul sur le problème, en espérant que le modèle ait de la chance.

Ce document présente un nouveau cadre appelé HAL (Human Aligning LLMs) qui tente de résoudre ce problème en transformant le « sentiment d'être humain » en un score mesurable, comme une note sur un bulletin scolaire.

Voici comment ils ont procédé, décomposé en étapes simples :

1. Le travail de détective : Trouver l'indice

D'abord, les chercheurs devaient découvrir ce qui rend réellement une conversation humaine. Ils ont examiné des milliers de « tests de Turing » (des jeux où un juge humain essaie de deviner qui est une personne et qui est un robot).

Au lieu de simplement demander : « Qui est l'humain ? », ils ont demandé à un IA détective super intelligente d'expliquer pourquoi elle avait fait ce choix. Le détective a trouvé des motifs. Par exemple :

  • Les humains font souvent de petites fautes de frappe ou utilisent des lettres minuscules.
  • Les humains peuvent être un peu impatients ou terminer une discussion rapidement.
  • Les humains utilisent un langage familier et ne tout expliquent pas de manière excessive.
  • Les humains admettent parfois qu'ils ne savent pas quelque chose au lieu d'inventer des choses.

Les chercheurs ont pris des centaines de ces indices et les ont synthétisés en une liste de contrôle de 16 traits spécifiques (appelée HL16Q). Considérez cela comme une « Liste de contrôle de l'humanité ».

2. La fiche de notation : Noter la conversation

Une fois qu'ils avaient la liste de contrôle, ils devaient trouver un moyen de noter une conversation. Ils ont entraîné un modèle mathématique simple (comme une échelle pondérée) pour examiner un chat et lui attribuer un chiffre unique.

  • Si le chat utilise un langage décontracté et comporte quelques fautes de frappe, le score augmente.
  • Si le chat est trop poli, parfait et robotique, le score diminue.

Ce chiffre est le Score HAL. C'est un chiffre unique qui dit : « À quel point cette conversation semble-t-elle humaine ? »

3. L'entraînement : Apprendre au robot à viser le score

Maintenant, ils ont utilisé ce score pour entraîner différents modèles d'IA (allant de petits à très grands modèles).

  • Ils ont demandé à l'IA d'avoir une conversation.
  • Ils lui ont donné une « récompense » si la conversation obtenait un score HAL élevé.
  • Ils lui ont donné une « pénalité » si le score était bas.

Avec le temps, l'IA a appris à ajuster son comportement pour obtenir un score plus élevé. Elle a commencé à agir moins comme une encyclopédie parfaite et plus comme une vraie personne discutant autour d'un café.

4. La preuve : Est-ce que cela a fonctionné ?

Pour voir si cela fonctionnait réellement, ils ont organisé un « Test de dégustation à l'aveugle » (similaire à un Chatbot Arena). De vrais volontaires humains ont discuté avec deux IA différentes côte à côte et ont dû deviner laquelle était l'humain.

  • Le résultat : L'IA entraînée avec HAL a été choisie comme « humaine » 61,78 % du temps.
  • La comparaison : Elle a battu sa propre version non entraînée et a même battu une IA commerciale très populaire et haut de gamme (GPT-4o-mini), qui n'était choisie comme humaine qu'environ 34 % du temps.

Pourquoi cela importe

La plus grande victoire ici n'est pas seulement que l'IA semble meilleure ; c'est que le processus est transparent.

  • L'ancienne méthode : « Nous avons rendu l'IA plus grande, et maintenant elle semble plus humaine. » (Boîte noire mystérieuse).
  • La méthode HAL : « Nous avons appris à l'IA à être brève, à utiliser l'argot et à admettre quand elle se trompe, et c'est pourquoi elle semble humaine. » (Recette claire).

Parce qu'ils savent exactement quels traits sont récompensés, ils peuvent vérifier que l'IA ne fait rien de bizarre ou de nuisible pour obtenir ce score. Ils ont également vérifié que l'IA n'avait pas perdu sa capacité à comprendre les émotions en apprenant à paraître humaine, et ce n'était pas le cas.

En bref : HAL est un outil qui prend l'idée vague d'« être humain », la transforme en une liste de contrôle concrète, et utilise cette liste pour entraîner l'IA à discuter plus naturellement, sans perdre son intelligence.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →