← Nieuwste papers
💬 NLP

HAL: Inducing Human-likeness in LLMs with Alignment

Het artikel introduceert HAL, een framework dat taalmodellen afstemt op menselijke conversatiekenmerken door een interpreteerbare, datagedreven beloning af te leiden uit contrastieve dialoogdata, wat gerichte optimalisatie mogelijk maakt die de waargenomen menselijkheid verbetert zonder de algehele prestaties in gevaar te brengen.

Oorspronkelijke auteurs: Masum Hasan, Junjie Zhao, Ehsan Hoque

Gepubliceerd 2026-07-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Masum Hasan, Junjie Zhao, Ehsan Hoque

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren hoe hij als een echt mens kan chatten. Het probleem is dat "mens-zijn" een vaag concept is. Het is geen wiskundige vergelijking die je kunt oplossen; het is een gevoel. Je weet het wanneer je het hoort, maar je kunt er niet gemakkelijk een regel voor opschrijven. Meestal proberen ontwikkelaars AI menselijker te laten klinken door er simpelweg meer geld en rekenkracht tegenaan te gooien, in de hoop dat het model geluk heeft.

Dit artikel introduceert een nieuw framework genaamd HAL (Human Aligning LLMs) dat probeert dit op te lossen door "menselijk aanvoelen" om te zetten in een meetbare score, zoals een cijfer op een rapport.

Dit is hoe ze het hebben aangepakt, onderverdeeld in eenvoudige stappen:

1. Het Detectivewerk: De "Vertel" vinden

Eerst moesten de onderzoekers uitzoeken wat een gesprek eigenlijk menselijk maakt. Ze keken naar duizenden "Turing-tests" (spelletjes waarbij een menselijke beoordelaar probeert te raden wie een persoon is en wie een robot).

In plaats van alleen te vragen: "Wie is mens?", vroegen ze een superintelligente AI-detective om uit te leggen waarom het die keuze maakte. De detective vond patronen. Bijvoorbeeld:

  • Mensen maken vaak kleine typefouten of gebruiken kleine letters.
  • Mensen kunnen een beetje ongeduldig zijn of een chat snel beëindigen.
  • Mensen gebruiken informele straattaal en leggen niet alles overdreven uit.
  • Mensen geven soms toe dat ze iets niet weten in plaats van dingen te verzinnen.

De onderzoekers namen honderden van deze aanwijzingen en destilleerden deze tot een checklist van 16 specifieke eigenschappen (de HL16Q genoemd). Zie dit als een "Menselijkheid-checklist".

2. Het Scoreformulier: Het Gesprek Beoordelen

Zodra ze de checklist hadden, hadden ze een manier nodig om een gesprek te beoordelen. Ze trainden een eenvoudig wiskundig model (zoals een gewogen schaal) om naar een chat te kijken en er één getal aan toe te kennen.

  • Als de chat informele taal gebruikt en een paar typefouten bevat, gaat de score omhoog.
  • Als de chat overdreven beleefd, perfect en robotachtig is, gaat de score omlaag.

Dit getal is de HAL-score. Het is één enkel getal dat zegt: "Hoe menselijk voelt dit gesprek?"

3. De Training: De Robot Leren Mikken op de Score

Nu gebruikten ze deze score om verschillende AI-modellen te trainen (variërend van klein tot zeer groot).

  • Ze vroegen de AI om een gesprek te voeren.
  • Ze gaven de AI een "beloning" als het gesprek een hoge HAL-score kreeg.
  • Ze gaven de AI een "straf" als de score laag was.

In de loop van de tijd leerde de AI zijn gedrag aan te passen om een hogere score te halen. De AI begon minder als een perfecte encyclopedie te handelen en meer als een echt persoon die koffie drinkt met een vriend.

4. Het Bewijs: Werkt het?

Om te zien of het daadwerkelijk werkte, hielden ze een "Blinde Proeverij" (vergelijkbaar met een Chatbot Arena). Echte menselijke vrijwilligersers chatten zij aan zij met twee verschillende AI's en moesten raden welke de mens was.

  • Het Resultaat: De AI die getraind was met HAL werd in 61,78% van de gevallen gekozen als "mens".
  • De Vergelijking: Het versloeg zijn eigen ongetrainde versie en versloeg zelfs een zeer populaire, hoogwaardige commerciële AI (GPT-4o-mini), die slechts in ongeveer 34% van de gevallen als mens werd gekozen.

Waarom Dit Belangrijk Is

De grootste overwinning hier is niet alleen dat de AI beter klinkt; het is dat het proces transparant is.

  • Oude Manier: "We hebben de AI groter gemaakt, en nu klinkt hij menselijker." (Een mysterieuze black box).
  • HAL-Manier: "We hebben de AI geleerd om kort te zijn, straattaal te gebruiken en toe te geven wanneer hij het niet weet, en dat is waarom hij menselijker klinkt." (Een duidelijk recept).

Omdat ze precies weten welke eigenschappen ze belonen, kunnen ze controleren of de AI geen vreemde of schadelijke dingen doet om die score te halen. Ze controleerden ook of de AI niet zijn vermogen om emoties te begrijpen verloor tijdens het leren menselijker te klinken, en dat deed hij niet.

Kortom: HAL is een hulpmiddel dat het vage idee van "mens-zijn" neemt, dit omzet in een concrete checklist, en die checklist gebruikt om AI te trainen om natuurlijker te chatten, zonder zijn intelligentie te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →