← Nieuwste papers
💬 NLP

Putting HUMANS first: Efficient LAM Evaluation with Human Preference Alignment

Dit artikel introduceert de HUMANS-benchmark, een efficiënt evaluatiekader voor grote audiomodellen dat gebruikmaakt van zorgvuldig samengestelde subsets van slechts 50 voorbeelden om een hoge correlatie met volledige benchmarks te bereiken en, via regressiemodellering, zowel willekeurige subsets als volledige benchmarks aanzienlijk overtreft in het voorspellen van menselijke gebruikersvoorkeuren.

Oorspronkelijke auteurs: Woody Haosheng Gan, William Held, Diyi Yang

Gepubliceerd 2026-05-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Woody Haosheng Gan, William Held, Diyi Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een chef-kok bent die 18 nieuwe recepten voor een gigantische soep moet proeven. Het volledige receptenboek voor elke soep bevat 16.000 ingrediënten. Het proeven van elk enkel ingrediënt voor elke soep zou je jaren kosten en een fortuin. Je hebt een snellere manier nodig om uit te zoeken welke soep het beste is, zonder alles te proeven.

Dit artikel gaat over het vinden van die afkorting voor Grote Audio-modellen (LAM's) – de AI-geesten die computers laten praten, luisteren en stemmen begrijpen.

Hier is het verhaal van hoe de onderzoekers dit probleem oplosten, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Te Groot om te Proeven" Soep

Het evalueren van deze AI-stemmodellen is duur en traag. Om ze goed te testen, moet je ze meestal door duizenden verschillende audiotaken laten gaan (zoals spraakherkenning, het beantwoorden van vragen of het aanroepen van tools).

  • De Kosten: Het testen van één model op het volledige "menu" van 16.000 items kan honderden dollars kosten en honderden uren computer tijd in beslag nemen.
  • Het Gat: Zelfs als je ze allemaal test, vertellen de scores misschien niet wat jij echt belangrijk vindt. Een model kan een perfecte score halen op een test, maar voor een menselijke gebruiker klinken als een robot.

2. De Eerste Ontdekking: De "Proeflepel"

De onderzoekers vroegen zich af: Kunnen we gewoon een klein lepeltje van de soep proeven en toch weten welke pot het beste is?

Ze probeerden 10 verschillende manieren om een klein steekproefje te kiezen uit het 16.000-items menu. Ze ontdekten dat als je de juiste 50 items kiest (wat slechts 0,3% van de totale data is), je de volledige testscore kunt voorspellen met meer dan 93% nauwkeurigheid.

  • De Analogie: Het is alsof je 50 specifieke ingrediënten kiest uit een receptenboek met 16.000 ingrediënten. Als je de juiste 50 kiest (diegenen die het verschil tonen tussen een goede en een slechte kok), weet je precies hoe het hele gerecht zal smaken zonder het hele gerecht te koken.
  • Het Resultaat: Ze creëerden een "Beste Subgroep"-methode. Voor zeer kleine steekproeven (minder dan 30 items) gebruikten ze een methode genaamd Ankerpunten (het kiezen van de meest representatieve "anker"-items). Voor grotere steekproeven (50+ items) gebruikten ze een Gecombineerde Embedding-methode (het mixen van geluid, betekenis en prestatiedata om de beste items te kiezen).

3. De Tweede Ontdekking: De "Menselijke Proef"

Het weten welk model de hoogste computerscore haalt, is niet genoeg. De onderzoekers wilden weten: Komt de computerscore overeen met wat mensen echt leuk vinden?

Ze huurden 776 mensen in om 10 minuten echte gesprekken te voeren met 7 verschillende AI-stemassistenten. Ze vroegen de mensen: "Vond je dit leuk? Was het natuurlijk? Helpte het je?"

  • De Verrassing: Zelfs de volledige, gigantische test (het 16.000-items menu) stemde slechts voor 85% overeen met menselijke gevoelens.
  • Het "Robot"-Probleem: De mensen klaagden vooral over dingen die de computertests niet oppikten. Ze gaven minder om "Hoorde het het woord correct?" (wat de tests goed meten). Ze gaven om:
    • "Klonk het als een robot?" (42% van de klachten)
    • "Was het te woordrijk?" (17% van de klachten)
    • "Verliep het gesprek ongemakkelijk?" (18% van de klachten)

4. De Oplossing: De "Magische Voorspeller"

Omdat de computerscores niet perfect overeenkwamen met menselijke gevoelens, bouwden de onderzoekers een regressiemodel (een slimme wiskundige formule).

In plaats van alleen te kijken naar de ruwe testscores, leerden ze de formule om te kijken naar de kleine subgroep van 50 items en te raden hoe een mens het model zou beoordelen.

  • De Magie: Toen ze deze formule trainden op de slim geselecteerde 50 items, voorspelde het menselijke tevredenheid met 98% nauwkeurigheid.
  • De Twist: Dit was beter dan het gebruik van de volledige 16.000-items test!
  • De Les: Kwaliteit boven Kwantiteit. Een kleine, zorgvuldig samengestelde lijst van 100 items voorspelde menselijk geluk beter dan de enorme, rommelige lijst van 16.000 items. De extra items in de grote lijst voegden alleen maar "ruis" toe en verwarde de voorspelling.

5. Het Eindproduct: "HUMANS"

De onderzoekers brachten hun bevindingen uit als een nieuwe benchmark genaamd HUMANS (HUman-aligned Minimal Audio evaluatioN Subsets).

  • Wat het is: Een kleine, efficiënte set audiotests.
  • Hoe het werkt: Je laat je AI-model op deze paar items draaien, voert de resultaten in bij hun "Magische Voorspeller"-formule, en het vertelt je hoe gelukkig echte mensen zouden zijn met dat model.
  • Waarom het belangrijk is: Het bespaart geld, bespaart tijd en vertelt je eigenlijk wat er toe doet: Gebruikstevredenheid.

Samenvatting

Denk aan de oude manier van AI-testen als het proberen om elke enkele pagina van een 10.000-pagina encyclopedie te lezen om te beslissen welke het beste is. Het is traag en saai.

Dit artikel zegt: "Nee, lees gewoon de 50 belangrijkste pagina's die we voor je hebben uitgezocht. Als je die leest, weet je dat het boek geweldig is. En als je onze speciale 'menselijk-gevoel'-rekenmachine op die 50 pagina's toepast, weet je precies hoeveel mensen ervan zullen houden om het te lezen."

Ze bewezen dat minder meer is, mits dat "minder" het juiste soort minder is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →