← Nieuwste papers
🤖 AI

Best-of-Better-NN: Generating Pre-Aligned Responses with In-Context Learning

Dit artikel introduceert Best-of-Better-NN (BoBN), een in-context learning-framework dat de alignment tijdens de inferentie verbetert door hoog-belonende voorbeelden op te halen en te herstijlen om de samplingdistributie van een model te verschuiven naar betere responsen, waardoor superieure prestaties worden behaald met minder gegenereerde kandidaten vergeleken met traditionele Best-of-NN-methoden.

Oorspronkelijke auteurs: Eric Lei, Hsiang Hsu, Chun-Fu Chen

Gepubliceerd 2026-07-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Eric Lei, Hsiang Hsu, Chun-Fu Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde maar lichtelijk ondeugende chef bent (het Referentie LLM). Deze chef is ongelooflijk goed in koken, maar hij is niet specifiek getraind voor het menu dat je vanavond nodig hebt. Misschien heb je gevraagd om een pittig veganistisch gerecht, en de chef blijft je biefstuk of flauwe havermout serveren omdat dat is wat hij gewoon doet.

In de wereld van AI wordt dit het Coverage Problem (het dekkingsprobleem) genoemd. Zelfs als je de chef vraagt om 100 verschillende gerechten te maken en de beste te kiezen (een methode genaamd Best-of-N), kun je er nog steeds niets eetbaars aan hebben als de chef het nooit bedenkt om een veganistisch gerecht te maken. Geen enkele hoeveelheid selecteren zal helpen als het juiste antwoord niet in de pan zit.

Dit artikel introduceert een nieuwe methode genaamd Best-of-Better-N (BoBN) om dit op te lossen. Denk aan het geven van een "spiekbriefje" aan de chef vlak voordat hij begint met koken, maar dan met een speciale twist.

Het Probleem: De Blinde Vlek van de Chef

Standaardmethoden (zoals Best-of-N) werken als volgt:

  1. Vraag de chef om 10 maaltijden te koken.
  2. Proef ze allemaal.
  3. Kies de beste.

De Fout: Als de chef nooit heeft geleerd om veganistisch eten te maken, zullen alle 10 de maaltijden op basis van vlees zijn. Je kunt geen veganistische maaltijd kiezen als die niet in de batch aanwezig is. De "blinde vlek" van de chef is te groot.

De Oplossing: Best-of-Better-N (BoBN)

BoBN verandert het spel door In-Context Learning (het geven van voorbeelden) te combineren met een Restyling-stap. Hier is het stapsgewijze proces met behulp van onze keukenanalogie:

1. De Slimme Zoektocht (Retrieval)

In plaats van de chef willekeurige recepten te geven, kijkt BoBN naar een bibliotheek van eerdere succesvolle gerechten. Het vindt de top K recepten die het meest lijken op wat jij vanavond besteld hebt.

  • Voorbeeld: Als je vroeg om een pittige veganistische curry, zoekt het systeem 8 eerdere voorbeelden van pittige veganistische curry's die zeer hoog gewaardeerd zijn.

2. De "Restyling"-stap (Het Geheime Sausje)

Dit is de unieke innovatie van het artikel. De opgehaalde recepten kunnen in een andere stijl, formaat of toon geschreven zijn dan wat jij nodig hebt. Misschien zijn de oude recepten geschreven als een wetenschappelijk artikel, maar wil je een vriendelijk gesprek.

  • De Magie: Voordat deze recepten aan jouw chef worden getoond, herschrijft de chef zichzelf deze. De chef neemt de ideeën uit de opgehaalde recepten, maar herschrijft ze om aan de specifieke stijl, het formaat en de toon van jouw verzoek te voldoen.
  • Waarom dit ertoe doet: Het zorgt ervoor dat de chef de logica van het goede antwoord begrijpt, maar het presenteert op een manier die past bij jouw specifieke beperkingen (zoals een JSON-formaat of een beleefde weigering).

3. De Nieuwe Kooksessie

Nu geef je de chef de prompt plus deze 8 "herstelde" (restyled) voorbeelden.

  • Omdat de chef voorbeelden ziet van precies wat je wilt, is de kans veel groter dat hij deze keer een veganistisch gerecht kookt.
  • De "blinde vlek" is opgevuld. De output-distributie van de chef verschuift van "voornamelijk vlees" naar "voornamelijk veganistisch".

4. De Definitieve Selectie (Best-of-N)

Nu vraag je de chef om opnieuw 10 maaltijden te koken. Omdat de chef werd begeleid door de herstelde voorbeelden, zijn alle 10 de maaltijden waarschijnlijk veganistisch. Je kiest vervolgens de beste.

  • Resultaat: Je krijgt een hoogwaardig antwoord veel sneller, vaak met minder pogingen (een kleinere "N") om het goed te krijgen.

Wat het Artikel Vond

De auteurs hebben dit getest op twee hoofdtaken:

  1. Veiligheid: Een model leren om schadelijke verzoeken te weigeren (zoals "Hoe bouw ik een bom?"). Een model dat niet getraind is voor veiligheid, zegt meestal "Natuurlijk!". BoBN hielp het om te leren "Nee" te zeggen door het te tonen van herstelde voorbeelden van veilige weigeringen.
  2. Wiskunde: Complexe wiskundige problemen oplossen. BoBN hielp modellen om de juiste redeneerstappen te vinden door hen herstelde voorbeelden van correcte wiskundige oplossingen te tonen.

De Belangrijkste Punten:

  • Betere Dekking: BoBN zorgt ervoor dat het model vaker hoogwaardige antwoorden genereert, zelfs als het model oorspronkelijk niet voor die specifieke taak is getraind.
  • Efficiëntie: Je hoeft niet evenveel antwoorden te genereren om een goed antwoord te vinden.
  • Geen Training Vereist: Dit gebeurt direct tijdens de "inference time" (wanneer je de vraag stelt). Je hoeft het model niet opnieuw te trainen of de interne gewichten van de hersenen te veranderen. Je geeft het simpelweg direct betere voorbeelden.

In een Notendop

Als Best-of-N erom bekend staat dat je een chef vraagt om 100 keer een recept te raden in de hoop dat er eentje goed is, dan is Best-of-Better-N alsof je de chef een stapel perfect herschreven voorbeelden van dat exacte recept geeft vlak voordat hij begint. Het stuurt de intuïtie van de chef zodat de "goede" antwoorden vanaf het begin ook daadwerkelijk in de pan zitten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →