← Nieuwste papers
📊 statistics

DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks

Het artikel introduceert DUET, een nieuw globaal-naar-lokaal algoritme dat invloedsfuncties combineert met Bayesiaanse optimalisatie om theoretisch en empirisch LLM-trainingdata-mengsels te optimaliseren voor onbekende evaluatietaken uitsluitend op basis van feedback, zonder dat voorafgaande kennis van de taakdata vereist is.

Oorspronkelijke auteurs: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

Gepubliceerd 2026-05-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhiliang Chen, Gregory Kang Ruey Lau, Chuan-Sheng Foo, Bryan Kian Hsiang Low

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Koken in het Donker

Stel je voor dat je een chef bent (de AI-ontwikkelaar) die probeert de perfecte soep te maken (het Large Language Model, of LLM). Je hebt een voorraadkast vol met verschillende ingrediënten: Wikipedia-artikelen, wiskundeleerboeken, medische tijdschriften en trivia-vragen.

Meestal moet je om de beste soep te maken precies weten wat je klanten willen eten. Als ze van pittig eten houden, voeg je meer chili toe. Als ze iets gezonds willen, voeg je meer groenten toe.

Maar hier zit de vangst: In de echte wereld weet je vaak niet wat je klanten willen voordat je hen bedient.

  • Misschien chatten je klanten met je AI in een privé, versleutelde kamer. Je kunt niet zien wat ze zeggen (de "onzichtbare evaluatietaken").
  • Je krijgt alleen ruwe, grove feedback nadat ze gegeten hebben: een sterrenbeoordeling, een duim omhoog/omlaag, of hoe lang ze in de chat bleven. Je krijgt geen gedetailleerde receptkritiek; je krijgt alleen een vaag "Het was oké" of "Het was geweldig".

Het paper vraagt zich af: Hoe kom je achter het perfecte mengsel van ingrediënten (trainingsdata) als je de borden van de klanten niet kunt zien, alleen hun vage beoordelingen?

De Oude Manier: Gissen en Controleren

Vroeger waren methoden om dit op te lossen als het proberen om het beste soeprecept te vinden door:

  1. Blind gissen: Elke mogelijke combinatie van ingrediënten proberen (te duur en te traag).
  2. Aannemen dat je de klanten kent: Geavanceerde wiskunde gebruiken die vereist dat je de daadwerkelijke bestellingen van de klanten ziet (wat je niet kunt doen vanwege privacy).
  3. Willekeurige "goede" ingrediënten kiezen: Hoogwaardige datapunten selecteren zonder te weten of ze passen bij de specifieke smaak van de klant.

Deze methoden faalden in dit specifieke "blinde" scenario omdat ze meer informatie nodig hadden dan de chef mocht hebben.

De Oplossing: DUET (De Slimme Proeflus)

De auteurs introduceren DUET, een nieuwe methode die fungeert als een slimme, iteratieve proeflus. Het combineert twee krachtige technieken:

1. De "Globale" Proever (Bayesiaanse Optimalisatie)

Denk hierbij aan een slimme kompas. In plaats van willekeurig te gissen, kijkt het kompas naar je eerdere beoordelingen (feedback) en zegt: "Hé, de vorige keer dat we meer wiskundebundels toevoegden, ging de beoordeling omhoog. Laten we proberen nog meer wiskunde toe te voegen en minder trivia."

  • Het weet niet het exacte recept, maar het leert de richting om te bewegen op basis van de ruwe feedback (de sterrenbeoordelingen).
  • Het werkt voortdurend zijn kaart bij van "wat werkt" op basis van de feedbacklus.

2. De "Lokale" Chef's Mes (Data Selectie)

Zodra het kompas zegt: "Laten we 60% wiskunde en 40% wetenschap proberen", moet je nog steeds kiezen welke specifieke wiskunde- en wetenschapspagina's je gaat gebruiken. Je wilt geen pagina's gebruiken met typefouten of saai inhoud.

  • DUET gebruikt een techniek genaamd Invloedfuncties (IF). Stel je dit voor als een kwaliteitsfilter.
  • Voordat je zelfs maar begint te koken, scant het filter je voorraadkast met wiskunde en wetenschap en markeert de "beste" pagina's (deze die het model het meest helpen leren) en de "slechtste" pagina's (ruis of onzin).
  • Wanneer het kompas zegt dat je 60% wiskunde moet gebruiken, snijdt het mes de beste 60% van de wiskundepagina's eruit en negeert het de rommel.

Hoe DUET Samenwerkt

DUET is een Globaal-naar-Lokaal algoritme. Het werkt in een cyclus:

  1. Globale Stap: De "Slimme Kompas" (Bayesiaanse Optimalisatie) kijkt naar de feedback van de vorige ronde en suggereert een nieuw mengsel van ingrediënten (bijvoorbeeld: "Probeer 50% Wikipedia, 50% Nieuws").
  2. Lokale Stap: De "Kwaliteitsfilter" (Data Selectie) pakt de absolute beste pagina's uit Wikipedia en Nieuws om dat mengsel te matchen.
  3. Koken: De AI wordt getraind op dit nieuwe, hoogwaardige mengsel.
  4. Feedback: De AI wordt ingezet. Gebruikers interageren ermee (in het donker/versleuteld). Het systeem verzamelt de ruwe beoordelingen.
  5. Herhalen: Het kompas gebruikt die nieuwe beoordelingen om een nog beter mengsel voor de volgende ronde te suggereren.

Waarom Het Speciaal Is

  • Het werkt in het donker: Het hoeft de daadwerkelijke gebruikersgesprekken niet te zien. Het heeft alleen de "sterrenbeoordelingen" nodig.
  • Het gaat om met ruis: Gebruikersbeoordelingen zijn vaak inconsistent (de ene persoon geeft 5 sterren, een andere geeft 3 voor hetzelfde antwoord). DUET is ontworpen om de ruis te negeren en het echte signaal te vinden.
  • Het is efficiënt: In plaats van elke mogelijke recept te proberen, verengt het snel tot het beste.

De Resultaten

De auteurs hebben DUET getest op verschillende taken, waaronder:

  • In-Domain: Taken waarbij de trainingsdata overeenkomt met de test (bijvoorbeeld: trainen op TruthfulQA en testen op TruthfulQA).
  • Out-of-Domain: Taken waarbij de trainingsdata verschilt van de test (bijvoorbeeld: trainen op Wikipedia en Wiskunde, maar testen op medische vragen).

De Bevinding: Zelfs wanneer de testtaak volledig verschilde van de trainingsdata (Out-of-Domain), bedacht DUET dat het mixen van bepaalde "ongebonden" data (zoals algemene Wikipedia-tekst) de AI eigenlijk hielp om medische vragen beter te beantwoorden. Het presteerde beter dan alle andere methoden die probeerden data te mixen zonder deze feedbacklus.

De Conclusie

DUET is als een chef die de klanten niet kan zien, maar wel hun applaus kan horen. Door te luisteren naar het applaus en een slim filter te gebruiken om de beste ingrediënten te kiezen, kan de chef uiteindelijk de perfecte soep koken, zelfs zonder ooit het menu te hebben gezien.

Opmerking over Beperkingen: Het paper richt zich specifiek op fine-tuning (een bestaande AI nieuwe trucs leren) en beweert niet dat deze methode werkt voor pre-training (een AI vanaf nul leren) of klinisch medisch gebruik, hoewel de auteurs suggereren dat het in de toekomst potentieel aangepast zou kunnen worden voor pre-training.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →