CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks
CoEval is een open-source framework dat contaminatievrije, attribuutgestuurde benchmarks genereert en een divers ensemble van beoordelingsmodellen inzet om taalmodellen voor specifieke taken betrouwbaar te rangschikken zonder dat er gelabelde data nodig zijn of vertrouwd hoeft te worden op publieke benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een hiring manager bent die de beste werknemer probeert te kiezen voor een heel specifieke baan, zoals "het organiseren van een chaotische loods" of "het schrijven van grappige grappen over tuinieren." Je hebt een probleem: je hebt geen eerdere prestatiebeoordelingen (gelabelde data) en de standaardtests die iedereen gebruikt (publieke benchmarks) zijn nutteloos omdat de kandidaten de antwoorden al hebben geleerd door ze van tevoren te bestuderen.
Dit is precies het probleem dat CoEval oplost. Het is een nieuwe, open-source tool die je helpt om AI-modellen te rangschikken voor jouw specifieke behoeften, zonder dat je menselijke experts nodig hebt om te beoordelen of je je zorgen hoeft te maken over valsspelen.
Zo werkt het, uitgelegd aan de hand van eenvoudige analogieën:
1. De "Verse Test" Generator (Geen valsspelen toegestaan)
Normaal gesproken maken AI-modellen dezelfde oude tests (zoals de SATs of de GRE) die al jaren bestaan. Omdat deze tests zo populair zijn, hebben de AI-modellen de vragen waarschijnlijk gezien tijdens hun training en hebben ze de antwoorden gewoon uit het hoofd geleerd. Het is alsof een student de antwoordsleutel uit het hoofd leert in plaats van de wiskunde echt te leren.
CoEval verandert de regels. In plaats van oude vragen te gebruiken, gebruikt het een "Teacher AI" om ter plekke gloednieuwe vragen te bedenken, gebaseerd op alleen een beschrijving van jouw taak.
- De Analogie: Stel je een docent voor die een wiskundetoets maakt terwijl de student in de kamer is. De student had de antwoorden niet kunnen uit het hoofd leren omdat de vragen pas op dat moment bestonden.
- Het Resultaat: Het paper bewijst dat deze nieuwe vragen 100% vers zijn. Ze delen geen enkele reeks van 13 woorden met grote publieke testbanken, wat betekent dat de AI niet kan valsspelen door oude data op te roepen.
2. De "Jury" van Rechters (Diversiteit boven aantallen)
Zodra de AI-modellen deze verse vragen beantwoorden, moet er iemand zijn om ze te beoordelen. Je zou één superintelligente AI kunnen vragen om ze te beoordelen, maar dat is riskant. Die enkele rechter kan vreemde vooroordelen hebben, zoals een voorkeur voor lange antwoorden boven korte, goede antwoorden, of een voorkeur voor antwoorden die lijken op die van zijn eigen familie van modellen.
CoEval gebruikt een "Jury"-aanpak. Het verzamelt een kleine groep rechters van verschillende bedrijven (bijv. één van OpenAI, één van Anthropic, één van Google).
- De Analogie: Denk aan een rechtszaal. Als je één rechter hebt die bekend staat als chagrijnig, kan het vonnis onrechtvaardig zijn. Maar als je een jury hebt van drie mensen met verschillende achtergronden, vallen hun individuele eigenaardigheden elkaar tegen. Als de ene rechter van lange antwoorden houdt en de andere ervan een hekel heeft, wordt het gemiddelde cijfer eerlijk.
- De Grote Ontdekking: Het paper vond dat wie er in de jury zit belangrijker is dan hoeveel mensen erin zitten. Het toevoegen van meer rechters van hetzelfde bedrijf vergroot alleen maar hun gedeelde vooroordeel. Een kleine, diverse groep rechters is daarentegen ontzettend betrouwbaar. Sterker nog, een enkele rechter kan soms "anti-gecorreleerd" zijn (het verkeerde antwoord geven), maar een diverse jury doet dat bijna nooit.
3. De "Geen-Mens" Fabriek
Normaal gesproken heb je mensen nodig om vragen te schrijven en antwoorden te beoordelen om een goede test te bouwen. Dit is traag en duur.
- De Analogie: CoEval is als een volledig geautomatiseerde fabriek. Je geeft het een blauwdruk (een beschrijving van jouw taak) en het doet automatisch:
- Ontwerpt de testvragen.
- Laat de AI-kandidaten de test maken.
- Stelt de diverse jury samen om de antwoorden te beoordelen.
- Spuugt een definitieve ranglijst uit.
- De Kosten: De auteurs hebben een enorme studie uitgevoerd met bijna 8.000 evaluaties voor de prijs van een kop koffie ($5,89). Het is zo goedkoop dat je elke keer dat er een nieuw AI-model uitkomt, een nieuwe test kunt draaien.
4. Waarom dit ertoe doet
Het paper testte CoEval in drie real-world scenario's waarvoor geen "juiste" antwoorden bestonden:
- Medicijninteracties: Uitzoeken of twee medicijnen met elkaar botsen.
- Klinische Redenering: Het diagnosticeren van symptomen van patiënten.
- Juridische Analyse: Het interpreteren van wetten.
In deze gebieden zijn er geen standaard "gouden standaarden" voor tests. CoEval slaagde erin de modellen te rangschikken en liet zien welke het beste waren voor deze specifieke taken. Het merkte zelfs op dat een kleiner, goedkoper model eigenlijk slechter was dan een grotere, iets wat een enkele bevooroordeelde rechter misschien gemist zou hebben.
De Kernboodschap
CoEval is een tool die zegt: "Vertrouw de oude, uit het hoofd geleerde tests niet. Vertrouw niet op een enkele rechter die bevooroordeeld kan zijn. Genereer in plaats daarvan een verse test voor jouw specifieke baan en laat een divers, klein team van AI-rechters deze beoordelen."
Het verandert het rommelige, dure proces van het testen van AI in een goedkoop, herhaalbaar en eerlijk proces dat elk team kan gebruiken om de juiste AI voor hun specifieke behoeften te vinden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.