← Nieuwste papers
📊 statistics

LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

Dit artikel stelt een semiparametrisch inferentiekader vast voor low-rank tensor completion in LLM-evaluatie, waarbij efficiëntiegrenzen worden afgeleid en een score-whitening methode wordt geïntroduceerd om asymptotisch normale, onzekerheid-gekwantificeerde schatting van modelvaardigheden mogelijk te maken vanuit ruisende, ijle paarwijze vergelijkingen.

Oorspronkelijke auteurs: Jiachun Li, David Simchi-Levi, Will Wei Sun

Gepubliceerd 2026-09-04
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jiachun Li, David Simchi-Levi, Will Wei Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie is een nieuw soort statistische uitdaging ontstaan. Naarmate grote taalmodellen krachtiger worden, gaat de vraag niet langer alleen over het bouwen ervan, maar over precies weten hoe goed ze zijn. Om dit te beantwoorden, hebben platforms een methode omarmd die weerspiegelt hoe mensen leren: mensen vragen om twee reacties naast elkaar te vergelijken en te stemmen op de betere. Dit proces genereert een enorme stroom aan gegevens, maar het is rommelig. Sommige modellen worden duizenden keren vergeleken, terwijl anderen zelden worden gezien. Sommige vragen worden constant gesteld, terwijl andere worden genegeerd. Het resultaat is een ranglijst die eruitziet als een duidelijke rangschikking, maar die eigenlijk is gebouwd op een fundament van ongelijkmatige, ruisige en onvolledige informatie. Zonder een manier om de onzekerheid in deze rangschikkingen te meten, is het moeilijk te weten of een model echt is verbeterd of dat het resultaat slechts een toevalstreffer is van de data.

Onderzoekers van MIT en Purdue University hebben dit probleem aangepakt door de evaluatie van deze AI-modellen te behandelen als een puzzel van ontbrekende stukjes. Ze realiseerden zich dat het vermogen van een model niet één enkel getal is, maar een complex profiel dat verandert afhankelijk van de taak, de taal of de gebruiker. Om dit begrijpelijk te maken, stelden zij zich de prestaties van elk model in elk mogelijk scenario voor als een enorm, meerdimensionaal rooster van verborgen scores. De meeste van deze scores worden nooit direct waargenomen, omdat we een mens niet kunnen vragen om elk model tegen elk ander model in elke situatie te vergelijken. In plaats daarvan zien we alleen de uitkomst van specifieke, willekeurige confrontaties. De onderzoekers ontwikkelden een nieuw wiskundig kader om deze ontbrekende scores in te vullen, niet door simpelweg te gokken, maar door de meest waarschijnlijke waarden te berekenen terwijl ze strikt meten hoe zeker we kunnen zijn van die gokken.

De kern van hun werk adresseert een specifieke moeilijkheid die eerdere methoden over het hoofd zagen: de ongelijkmatige aard van de data. In een perfecte wereld zou elke vergelijking even informatief zijn, maar in de werkelijkheid biedt een confrontatie tussen twee zeer vergelijkbare modellen veel nuttige informatie, terwijl een confrontatie tussen een topmodel en een zwak model ons heel weinig vertelt. Bovendien is de manier waarop gegevens worden verzameld vaak bevooroordeeld naar populaire modellen of trending onderwerpen. De onderzoekers ontdekten dat standaard statistische instrumenten falen in deze omgeving omdat ze aannemen dat de data uniform is. Ze ontdekten dat de wiskundige machinerie die wordt gebruikt om deze scores te schatten, instabiel wordt wanneer de informatie eenzijdig is, wat leidt tot onbetrouwbare ranglijsten en misleidende betrouwbaarheidsintervallen.

Om dit op te lossen, introduceerde het team een techniek die ze "score whitening" noemen. Denk eraan als het aanpassen van het volume van een radio, zodat elke zender, of deze nu helder uitzendt of met ruis, evenveel bijdraagt aan het uiteindelijke geluid. Door elke vergelijking wiskundig te herschalen op basis van hoeveel informatie deze daadwerkelijk bevat, transformeerden ze de chaotische, ongelijkmatige data naar een gebalanceerde stroom. Dit stelde hen in staat om een nieuw type estimator te construeren die de rommelige realiteit van AI-evaluatie kan aanpakken. Ze bewezen dat deze methode de creatie van betrouwbaarheidsintervallen mogelijk maakt die zowel accuraat als efficiënt zijn, wat betekent dat ze zo nauwkeurig mogelijk zijn zonder de betrouwbaarheid op te offeren.

Hun bevindingen tonen aan dat door rekening te houden met de laag-rang structuur van de data — wat betekent dat modelprestaties worden gedreven door een paar onderliggende factoren zoals redeneervermogen of programmeervaardigheid in plaats van willekeurige ruis — het mogelijk is om kracht te lenen tussen verschillende taken en modellen. Dit lenen van informatie is cruciaal wanneer de data schaars is. De onderzoekers demonstreerden dat hun aanpak niet alleen werkt voor eenvoudige vragen, zoals "hoeveel beter is Model A dan Model B?", maar ook voor complexe, niet-lineaire vragen, zoals "wat is de waarschijnlijkheid dat Model A zal winnen in een specifieke categorie?".

In experimenten met zowel synthetische data als real-world data van het populaire Arena-platform, bewees de nieuwe methode haar waarde. Wanneer vergeleken met bestaande benaderingen die elke taak apart behandelen of de ongelijkmatige bemonstering negeren, produceerde de nieuwe estimator rangschikkingen met aanzienlijk kleinere foutmarges. Het slaagde erin zijn betrouwbaarheidsniveaus te kalibreren, wat betekent dat wanneer het claimde een kans van 95% correct te zijn, het ook daadwerkelijk ongeveer 95% van de tijd correct was. De studie bevestigt dat hoewel de data uit menselijke voorkeuren inherent ruisig en bevooroordeeld is, het mogelijk is om een helder, statistisch onderbouwd beeld van modelprestaties te extraheren. Dit biedt een principiële manier voor ontwikkelaars en gebruikers om niet alleen te begrijpen wie er wint, maar ook hoe zeker we kunnen zijn over de overwinning, waardoor een ruisende verzameling stemmen wordt omgezet in een betrouwbare maatstaf voor de capaciteiten van kunstmatige intelligentie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →