← Nieuwste papers
🤖 AI

InfiCoEvalChain: A Blockchain-Based Decentralized Framework for Collaborative LLM Evaluation

InfiCoEvalChain is een gedecentraliseerd blockchain-framework dat de betrouwbaarheid en stabiliteit van LLM-evaluaties verhoogt door gebruik te maken van een collectief netwerk van diverse hardware en onafhankelijke validatoren.

Oorspronkelijke auteurs: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

Gepubliceerd 2026-02-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yifan Yang, Jinjia Li, Kunxi Li, Puhao Zheng, Yuanyi Wang, Zheyan Qu, Yang Yu, Jianmin Wu, Ming Li, Hongxia Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een wedstrijd wilt organiseren om de beste kok ter wereld te bepalen. Maar er is een probleem: de jury bestaat uit slechts één persoon, die in een donkere kamer zit, met een heel eigen smaak, en die de gerechten alleen proeft op een specifieke, vreemde manier (bijvoorbeeld met een houten lepel).

Als die ene juryleden toevallig een slechte dag heeft, of als het gerecht net een fractie anders is gekruid, kan de uitslag compleet de mist in gaan. De ene dag wint de Italiaanse chef, de volgende dag de Franse, puur door de grillen van die ene persoon. Dat is precies het probleem waar de onderzoekers van InfiCoEvalChain naar kijken bij de huidige tests voor AI (zoals ChatGPT).

Hier is de uitleg van hun oplossing in begrijpelijke taal:

Het probleem: De "Eenzame Jury" (Centralisatie)

Op dit moment worden grote AI-modellen getest door een paar grote bedrijven op hun eigen computers. Dit heeft drie grote nadelen:

  1. De "Gok-factor" (Stochastiek): AI is een beetje als een mens die een verhaal vertelt; elke keer dat je het vraagt, kan het antwoord net even anders zijn. Als je maar één keer test, heb je eigenlijk een beetje geluk of pech.
  2. De "Apparatuur-bias": De ene computer is sneller of werkt anders dan de andere, wat de score van de AI kan beïnvloeden.
  3. De "Zwarte Doos": Je weet niet precies hoe de score tot stand is gekomen. Is de test wel eerlijk? Is de AI niet stiekem getraind op de vragen van de test?

De onderzoekers ontdekten dat de verschillen tussen de scores van de beste AI's soms kleiner zijn dan de "ruis" (de foutmarge) van de test zelf. Dat is alsof je een wedstrijd wint, maar de scheidsrechter zegt: "Ik weet het niet zeker, het was een heel wankele meting."

De oplossing: Het "Wereldwijde Proefpanel" (Blockchain)

In plaats van één jury in een donkere kamer, stelt InfiCoEvalChain een gigantisch, wereldwijd proefpanel voor.

1. Een democratisch proefpanel (Decentralisatie)
In plaats van één bedrijf, laten ze duizenden mensen over de hele wereld hun eigen computers gebruiken om de AI te testen. De ene test op een supercomputer in Amerika, de andere op een laptop in Nederland. Door al die verschillende "smaakjes" en computers bij elkaar op te tellen, verdwijnt de ruis. Het is alsof je niet één jury hebt, maar 10.000 mensen die allemaal een hapje nemen. De uitslag wordt daardoor veel stabieler en eerlijker.

2. De digitale notaris (Blockchain)
Hoe weet je dat die 10.000 mensen niet allemaal stiekem hetzelfde antwoord opschrijven om vals te spelen? Hier komt de blockchain om de hoek kijken. Zie de blockchain als een digitale notaris die elke stem onuitwisbaar opschrijft in een groot, openbaar logboek. Niemand kan achteraf de uitslag veranderen of een score vervalsen zonder dat iedereen het ziet.

3. De "Eerlijkheid-beloning" (Incentives)
Om mensen te motiveren om hun computer te gebruiken, is er een beloningssysteem. Maar er zit een slimme truc in: als je een antwoord geeft dat heel erg afwijkt van wat de grote meerderheid (het gemiddelde) vindt, krijg je bijna niets. Maar als je een eerlijk en nauwkeurig antwoord geeft dat past bij de consensus, verdien je beloningen. Het is een systeem dat eerlijkheid beloont en "valsspelen" of "luiheid" financieel afstraft.

Wat is het resultaat?

De onderzoekers hebben dit al getest en de resultaten zijn indrukwekkend. Waar de scores van AI voorheen alle kanten op schoten (als een nerveuze vlieg in een kamer), zijn de scores met dit nieuwe systeem heel stabiel en voorspelbaar geworden (als een rustig stromende rivier).

Kortom: InfiCoEvalChain verandert de AI-test van een "geheimzinnige wedstrijd in een afgesloten hal" naar een "transparant wereldfeest waarbij iedereen meedoet en de uitslag onweerlegbaar is."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →