← Nieuwste papers
💬 NLP

compar:IA: The French Government's LLM arena to collect French-language human prompts and preference data

Het artikel introduceert compar:IA, een open-source Frans overheidsplatform dat grootschalige, Franstalige menselijke voorkeursgegevens verzamelt via blinde paarwijze vergelijkingen om het tekort aan niet-Engelse datasets voor het trainen en evalueren van Large Language Models aan te pakken.

Oorspronkelijke auteurs: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

Gepubliceerd 2026-02-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Lucie Termignon, Simonas Zilinskas, Hadrien Pélissier, Aurélien Barrot, Nicolas Chesnais, Elie Gavoty

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de wereld van Kunstmatige Intelligentie (AI) voor als een enorme bibliotheek waar de boeken bijna volledig in het Engels zijn geschreven. Als je probeert een boek in het Frans, Spaans of een andere taal te lezen, kan het verhaal stroef aanvoelen, kunnen de personages vreemd handelen of kan het advies cultureel niet logisch overkomen. Dit gebeurt omdat de AI-"studenten" het grootste deel van hun tijd Engelse boeken hebben bestudeerd en zelden met andere talen hebben geoefend.

Om dit op te lossen, heeft de Franse regering een speciale speeltuin gebouwd genaamd compar:IA. Denk aan een gigantische, publieke blind proeverij voor AI-modellen, maar in plaats van ijsjes, proeven zij antwoorden op vragen.

Hier is hoe het werkt, onderverdeeld in eenvoudige delen:

1. De Blind Proeverij (Hoe het werkt)

Stel je voor dat je een kamer binnenloopt en twee mysterieuze chefs (AI-modellen) ziet die een antwoord bereiden op jouw vraag. Je weet nog niet wie ze zijn.

  • Stap 1: Je stelt een vraag (zoals: "Hoe bak ik een croissant?" of "Vertel me een grapje").
  • Stap 2: Beide chefs schrijven een reactie. Je leest ze naast elkaar.
  • Stap 3: Je kiest degene die je beter vindt.
  • Stap 4: Pas nadat je hebt gestemd, onthullen de chefs hun namen.

Deze "blinde" methode is cruciaal. Het voorkomt dat je een chef kiest alleen omdat je hun naam of merk herkent. Het zorgt ervoor dat de stem puur gebaseerd is op de kwaliteit van het antwoord.

2. Waarom dit bouwen? (Het probleem)

De meeste AI-trainingsdata is als een dieet van alleen Engels eten. Hierdoor worstelt AI met de Franse cultuur, straattaal en veiligheidsregels. Om een AI te leren goed te zijn in het Frans, heb je duizenden Franse mensen nodig die zeggen: "Ik vond dit antwoord leuk, maar dat andere antwoord haatte ik."

Vóór compar:IA was deze data ofwel verborgen binnen grote techbedrijven, of het bestond simpelweg niet voor Franstaligen. compar:IA is een openbare keuken waar iedereen kan helpen bij het bereiden van deze data, en vervolgens wordt het recept (de data) gratis met iedereen gedeeld.

3. De Oogst (Wat ze hebben verzameld)

Sinds de opening eind 2024 is deze digitale speeltuin druk bezig geweest. Begin 2026 hebben ze het volgende verzameld:

  • 600.000+ vragen gesteld door echte mensen.
  • 250.000+ stemmen die bepaalden welk AI-antwoord beter was.
  • 89% van de data is in het Frans, wat een enorme zaak is in een wereld die gedomineerd wordt door Engelse data.

Ze hebben niet alleen de stemmen verzameld; ze vroegen gebruikers ook om te reageren op specifieke delen van de antwoorden, wat een rijke kaart creëert van waar Franstaligen werkelijk om geven.

4. Wie gebruikt het en waarom?

  • Voor gewone mensen: Het is een gratis manier om met veel verschillende AI-modellen te chatten (sommige beroemd, andere open-source) om te zien hoe ze denken. Het laat hen ook zien hoeveel energie (elektriciteit) de AI verbruikt om een antwoord te geven, wat hen aanmoedigt om na te denken over het milieu.
  • Voor wetenschappers en bedrijven: Zij kunnen het "receptenboek" (de data) downloaden om hun eigen AI-modellen beter Frans te laten spreken.
  • Voor scholen: Leraren gebruiken het om studenten te laten zien hoe AI werkt, waarbij het platform een klaslokaal-instrument wordt waar studenten debatteren over welk AI-antwoord het eerlijkst of meest accuraat is.

5. De Spelregels (Privacy & Veiligheid)

De makers zijn zeer voorzichtig geweest met privacy.

  • Geen aanmeldingen: Je hoeft je naam of e-mailadres niet op te geven om mee te spelen. Dit verlaagt de drempel om deel te nemen, maar betekent ook dat ze later extra voorzichtig moeten zijn.
  • De Filter: Voordat enige data met het publiek wordt gedeeld, scant een slimme computer elk gesprek. Als de computer een echte naam, adres of privé-informatie tegenkomt, gooit hij het hele gesprek in de prullenbak. Het is beter om een paar datapunten te verliezen dan per ongeluk iemands geheimen te lekken.
  • Open Source: De data wordt vrijgegeven onder een Franse overheidslicentie, wat betekent dat iedereen de data kan gebruiken voor onderzoek of het bouwen van nieuwe tools, zolang ze de regels respecteren.

6. Het Scorebord

Het platform houdt ook een leaderboard bij (een ranglijst). Het is als een sportscorebord dat laat zien welke AI-modellen Fransen het meest waarderen. De auteurs waarschuwen echter dat dit geen perfecte test van "intelligentie" is. Het laat alleen zien wat mensen leuk vonden in een informele setting. Het is meer een populariteitswedstrijd dan een definitiek examen.

7. De Toekomst

Het Franse team ziet dit als een prototype. Ze werken er al aan om de "proeverij" uit te breiden naar andere talen (beginnend met Deens), zodat andere landen hun eigen publieke datatuinen kunnen bouwen.

Kortom: compar:IA is een publieke dienst die de voorkeuren van de Franse taal crowdsourcet om AI te leren hoe het spreekt, denkt en zich gedraagt als een menselijke Franstalige, terwijl het proces open, privé en gratis voor iedereen bruikbaar blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →