← Nieuwste papers
💬 NLP

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

Dit artikel introduceert ML2B, de eerste benchmark voor het evalueren van cross-linguale machine learning pipeline-generatie door grote taalmodellen, die 490 taak-taalparen over 14 talen gebruikt om aan te tonen dat prestatievermindering sterk taakafhankelijk is in plaats van de traditionele hulpbronnenhiërarchieën te volgen.

Oorspronkelijke auteurs: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

Gepubliceerd 2026-07-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je een superintelligente robot kunt vragen om een machine learning-model voor je te bouwen, simpelweg door een eenvoudige opdracht te typen zoals: "Voorspel welke klanten onze nieuwe schoenen zullen kopen." Een lange tijd waren deze robots — Large Language Models (LLM's) genoemd — hier ongelooflijk goed in, maar alleen als je met hen in het Engels spreekt. Het is alsof je een briljante chef hebt die een vijfsterrenmaaltijd kan koken als je het recept in het Engels geeft, maar als je hem een recept in het Frans, Spaans of Japans overhandigt, staart hij misschien alleen maar naar de ingrediënten en brandt hij de keuken af.

Dit is het probleem waar onderzoekers zich mee bezighouden: naarmate AI zich over de hele wereld verspreidt, moeten we weten of deze digitale chefs daadwerkelijk instructies kunnen opvolgen in elke taal, en niet alleen in de taal waarin ze voornamelijk zijn getraind. Maar er is een addertje onder het gras. Als we ze simpelweg vragen om puzzels op te lossen die al op het internet staan, kunnen de robots de antwoorden uit hun trainingsdata hebben gememoriseerd, waardoor ze slimmer lijken dan ze werkelijk zijn. Het is alsof je een student een wiskundetoets geeft waarvan hij de antwoorden al heeft gezien; hij krijgt een A, maar we weten niet of hij daadwerkelijk algebra begrijpt. Om een echt beeld te krijgen, hebben we een test nodig die fris, eerlijk en gesproken wordt in vele verschillende talen.

Maak kennis met ML2B, een nieuwe "examen"-vorm die is gecreëerd door een team van onderzoekers om te testen hoe goed deze AI-robots volledige machine learning-pipelines kunnen bouwen wanneer de instructies in 14 verschillende talen zijn. Denk aan ML2B als een enorme, meertalige kookwedstrijd. In plaats van de robots alleen te vragen om een enkele regel code te schrijven, gaven de onderzoekers ze 35 echte werelduitdagingen — zoals het voorspellen van huizenprijzen, het identificeren van hondenrassen of het opsporen van giftige reacties — en vertaalden de instructies naar talen variërend van Arabisch en Chinees tot Kazach way en Oekraïens.

Om ervoor te zorgen dat de robots niet konden valsspelen door antwoorden te memoriseren, voegde het team 10 "geheime" wedstrijden toe waarvan de oplossingen nooit openbaar zijn gemaakt. Ze bouwden ook een speciale, geïsoleerde digitale keuken (een netwerk-geïsoleerde container) waar de robots hun code moesten bereiden. Als de robot probeerde een vooraf gemaakt gerecht van het internet te sluipen of een recept gebruikte waarbij de ingrediënten werden door elkaar gehusseld voordat ze werden bereid (een probleem dat bekend staat als "data leakage"), zou het systeem hen betrappen. De robots moesten strikte regels volgen, zoals het scheiden van de "trainingsfase" van de "voorspellingsfase", net zoals een echte chef de uiteindelijke gerechten niet zou proeven voordat ze volledig zijn bereid.

Toen de onderzoekers de tests uitvoerden met top-tier AI-modellen, ontdekten ze iets verrassends dat de aannames van velen uitdaagt. Ze verwachtten dat robots het meest zouden worstelen met "low-resource" talen (talen met minder beschikbare digitale data) en het best zouden presteren met "high-resource" talen zoals Engels of Frans. Maar de resultaten lieten zien dat de taal zelf niet de belangrijkste baas was. In plaats daarvan hing de moeilijkheid volledig af van wat de robot werd gevraagd te doen. Soms presteerde een robot beter in een "low-resource" taal dan in het Engels, en op andere momenten stortte hij volledig in in een "high-resource" taal.

De studie suggereert dat de echte flessenhals niet alleen het kennen van de woorden is, maar het volgen van de complexe, stapsgewijze instructies voor het bouwen van een machine learning-model. De onderzoekers ontdekten dat de robots vaak niet faalden omdat ze de taal niet begrepen, maar omdat ze de structuur van de code verpestten — zoals het vergeten van een haakje sluiten of het gebruik van een tool die niet bestond in de versie van de software die ze gebruikten. Eén model, GPT-4.1-mini, was erg goed in het bedenken van hoogwaardige ideeën, maar faalde vaak in het correct voltooien van de taak, terwijl een ander, GPT-OSS-120b, betrouwbaarder was in het volgen van de regels maar soms simpelere resultaten produceerde.

Uiteindelijk onthult ML2B dat we niet zomaar kunnen aannemen dat een AI goed is in alles, alleen omdat hij vele talen spreekt. Het vermogen om complexe hulpmiddelen te bouwen hangt sterk af van de specifieke taak die voorhanden is, en niet alleen van de taal waarin erom wordt gevraagd. Door deze nieuwe benchmark voor het publiek open te stellen, hopen de auteurs dat ontwikkelaars robots kunnen bouwen die niet alleen meertalig zijn, maar ook echt robuust en betrouwbaar, ongeacht de taal waarin ze worden gevraagd te spreken of het probleem dat ze moeten oplossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →