← Nieuwste papers
💻 computer science

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

Deze studie toont aan dat het agressief gekwantiseerde Kimi-K2.5-model, ondanks een lagere SWE-Bench-score, een complex React Native-applicatieproject succesvol genereert op een GH200-hardware, terwijl het bovendien nieuwe inzichten biedt over temperatuur-instellingen, redeneringslekkage en de kloof tussen native en web-API's.

Oorspronkelijke auteurs: Alex Potanin

Gepubliceerd 2026-04-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alex Potanin

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een groep van vijf zeer slimme, maar verschillende architecten (de AI-modellen) hebt. Je geeft ze allemaal precies hetzelfde opdracht: "Bouw een app waarin mensen hun dagelijkse kangoeroe-tellingen kunnen bijhouden, met een inlogfunctie, en die ook op een website werkt."

Je hebt een superkrachtige bouwmachine (een NVIDIA GH200 server) en een weekend de tijd. De vraag is: wie bouwt de beste, werkende app?

Dit onderzoek van Alex Potanin is het verslag van dat experiment. Het belangrijkste wat hij ontdekte, is dat de officiële ranglijsten (zoals de SWE-Bench, die vaak wordt gebruikt om te zeggen welke AI het slimst is) volledig misleidend waren.

Hier is wat er gebeurde, vertaald in simpele taal en met een paar creatieve vergelijkingen:

1. De Ranglijst vs. De Werkelijkheid

In de wereld van AI kijken mensen vaak naar cijfers op een scorebord (zoals SWE-Bench) om te beslissen welke AI ze moeten gebruiken. Het was alsof je een Formule 1-auto kiest puur op basis van wie de snelste ronde op een testcircuit reed.

  • De verwachting: De modellen die op die scoreborden bovenaan stonden (zoals GLM-5.1 en DeepSeek-V3.2), zouden de beste apps moeten bouwen.
  • De realiteit: De winnaar was Kimi-K2.5, een model dat op de scoreborden niet eens de absolute nummer 1 was.
  • De les: Een hoge score op een theoretische test betekent niet dat de AI ook een goed, werkend product levert in de echte wereld.

2. De Drie "Bouwfouten" die niemand zag aankomen

Tijdens het bouwen van de app kwamen er drie vreemde problemen naar voren die niets met de slimheid van de AI te maken hadden, maar wel met hoe we ze gebruiken:

  • De "Te Stille" Motor (Temperatuur 0):
    Sommige slimme AI's (de "redenerende" modellen) hebben een beetje chaos nodig om te denken. De software die de opdracht gaf (Aider) stelde de AI echter op "temperatuur 0" (alles moet perfect voorspelbaar zijn). Voor deze specifieke AI's was dat alsof je een Formule 1-auto start met de handrem erop: de motor draaide, maar de auto bewoog niet. De AI bleef hangen in een denkproces zonder iets te produceren. Pas toen ze de "chaos" (temperatuur) wat omhoog draaiden, ging het werk.
  • De "Verkeerde Adresbrieven" (Lekken in de tekst):
    De AI's moeten hun werk in bestanden opslaan. Soms begint een slimme AI echter met een gedachte: "Laten we beginnen met App.js..." en schrijft dat direct op de lijn waar het bestandsnaam zou moeten staan. De software dacht toen dat de bestandsnaam "Laten we beginnen met App.js..." was, in plaats van gewoon App.js. Het resultaat? De app werd in een verkeerde map gezet en kon nooit starten. Het was alsof een postbode een brief in een doosje stopt met de naam van de geadresseerde, maar de doos zelf vergeten te labelen.
  • De "Stille Alarmklok" (Web vs. Mobiel):
    De opdracht was: "Maak het werkend op het web." Alle AI's gebruikten echter een standaard knop voor waarschuwingen die alleen op telefoons werkt. Op een website gebeurt er niets als je op die knop drukt. Het was alsof je een brandalarm installeert dat alleen in de kelder werkt, terwijl de brand in de woonkamer is. De code zag er perfect uit, maar de app deed niets wat de gebruiker zag.

3. De Winnaar: De "Kleine" vs. De "Grote"

De echte verrassing was wie er won:

  • De Reuzen (GLM-5.1, DeepSeek): Deze modellen waren enorm groot en zwaar (hadden veel "hersencellen" nodig). Ze maakten grote fouten: de ene bouwde een te ingewikkeld systeem dat je zelf moest configureren (te veel werk voor de gebruiker), de andere bouwde een app die technisch werkte maar de opdracht verkeerd begreep (geen dagelijkse tellingen, maar één grote teller).
  • De Winnaar (Kimi-K2.5 in 3-bit): Dit model was "gekwantiseerd" (opgeschaald en gecomprimeerd, alsof je een zware zware jas hebt omgezet in een lichte, maar warme trui). Het was kleiner en sneller. Het begreep de opdracht perfect: het bouwde een simpele, werkende app die deed wat er gevraagd werd.
    • Vergelijking: Het was alsof een ervaren timmerman (Kimi) een perfecte stoel bouwde met minder hout, terwijl een dure architect (GLM) een ontwerp maakte dat prachtig was op papier, maar waar je niet op kon zitten omdat de poten te kort waren.

4. Hardware: Waarom je geen miljardair hoeft te zijn

Het onderzoek toonde ook aan dat je geen superduurzame server (die meer kost dan een huis) nodig hebt om goede AI te draaien.

  • Er zijn twee scholen: de "Grote Schaal" (enorme modellen die zware machines nodig hebben) en de "Efficiënte Schaal" (kleinere, slimme modellen).
  • De "Efficiënte Schaal" (zoals MiniMax) gaf net zo goede resultaten als de "Grote Schaal", maar kostte 7 keer minder aan hardware.
  • Vergelijking: Je kunt een gigantische vrachtwagen huren om een pakketje te bezorgen (duur en traag), of een snelle scooter gebruiken die precies hetzelfde doet voor een fractie van de prijs.

Conclusie in één zin

Als je in 2026 een AI wilt gebruiken om software te bouwen, vertrouw dan niet blind op de officiële ranglijsten. Kijk niet naar hoe groot het model is, maar test of het de specifieke opdracht begrijpt. Soms wint de slimme, compacte "trui" de race van de zware, dure "jas".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →