← Nieuwste papers
💬 NLP

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

Deze survey definieert het opkomende veld van Multimodale Code Intelligentie door een taxonomie vast te stellen die taken categoriseert op basis van de rol van code en methoden organiseert over vier sleuteldomeinen, om uiteindelijk vier verificatie-gecentreerde richtingen voor te stellen om het veld te laten evolueren van imitatie met een enkele output naar bewijs-gegronde uitvoerbare systemen.

Oorspronkelijke auteurs: Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng
Gepubliceerd 2026-06-16
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een architect bent. In de oude dagen, als je wilde dat een bouwer een huis bouwde, moest je een zeer lange, gedetailleerde lijst met instructies schrijven: "Zet hier een deur, schilder de muur blauw, maak het raam 3 voet breed." Dit is wat de huidige AI doet met text-to-code: je beschrijft iets in woorden, en de AI schrijft de computercode om het te bouwen.

Maar dit artikel betoogt dat tekst een verschrikkelijke manier is om visuele zaken te beschrijven. Als je een bouwer een foto van een huis laat zien, begrijpt hij de indeling, de stijl en het gevoel direct. Als je diezelfde foto in woorden probeert te beschrijven, vergeet je misschien een detail, of begrijpt de bouwer de vorm van het dak verkeerd.

Dit overzicht, getiteld "Beyond NL2Code," is een enorme kaart van een nieuw veld waar AI niet alleen naar je woorden luistert, maar ook naar je foto's, diagrammen en video's kijkt om de exacte code te schrijven om het te recreëren of te besturen.

Hier is de onderverdeling van dit veld, eenvoudig uitgelegd:

1. Het Grote Idee: Van "Vertel me" naar "Laat me zien"

Het artikel zegt dat we voorbijgaan aan alleen het typen van instructies. Nu willen we dat AI een screenshot van een website bekijkt, een grafiek uit een wetenschappelijk artikel, een schets van een logo, of een video van een bewegende robot, en de exacte code schrijft om het te recreëren of te besturen.

De auteurs verdelen deze wereld in vier hoofdbuurten:

Buurt A: De Voordeur (Grafische Gebruikersinterfaces)

  • Wat het is: Het omzetten van afbeeldingen van websites of mobiele apps naar de eigenlijke code die ze laat werken.
  • De Analogie: Stel je voor dat je een foto maakt van de woonkamer van een vriend en de AI vraagt om een digitale replica te bouwen.
  • De Addertjes onder het gras: Het is makkelijk om de digitale kamer er uit te laten zien als de foto (de bank staat op de juiste plek). Maar is de bank ook echt zacht? Kun je erop zitten? Gaat de deur open? Het artikel waarschuwt dat veel AI's goed zijn in het laten kloppen van het uiterlijk, maar falen wanneer je op een knop probeert te klikken of een schuifregelaar wilt bewegen.

Buurt B: Het Laboratorium (Wetenschappelijke Visualisatie)

  • Wat het is: Het omzetten van tabellen, grafieken en wetenschappelijke diagrammen in code die bewerkbaar is en kan worden uitgevoerd.
  • De Analogie: Stel je voor dat je naar een grafiek in een tekstboek kijkt en de AI vraagt de code te schrijven die deze heeft gegenereerd.
  • De Addertjes onder het gras: Als de AI de vorm van de lijn wel goed krijgt maar de cijfers fout, ziet de grafiek er prima uit, maar is de wetenschap erachter kapot. Het artikel stelt dat we niet alleen moeten controleren of het plaatje er goed uitziet, maar of de data binnenin de afbeelding correct is.

Buurt C: De Blauwdrukwerkplaats (Gestructureerde Grafische Objecten)

  • Wat het is: Het omzetten van tekeningen in code voor zaken zoals logo's (SVG), stroomdiagrammen of 3D-engineeringontwerpen (CAD).
  • De Analogie: Stel je een schets van een brug voor. De AI moet code schrijven die niet alleen de brug tekent, maar ook begrijpt dat de balken gewicht moeten dragen en de bouten moeten passen.
  • De Addertjes onder het gras: Een tekening kan er perfect uitzien, maar als de code zegt "verbind deze twee punten" terwijl het zou moeten zeggen "verbind deze drie", kan het 3D-model instorten. De code moet een logische blauwdruk zijn, geen enkel plaatje.

Buurt D: De Nieuwe Grens (Frontier Tasks)

  • Wat het is: Het gebruiken van code om robots aan te sturen, video's te maken, of te fungeren als een "brein" dat naar een afbeelding kijkt en beslist welke tool het als volgende gebruikt.
  • De Analogie: Stel je een robot voor die een video bekijkt van een mens die koffie zet en de code schrijft om dit zelf te doen.
  • De Addertjes onder het gras: De robot kan code schrijven die zegt "schenk koffie in", maar als hij het timing of de hitte niet begrijpt, kan hij de keuken afbranden. De code moet tijd en fysica begrijpen, niet alleen het uiteindelijke beeld.

2. Het Probleem: "Het ziet er goed uit, maar is het waar?"

De belangrijkste boodschap van het artikel is een waarschuwing over evaluatie.

Op dit moment controleren de meeste mensen of een AI zijn werk goed heeft gedaan door te vragen: "Lijkt het resultaat op de foto?"

  • Het artikel zegt: Dit is alsof je een essay van een student beoordeelt door alleen naar de lettergrootte te kijken en de spelling te negeren.
  • De Realiteit: Een AI kan code genereren die een prachtige grafiek produceert die er precies zo uitziet als jij wilde, maar de cijfers binnenin zijn volledig verzonnen. Of het kan een website bouwen die er geweldig uitziet, maar crasht zodra je op een knop klikt.

3. De Oplossing: Een Nieuwe Manier van Testen

De auteurs stellen voor dat we stoppen met alleen de "eindfoto" te controleren en in plaats daarvan het proces gaan controleren. Ze suggereren vier nieuwe manieren om te verifiëren of de AI daadwerkelijk slim is:

  1. Multi-Signaal Validatie: Controleer niet alleen het plaatje. Controleer tegelijkertijd de data, de codestructuur en de interactiviteit.
  2. Multi-State Verificatie: Controleer niet alleen het startpunt. Klik op de knoppen, verander de grootte van de vensters en kijk de video af. Werkt het nog steeds?
  3. Cross-Task Transfer: Als de AI leert om een grafiek te tekenen, kan hij diezelfde logica gebruiken om een stroomdiagram te tekenen? Of memoriseert hij alleen de specifieke grafiek die hij zag?
  4. Verifieerbare Agent-Traces: Als de AI handelt als een robot of een browser-agent, moeten we zijn "denkproces" kunnen zien. Heeft hij naar het juiste deel van de afbeelding gekeken om zijn beslissing te nemen?

Samenvatting

Beschouw dit artikel als een gids voor een nieuw tijdperk van AI. We bewegen van AI die luistert (Text-to-Code) naar AI die ziet (Multimodal Code).

De auteurs zeggen: "We hebben de technologie om AI naar een plaatje te laten kijken en code te laten schrijven. Maar op dit moment zijn we te veel gefocust op de vraag of de afbeelding er mooi uitziet. We moeten beginnen met controleren of de code daadwerkelijk werkt, of de data echt is, en of de robot de tafel niet kapot maakt. We moeten betere tests bouwen die naar het hele plaatje kijken, en niet alleen naar de oppervlakte."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →