← Nieuwste papers
🤖 AI

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

Deze studie evalueert het gebruik van gerenderde code-afbeeldingen als een strategie voor tokencompressie voor repository-niveau programmeeragenten, waarbij wordt vastgesteld dat hoewel het effectief de promptkosten verlaagt en de reparatie-accuratesse behoudt, de voordelen voorwaardelijk zijn en beperkt worden door de capaciteiten van het onderliggende model en de specifieke fasen van de reparatiewerkstroom.

Oorspronkelijke auteurs: Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

Gepubliceerd 2026-08-11
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers lijken op ongelooflijk snelle, superintelligente bibliothecarissen die in een seconde miljoenen boeken kunnen lezen. Deze "AI-agenten" worden geleerd om kapotte code in enorme softwareprojecten te repareren, optredend als digitale monteurs voor het internet. Maar er is een addertje onder het gras: deze bibliothecarissen raken overweldigd als je ze in één keer een hele bibliotheek geeft. Ze moeten de tekst regel voor regel lezen, en hoe meer tekst ze moeten verwerken, hoe meer dit kost aan tijd en geld. Onlangs ontdekten wetenschappers een truc: in plaats van de bibliothecaris een muur van tekst te geven, kun je een foto van de code maken. Het is alsof je een lange roman verandert in één enkele, dichte afbeelding. Deze "visuele compressie" bespaart ruimte, maar helpt het de bibliothecaris ook echt om het boek te repareren, of maakt het de foto gewoon te wazig om te lezen?

Deze vraag staat centraal in een nieuwe studie door onderzoekers van de Hong Kong University of Science and Technology en ByteDance. Ze wilden weten of het veranderen van code in afbeeldingen een magische afkorting is voor AI-agenten die software proberen te repareren, of dat het slechts een slim trucje is dat tegen een muur aanloopt wanneer het werk serieus wordt. Ze vroegen de AI niet alleen om naar een plaatje te "kijken"; ze plaatsten de AI in een realistisch scenario waarin het door een rommelig digitaal magazijn moest zoeken, het kapotte onderdeel moest vinden, het moest repareren en moest bewijzen dat het werkte. Hun bevindingen suggereren dat hoewel het maken van een foto van de code veel geld bespaart, het de AI niet slimmer maakt, en dat de AI soms in de war raakt als je de foto te strak samenperst.

Het Experiment: Van Tekst naar Pixels

Om dit te testen, zetten de onderzoekers een digitale hindernisbaan op met behulp van een beroemde benchmark genaamd SWE-bench Verified. Denk aan dit als een gigantisch, real-world videospelniveau waarin de AI daadwerkelijke bugs in echte softwareprojecten moet oplossen. De AI-agent moest drie hoofdzaken doen:

  1. Zoeken: Het juiste bestand vinden in een enorme codebase (zoals het zoeken naar een specifieke naald in een hooiberg).
  2. Bewerken: De code aanpassen om de bug te repareren.
  3. Verifiëren: Tests uitvoeren om te control je of de reparatie daadwerkelijk heeft gewerkt en niet iets anders heeft kapotgemaakt.

De onderzoekers vergeleken twee manieren om de AI de "aanwijzingen" te geven die het nodig had:

  • De Tekst-manier: De AI leest de code regel voor regel, precies zoals een mens een boek leest.
  • De Visuele Manier: De code wordt omgezet in een afbeelding (een gerenderde screenshot), en de AI kijkt naar de foto om de code te begrijpen.

Ze testten dit met verschillende niveaus van "compressie". Stel je voor dat je een foto maakt van een pagina met tekst. Je kunt de foto kleiner maken (comprimeren) om ruimte te besparen. De onderzoekers probeerden de foto's steeds kleiner te maken (compressieverhoudingen van 1, 3, 5 en 7) om te zien hoeveel ruimte ze konden besparen voordat de AI de code niet meer begreep.

De Resultaten: Een Gemengd Beeld van Besparingen en Moeite

De studie onthulde een fascinerend, enigszins complex beeld. Dit is wat zij vonden:

1. De Geldbespaarder (Maar Geen Magische Stok)
Het omzetten van code in afbeeldingen bespaart absoluut geld. De onderzoekers ontdekten dat het gebruik van visuele representaties consequent het aantal "tokens" (de eenheden data die de AI verwerkt) verminderde dat de AI moest lezen. In sommige gevallen bespaarde dit tot wel 2,8 keer de hoeveelheid data vergeleken met het lezen van ruwe tekst. Echter, deze besparing verliep niet in een rechte lijn. Je zou kunnen denken dat als je de afbeelding 7 keer compresseert, je ook 7 keer geld bespaart. Maar zo werkt het niet. De besparingen bereikten zeer snel een "vloer". Voor kleine stukjes code kromp de omvang van de afbeelding nauwelijks, ongeacht hoe hard je probeert te comprimeren, omdat de afbeelding nog steeds groot genoeg moet zijn om leesbaar te blijven. Het is als het proberen te verkleinen van een postzegel; uiteindelijk kun je hem niet kleiner maken zonder de postzegel onleesbaar te maken.

2. De Accuratesse-valstrik
De belangrijkste bevinding was dat geld besparen de AI niet slimmer maakte. Het vermogen van de AI om daadwerkelijk de bugs op te lossen (de nauwkeurigheid) bleef ongeveer gelijk, of hij nu tekst las of naar plaatjes keek.

  • Wanneer de AI de hele taak vanaf het begin moest doen (zoeken, lezen, repareren), werkte de visuele methode net zo goed als de tekstmethode, maar dan goedkoper.
  • Echter, als de onderzoekers de AI dwongen de afbeeldingen te veel te comprimeren (agressieve compressie), begon de AI meer fouten te maken. De plaatjes werden te wazig of te vol, waardoor de AI de details die hij nodig had om de code te repareren, niet meer kon zien.

3. Het "Zoek" versus "Fix"-probleem
De onderzoekers deelden de taak van de AI op in twee duidelijke fasen om te zien waar de visuele truc precies hielp:

  • De Locator (De Zoeker): Dit deel van de AI zoekt naar waar de bug zich bevindt. Hier waren visuele afbeeldingen zeer nuttig. Omdat de AI veel ruwe code moest lezen om de naald in de hooiberg te vinden, bespaarde het omzetten van die code in een compacte afbeelding een enorme hoeveelheid data.
  • De Editor (De Fixer): Zodra de bug is gevonden, moet de AI de code daadwerkelijk aanpassen en tests draaien. Hier hielp de visuele truc niet veel. De onderzoekers ontdekten dat zelfs als de AI precies wist waar de bug zat, het moeilijkste deel het "trial and error"-proces van het repareren was. De AI moest bewerken, testen, falen, opnieuw bewerken, opnieuw testen, enzovoort. Dit proces zit vol met heen-en-weer gesprekken en testen, en daar profiteert men niet veel van het comprimeren van de initiële code-afbeelding. Sterker nog, voor deze "reparatiestappen" werd de kostenpost gedomineerd door het testen en bewerken, niet door het lezen.

Het Eindoordeel: Een Nuttig Instrument, Maar Geen Panacee

Dus, kunnen coding-agenten problemen op repository-niveau oplossen met gerenderde code? Ja, maar onder voorwaarden.

De studie sugggeelt dat het omzetten van code in afbeeldingen een levensvatbare strategie is om kosten te drukken, vooral wanneer de AI veel tijd besteedt aan het simpelweg lezen en zoeken door enorme hoeveelheden tekst. Het is alsof je de bibliothecaris een foto van de index van het boek geeft in plaats van het hele boek, om zo een paginanummer te vinden. Het is sneller en goedkoper.

Het is echter geen magische oplossing die de AI oneindig veel beter maakt.

  • Het repareert de onderliggende intelligentie van de AI niet; als een AI slecht is in het oplossen van bugs, zal hij nog steeds slecht zijn in het oplossen van bugs, zelfs als hij een plaatje ziet.
  • Het heeft een limiet. Als je de afbeelding te klein probeert te maken om nóg meer geld te besparen, raakt de AI in de war en daalt de nauwkeurigheid.
  • Het helpt vooral in de "zoekfase". Zodig de AI weet waar het probleem zit, wordt het echte werk van het repareren (bewerken en testen) de bottleneck, en helpt visuele compressie daar niet veel.

Kortom, de onderzoekers concluderen dat visuele code een geweldig "conditioneel" instrument is. Het is een slimme manier om geld te besparen op het saaie, zware werk van het lezen van code, maar het vervangt niet de noodzaak van een slimme, zorgvuldige editor die het eigenlijke reparatiewerk moet uitvoeren. De toekomst van AI-coding gaat niet alleen over het kleiner maken van de input; het gaat erom te weten wanneer je een foto gebruikt en wanneer je bij de tekst blijft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →