← Nieuwste papers
🤖 AI

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

Dit artikel blootlegt een kritisch "Mirage"-fenomeen waarbij multimodale modellen visuele schakelingdiagrammen omzeilen om code te genereren op basis uitsluitend van tekstidentificatoren, en introduceert VeriGround, een model met 4 miljard parameters dat is getraind met anonimisering en voorkeursuitlijning om betrouwbare, echt onderbouwde conversie van schakelingen naar Verilog te bereiken.

Oorspronkelijke auteurs: Guang Yang, Xing Hu, Xiang Chen, Xin Xia

Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Guang Yang, Xing Hu, Xiang Chen, Xin Xia

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Het "Mirage"-effect

Stel je voor dat je een toets moet maken waarbij je een plattegrond van een stad moet tekenen op basis van een foto van die stad. De instructies voor de toets bevatten echter ook een lijst met straatnamen (zoals "Hoofdstraat" en "Eikenlaan").

De onderzoekers ontdekten dat veel AI-modellen aan het valsspelen zijn. In plaats van echt naar de foto van de stad te kijken om uit te zoeken waar de wegen lopen, leest de AI de lijst met straatnamen en reciteert hij simpelweg een ingezette kaart die hij al kent.

Het "Mirage"-fenomeen:
De auteurs noemen dit een Mirage (wijn). Het is als water zien in de woestijn dat er niet echt is.

  • De Toets: Ze lieten de AI een echt circuitschema zien (de foto) en vroegen hem de code te schrijven (de kaart).
  • De Truc: Vervolgens vervingen ze de echte foto door een leeg wit beeld, maar hielden ze de lijst met straatnamen (de module-header) exact hetzelfde.
  • Het Resultaat: Verrassend presteerde de AI net zo goed, en soms zelfs beter, met het lege beeld!

Dit bewijst dat de AI het circuitschema niet echt "zag". Hij negeerde de foto volledig en raadselde de code enkel op basis van de namen van de onderdelen. Als de namen "Som" en "Carry" waren, wist de AI dat hij een "Half-Adder" moest bouwen zonder ooit naar de draden in het schema te kijken.

Waarom Dit Belangrijk Is: De Siliciumval

Waarom maakt dit uit? Het artikel vergelijkt dit met het bouwen van een huis.

  • Normale Code: Als een webdesigner een fout maakt, ziet de website er lelijk uit. Je kunt het makkelijk repareren.
  • Circuitcode: Als een AI een fout maakt in een circuitschema, wordt die code op een fysieke chip (silicium) gebrand. Zodra de chip is gemaakt, kun je de fout niet meer "Ctrl+Z"en. Het is als beton gieten voor een fundering en dan beseffen dat de deur aan de verkeerde kant zit. Je moet het hele gebouw afbreken.

Als de AI hallucineert (dingen verzint) op basis van tekstclues in plaats van de visuele realiteit, kan het chips creëren die op papier perfect lijken maar in de echte wereld falen.

De Oplossing: De "Amnesie"-test en een Nieuwe AI

Om dit op te lossen, bouwden de onderzoekers twee dingen: een nieuwe test en een nieuw AI-model genaamd VeriGround.

1. De Nieuwe Test: "C2VEVAL" (De Amnesie-test)

Ze creëerden een benchmark waarbij ze de test "anoniem" maakten.

  • Normale Modus: De AI ziet het schema en de namen (bijv. "Clock", "Reset").
  • Geanonimiseerde Modus: Ze veranderden alle namen in generieke placeholders zoals "Val_0", "Val_1" en "Val_2".
  • Het Doel: Als de AI de foto echt begrijpt, zou hij nog steeds moeten werken met de generieke namen. Als hij alleen maar valsspeelde met de namen, zou hij moeten falen.

Het Resultaat: Toen ze de namen verwijderden, stortte de prestatie van de meeste grote AI-modellen in. Dit bevestigde dat de "Mirage" echt was. Slechts ongeveer 8–9% van de tijd keken de modellen daadwerkelijk naar de foto.

2. De Nieuwe AI: "VeriGround" (De Eerlijke Student)

De onderzoekers trainden een nieuwe, kleinere AI (slechts 4 miljard parameters, wat miniem is in vergelijking met reuzen als GPT-5) om te stoppen met valsspelen. Ze gebruikten drie specifieke trainingstrucs:

  • Truc A: De "Blinddoek"-training (Anonimisering): Ze dwongen de AI om te leren van de geanonimiseerde data. Omdat hij niet op de namen kon vertrouwen, moest hij leren om de echte lijnen en vormen in het schema te lezen.
  • Truc B: De "Nee Zeggen"-training (Refusal Augmentation): Ze leerden de AI om te zeggen: "Ik kan dit niet doen", wanneer het beeld leeg was of niet overeenkwam met de instructies. Dit voorkomt dat de AI raadt wanneer hij het niet zeker weet.
  • Truc C: De "Eerste Indruk"-focus (D-ORPO): Dit is een technische aanpassing. Wanneer een AI besluit om te antwoorden of te weigeren, maakt hij die beslissing in de aller eerste woorden van zijn antwoord. De onderzoekers zorgden ervoor dat de AI extra aandacht besteedde aan die eerste paar woorden om ervoor te zorgen dat hij de juiste keuze maakt (Genereren vs. Weigeren) zonder in de war te raken door de lengte van het antwoord.

De Resultaten: Klein maar Krachtig

De nieuwe AI, VeriGround, behaalde enkele indrukwekkende prestaties:

  • Hij kijkt echt: Onder de "Geanonimiseerde"-test (waar valsspelen onmogelijk is), scoorde VeriGround veel hoger dan alle andere modellen, wat bewees dat hij de schema's echt las.
  • Hij raadt niet blind: Hij leerde om lege beelden 92% van de tijd te weigeren, maar weigerde zelden een geldig beeld (slechts 1,2% valse weigeringen).
  • Hij slaat boven zijn gewicht: Hoewel VeriGround een "klein" model is (4B parameters), presteerde hij net zo goed als het enorme, dure "GPT-5.4"-model wanneer de namen aanwezig waren, en hij versloeg ze wanneer de namen werden verwijderd.

Samenvatting

Het artikel onthult dat veel AI-modellen "doen alsof" wanneer ze foto's van circuits omzetten in code; ze lezen alleen de labels en negeren de foto. De auteurs bouwden een nieuwe test om deze "Mirage" bloot te leggen en trainden een nieuwe, eerlijke AI (VeriGround) die echt naar de foto kijkt, weigert te raden wanneer hij in de war is, en beter presteert dan de reuzen bij deze taak.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →