← Nieuwste papers
🤖 AI

RuC: HDL-Agnostic Rule Completion Benchmark Generation

Het artikel introduceert RuC, een grammatica-gedreven, taal-onafhankelijk raamwerk dat schaalbare en gedetailleerde benchmarks voor RTL-code-aanvulling genereert door syntactische gebieden te maskeren om de prestaties van Large Language Models bij hardwareontwerptaken systematisch te evalueren.

Oorspronkelijke auteurs: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

Gepubliceerd 2026-05-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een zeer slimme, maar iets letterlijke robot te leren computercode te schrijven voor hardware (zoals de chips in je telefoon of een supercomputer). De robot is een "Large Language Model" (LLM) en is uitstekend in het schrijven van verhalen of het beantwoorden van vragen, maar we moeten weten of het daadwerkelijk functionele schakelingen kan bouwen.

Dit artikel introduceert een nieuwe manier om deze robots te testen, genaamd RuC (Rule-based Completion). Hieronder wordt uitgelegd hoe dit werkt, met behulp van eenvoudige analogieën:

Het Probleem: De "Alles-of-Niets"-Test

Voor RuC was het testen van deze robots als een spelletje "Raad het Ontbrekende Stuk" spelen met twee zeer extreme opties:

  1. De "Hele Huis"-Test: Je verbergt een hele kamer van een huis en vraagt de robot om deze vanaf nul te herbouwen, uitsluitend gebaseerd op de hal er buiten. Dit is te moeilijk; de robot moet te veel raden.
  2. De "Baksteen"-Test: Je verbergt slechts één enkele baksteen in een muur en vraagt de robot om te raden welke kleur deze heeft. Dit is te makkelijk en willekeurig; de baksteen doet misschien niet eens ertoe voor de structuur.

Beide methoden konden ons niet precies vertellen hoe goed de robot de specifieke regels van het bouwen van hardware begreep.

De Oplossing: De "Grammatica-puzzel"

De auteurs hebben RuC bedacht, wat werkt als een slimme puzzelmaker. In plaats van willekeurige woorden of hele kamers te raden, gebruikt RuC de "grammatica" (het officiële regelboek) van de hardwaretaal (SystemVerilog) om puzzels te maken.

Stel je hardwarecode voor als een zin in een taal. RuC kan kiezen om te verbergen:

  • Alleen het onderwerp van de zin (bijvoorbeeld de naam van een draad).
  • Het werkwoord (bijvoorbeeld de actie die de draad uitvoert).
  • De hele bijzin (bijvoorbeeld een hele logische regel).

Dit stelt de onderzoekers in staat om puzzels van elke moeilijkheidsgraad te maken. Ze kunnen de robot vragen om een klein, simpel stukje in te vullen of een complex, meerstaps logisch blok, afhankelijk van wat ze willen testen.

Hoe de Test Werkt

  1. De Opstelling: RuC neemt echte, bestaande hardwareontwerpen (zoals de "Tiny Tapeout"-shuttle en een "CVE2"-processorcore) en breekt deze af tot hun grammaticale onderdelen.
  2. Het Masker: Het kiest een specifieke regel (zoals een "continue toewijzing" of een "case-statement") en verbergt deze, vervangend door een lege ruimte (een <MASK>).
  3. De Prompt: Het toont de robot de code voor en na de leegte, en vraagt het om het ontbrekende stuk in te vullen.
    • Analogie: Stel je voor dat je een zin leest als "De kat zat op de ___." De robot moet "mat" raden. RuC doet dit, maar dan met complexe hardwarelogica.
  4. De Controle: Zodra de robot zijn antwoord heeft geschreven, kijkt RuC niet alleen naar de woorden. Het gebruikt twee strenge controles:
    • Syntaxiscontrole: Maakt de zin grammaticaal zin? (Is de code geldig?)
    • Functiecontrole: Betekent de zin hetzelfde als het origineel? (Werkt de schakeling echt op dezelfde manier?) Ze gebruiken een "spiegel"-test: ze draaien de code van de robot en de originele code naast elkaar om te zien of ze verschillende resultaten opleveren. Als ze perfect overeenkomen, slaagt de robot.

Wat Ze Vonden

De onderzoekers testten enkele van 's werelds beste open-source AI-modellen op deze puzzels. Hier is wat ze ontdekten:

  • De "Vul-in-het-Midden"-Truc: De robots presteerden het beste wanneer de test was opgezet als een "Vul-in-het-Midden" (FIM)-puzzel. Dit is als de robot het begin en einde van een zin geven en vragen om het midden in te vullen, in plaats van te vragen om een hele nieuwe paragraaf te schrijven. Het blijkt dat de robots zo zijn getraind, dus ze zijn daar beter in.
  • Grootte Maakt Uit (Maar Niet Altijd): Over het algemeen scoorden grotere robots (grotere modellen) beter. Echter, een kleinere robot won soms van een grotere als de specifieke puzzel aansloot bij zijn sterke punten.
  • Moeilijkheid Varieert: Sommige regels waren makkelijk voor de robots (zoals het definiëren van simpele invoer), terwijl andere erg moeilijk waren (zoals complexe "als-dan"-logische blokken). Dit bewijst dat je niet zomaar kunt zeggen "De robot is goed in coderen." Je moet zeggen "De robot is goed in X, maar slecht in Y."

Waarom Dit Belangrijk Is

Het artikel concludeert dat we, om echt te begrijpen of AI ingenieurs kan helpen bij het ontwerpen van chips, tests nodig hebben die flexibel en precies zijn. We kunnen de AI niet zomaar vragen "een chip te schrijven" of "een regel te raden". We moeten specifieke regels van de taal testen, net zoals een rijexamen controleert of je kunt inparkeren, kunt invoegen op een snelweg en kunt stoppen bij een rood licht, afzonderlijk, in plaats van alleen te kijken of je een auto kunt besturen.

RuC biedt deze flexibele, regel-voor-regel testomgeving, zodat we, wanneer we uiteindelijk AI gebruiken om hardware te helpen bouwen, precies weten wat het wel en niet kan.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →