← Nieuwste papers
💬 NLP

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet is een volledig open-source dataset bestaande uit meer dan 131.000 diverse Verilog-modules gekoppeld aan door AI gegenereerde natuurlijke taalbeschrijvingen, ontworpen om de capaciteiten van grote taalmodellen in hardwareontwerp te verbeteren en aan te tonen dat open-source benaderingen superieure prestaties kunnen bereiken in Verilog-codegeneratie.

Oorspronkelijke auteurs: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

Gepubliceerd 2026-06-10
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een briljante maar onervaren leerling te leren hoe je complexe digitale circuits bouwt. In de wereld van de elektronica worden deze circuits beschreven met een speciale taal genaamd Verilog. Lange tijd hadden de beste "leraren" (Large Language Models of LLM's) voor deze taak moeite, omdat ze niet genoeg goede tekstboeken hadden om uit te studeren. De meeste bestaande boeken waren opgeborgen in privébibliotheken (propriëtaire industriële data), of ze waren simpelweg te kort en vol fouten.

De paper introduceert OPENRTLSET, wat in feite de grootste, volledig gratis bibliotheek van Verilog-tekstboeken ter wereld is, specifell ontworpen om deze AI-leerlingen te trainen.

Hier is een uitsplitsing van hoe ze deze bibliotheek hebben gebouwd en wat ze hebben ontdekt, gebruikmakend van eenvoudige analogieën:

1. Het verzamelen van de grondstoffen (De Dataset)

De onderzoekers hebben niet alleen code gekopieerd en geplakt; ze bouwden een enorme collectie uit drie verschillende bronnen, zoals het verzamelen van ingrediënten uit drie verschillende tuinen:

  • De Verilog-tuin: Ze vonden meer dan 100.000 bestaande Verilog-ontwerpen op GitHub (het "open-source" internet voor code).
  • De VHDL-tuin: Ze vonden ongeveer 5.000 ontwerpen geschreven in een andere taal genaamd VHDL en vertaalden deze naar Verilog, zoals het vertalen van een Frans recept naar het Engels zodat iedereen het kan lezen.
  • De C++-tuin: Ze vonden ongeveer 24.000 ontwerpen geschreven in C/C++ (een hogere programmeertaal) en gebruikten een speciale tool om deze om te zetten naar Verilog. Denk hierbij aan het nemen van een hoogwaardig architectonisch blauwdruk en het automatisch genereren van de gedetailleerde instructies steen voor steen.

De Gouden Regel: Elk stuk code in deze bibliotheek is "open source". Dit betekent dat iedereen—studenten, onderzoekers of bedrijven—het gratis kan gebruiken zonder zich zorgen te maken over juridische beperkingen of verborgen kosten.

2. Het schrijven van de aantekeningen van de leraar (Labeling)

Ruwe code is als een stapel bakstenen; het is moeilijk te begrijpen wat het gebouw precies moet zijn zonder een beschrijving. Om dit op te lossen, gebruikten het team een super slimme AI (DeepSeek-R1) om voor elk module een beschrijving in natuurlijke taal te schrijven.

  • De "Context"-truc: Soms genereerden ze, om de AI te helpen de code beter te begrijpen, ook een "C++-versie" van het circuit naast de Verilog. Het is also eigenlijk het geven van zowel de blauwdruk als een 3D-model van het gebouw aan de student om hen te helpen de structuur beter te begrijpen.
  • Het resultaat: Ze creëerden paren van "Code + Beschrijving", waardoor een stapel bakstenen werd veranderd in een reeks lessen van het type: "Dit is wat het doet, en dit is hoe je het bouwt".

3. Het trainingskamp (Fine-Tuning)

De onderzoekers namen deze nieuwe bibliotheek en gebruikten deze om verschillende AI-modellen te trainen (zoals Qwen en Granite). Ze testten deze modellen om te zien hoe goed ze nieuwe, correcte Verilog-code vanaf nul konden genereren.

Wat ze ontdekten:

  • Meer data is beter: Wanneer ze de AI trainden op de volledige bibliotheek van 131.000 modules, werd de AI aanzienlijk beter dan wanneer ze hem alleen trainden op een kleinere sectie van 11.000 modules. Het is het verschil tussen het lezen van één hoofdstuk van een boek versus het lezen van de hele encyclopedie.
  • Kwaliteit doet ertoe: De AI die getraind was op OPENRTLSET presteerde veel beter dan AI's die getraind waren op oudere, kleinere datasets. Sterker nog, de nieuwe AI-modellen konden ongeveer 14% vaker correcte circuits genereren dan eerdere pogingen.
  • Kleine modellen kunnen winnen: Ze ontdekten dat zelfs een kleiner AI-model (8 miljard parameters), wanneer getraind op deze hoogwaardige data, de overhand kon krijgen op veel grotere, beroemde modellen die niet specifiek op deze hardware-data waren getraind.

4. De kern van het verhaal

De paper beweert dat OPENRTLSET de grootste barrière weghaalt bij het leren van AI hoe je hardware ontwerpt: het gebrek aan gratis, hoogwaardige data. Door een enorme, schone en juridisch veilige dataset te leveren, hebben ze aangetoond dat open-source benaderingen in dit specifie면 veld daadwerkelijk de propriëtaire kunnen verslaan.

Kortom, ze hebben de ultieme "trainingshandleiding" gebouwd voor AI om hardwareontwerp te leren, waarmee ze hebben bewezen dat wanneer je AI de juiste open-source tools geeft, het een meesterbouwer kan worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →