← Últimos artículos
💬 NLP

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet es un conjunto de datos totalmente de código abierto que comprende más de 131.000 diversos módulos Verilog emparejados con descripciones de lenguaje natural generadas por IA, diseñado para avanzar en las capacidades de los modelos de lenguaje extensos en el diseño de hardware y demostrar que los enfoques de código abierto pueden lograr un rendimiento superior en la generación de código Verilog.

Autores originales: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

Publicado 2026-06-10
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un aprendiz brillante pero inexperto cómo construir circuitos digitales complejos. En el mundo de la electrónica, estos circuitos se describen utilizando un lenguaje especial llamado Verilog. Durante mucho tiempo, los mejores "maestros" (Modelos de Lenguaje Extensos o LLM) para esta tarea estaban teniendo dificultades porque no tenían suficientes libros de texto buenos para estudiar. La mayoría de los libros existentes estaban guardados en bibliotecas privadas (datos industriales patentados) o eran demasiado cortos y llenos de errores.

El artículo presenta OPENRTLSET, que es esencialmente la biblioteca de libros de texto de Verilog más grande del mundo, completamente gratuita, diseñada específicamente para entrenar a estos aprendices de IA.

Aquí tienes un desglose de cómo construyeron esta biblioteca y lo que descubrieron, utilizando analogías sencillas:

1. Recolección de las materias primas (El conjunto de datos)

Los investigadores no se limitaron a copiar y pegar código; construyeron una colección masiva de tres fuentes diferentes, como recolectar ingredientes de tres jardines distintos:

  • El Jardín de Verilog: Encontraron más de 100,000 diseños de Verilog existentes en GitHub (el internet de "código abierto" para el código).
  • El Jardín de VHDL: Encontraron alrededor de 5,000 diseños escritos en un lenguaje diferente llamado VHDL y los tradujeron a Verilog, como traducir una receta francesa al inglés para que todos puedan leerla.
  • El Jardín de C++: Encontraron alrededor de 24,000 diseños escritos en C/C++ (un lenguaje de programación de alto nivel) y utilizaron una herramienta especial para convertirlos en Verilog. Piensa en esto como tomar un plano arquitectónico de alto nivel y generar automáticamente las instrucciones detalladas ladrillo por ladrillo.

La Regla de Oro: Cada pieza de código en esta biblioteca es de "código abierto". Esto significa que cualquier persona —estudiantes, investigadores o empresas— puede usarla de forma gratuita sin preocuparse por restricciones legales o tarifas ocultas.

2. Escribiendo las notas del maestro (Etiquetado)

El código bruto es como una pila de ladrillos; es difícil entender qué se supone que debe ser el edificio sin una descripción. Para solucionar esto, el equipo utilizó una IA superinteligente (DeepSeek-R1) para escribir una descripción en lenguaje natural para cada módulo.

  • El truco del "Contexto": A veces, para ayudar a la IA a entender mejor el código, también generaron una versión en "C++" del circuito junto con el Verilog. Es como darle al estudiante tanto el plano como un modelo 3D del edificio para ayudarle a comprender mejor la estructura.
  • El Resultado: Crearon pares de "Código + Descripción", convirtiendo una pila de ladrillos en un conjunto de lecciones de "Aquí está lo que esto hace, y aquí está cómo construirlo".

3. El campamento de entrenamiento (Ajuste fino)

Los investigadores tomaron esta nueva biblioteca y la utilizaron para entrenar varios modelos de IA diferentes (como Qwen y Granite). Probaron estos modelos para ver qué tan bien podían generar nuevo código Verilog desde cero.

Lo que descubrieron:

  • Más datos es mejor: Cuando entrenaron a la IA con la biblioteca completa de 131,000 módulos, la IA mejoró significamente en comparación con cuando solo la entrenaron con una porción más pequeña de 11,000 módulos. Es como la diferencia entre leer un capítulo de un libro y leer toda la enciclopedia.
  • La calidad importa: La IA entrenada con OPENRTLSET funcionó mucho mejor que las IA entrenadas con conjuntos de datos más antiguos y pequeños. De hecho, los nuevos modelos de IA podían generar circuitos correctos aproximadamente un 14% más a menudo que los intentos anteriores.
  • Los modelos pequeños pueden ganar: Descubrieron que incluso un modelo de IA más pequeño (8 mil millones de parámetros), cuando se entrena con estos datos de alta calidad, puede superar a modelos mucho más grandes y famosos que no han sido entrenados con este tipo de datos de hardware específicos.

4. La conclusión

El artículo afirma que OPENRTLSET elimina la mayor barrera para enseñar a la IA cómo diseñar hardware: la falta de datos gratuitos y de alta calidad. Al proporcionar un conjunto de datos masivo, limpio y legalmente seguro, han demostrado que los enfoques de código abierto pueden superar a los patentados en este campo específico.

En resumen, construyeron el "manual de entrenamiento" definitivo para que la IA aprenda diseño de hardware, demostiendo que cuando le das a la IA las herramientas de código abierto adecuadas, puede convertirse en un maestro constructor.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →