← Últimos artículos
🤖 AI

NoTB: Oracle-Free Triage of LLM-Generated RTL via Cross-Model Formal Consensus

El artículo presenta NoTB, un marco de trabajo libre de oráculo que aprovecha la verificación de equivalencia secuencial a través de múltiples diseños RTL generados por LLM para establecer una señal de consenso formal, permitiendo un triaje de alta precisión de la corrección funcional sin depender de bancos de pruebas o referencias doradas.

Autores originales: Elisavet Lydia Alvanaki, Je Yang, Biruk Seyoum, Luca P. Carloni

Publicado 2026-08-25
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Elisavet Lydia Alvanaki, Je Yang, Biruk Seyoum, Luca P. Carloni

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo del diseño de chips informáticos, los ingenieros tradicionalmente escriben código que describe cómo debe fluir la electricidad a través de un circuito. Este código, conocido como nivel de transferencia de registros o RTL, actúa como un plano para el hardware físico. Durante décadas, la creación de este código ha sido un proceso meticuloso impulsado por humanos, donde cada línea se verifica contra una referencia confiable para asegurar que el chip funcione correctamente. Recientemente, la inteligencia artificial ha comenzado a escribir este código por nosotros. Los modelos de lenguaje extensos, el mismo tipo de tecnología que puede escribir historias o responder preguntas, ahora se están utilizando para generar estos complejos planos de hardware a partir de descripciones de texto simples. Si bien estos modelos pueden producir muchas versiones de un diseño rápidamente, persiste un problema crítico: ¿cómo saben los ingenieros cuáles de estos diseños generados por IA realmente funcionan? En el pasado, la respuesta era comparar la salida de la IA contra una referencia perfecta hecha por humanos o ejecutarla a través de una prueba de simulación. Sin embargo, la creación de estas referencias perfectas es costosa y lenta, y las pruebas mismas a veces pueden pasar por alto errores ocultos.

Un equipo de investigadores de la Universidad de Columbia ha introduido una nueva forma de clasificar estos diseños generados por IA sin necesidad de una referencia perfecta o una prueba preescrita. Llaman a su sistema NoTB. En lugar de depender de un único juez para decidir si un diseño es bueno, o de ejecutar una simulación que podría pasar por alto un fallo crítico, NoTB pide a múltiples modelos de IA diferentes que escriban el mismo diseño de forma independiente. Luego, utiliza una herramienta matemática rigurosa llamada verificación de equivalencia secuencial para ver si las diferentes versiones se comportan exactamente de la misma manera bajo cada condición posible. La idea central es que, si varios modelos de IA diferentes, que han sido entrenados de distintas maneras, llegan exactamente al mismo comportamiento, es muy probable que hayan encontrado la solución correcta. Este enfoque permite a los ingenieros identificar los diseños más confiables en una etapa temprana del proceso, ahorrando tiempo y recursos antes de comprometerse con la construcción del chip real.

Los investigadores probaron este método en setenta y ocho tareas diferentes de diseño de hardware. Utilizaron cuatro familias distintas de modelos de lenguaje extensos para generar múltiples versiones de cada diseño. Para cada tarea, compararon las salidas para ver cuáles eran matemáticamente idénticas. Descubrieron que cuando los diseños de las cuatro familias de IA estaban de acuerdo en el mismo comportamiento, el sistema era correcto casi el noventa y cinco por ciento de las veces. Esta alta confianza conllevó una compensación: el sistema solo realizó una predicción para aproximadamente el veintisiete por ciento de las tareas. Sin embargo, al reducir el requisito a solo tres familias de acuerdo, el sistema pudo cubrir el treinta y tres por ciento de las tareas manteniendo una tasa de precisión del ochenta y siete por ciento. Esto ofrece a los diseñadores una herramienta flexible: pueden optar por ser extremadamente cautelosos y aceptar solo los diseños más seguros, o pueden aceptar un riesgo ligeramente mayor para lograr que se aprueben más diseños para pruebas posteriores.

El estudio también reveló por qué los métodos antiguos de verificación de diseños de IA no eran fiables. Un enfoque común consistía en pedir a un segundo modelo de IA que actuara como juez y predijera si un diseño era correcto. Los investigadores descubrieron que este método era inconsistente; el mismo diseño podía ser marcado como correcto por un juez e incorrecto por otro, dependiendo de qué modelo de IA estuviera realizando la labor de juzgar. Otro método implicaba pasar los diseños a través de una prueba creada por una IA. Los investigadores descubrieron que la calidad de los resultados dependía enteramente de la calidad de esa prueba. Si la prueba era débil, podía fallar al detectar errores, llevando al sistema a creer que un diseño defectuoso era en realidad correcto. En contraste, el nuevo método no depende de una prueba ni de un juez. Se basa en el hecho de que los diseños mismos están probados como idénticos a lo largo de todo el rango de entradas posibles, lo que hace que el acuerdo sea una propiedad del diseño en lugar de una propiedad de la herramienta utilizada para verificarlo.

Para que este proceso sea eficiente, el sistema utiliza una técnica de filtrado inteligente. En lugar de comparar cada par de diseños individualmente, lo que tomaría mucho tiempo, primero elimina los duplicados exactos y luego agrupa los diseños que ya han sido probados como iguales. Esto reduce significamente el número de comparaciones necesarias. Todo el proceso, desde la generación de los diseños hasta su verificación, toma en promedio entre uno y dieciséis minutos por tarea, dependiendo de cuántas versiones se generen. El costo de ejecutar este sistema también es manejable, ya que evita la necesidad de realizar llamadas costosas y repetidas a los modelos de IA solo para que actúen como jueces. Los investigadores enfatizan que este método no reemplaza la necesidad de una verificación final. En cambio, actúa como un sistema de triaje, una forma de clasificar la pila de diseños generados por IA para que los más prometedores puedan avanzar con confianza, mientras que los inciertos se dejan de lado para una revisión más tradicional y exhaustiva.

Los hallazgos sugieren que la diversidad de los modelos de IA utilizados es clave para el éxito del sistema. Los investigadores probaron qué sucedería si eliminaban una de las cuatro familias de IA de la mezcla. Descubrieron que el sistema seguía siendo robusto y preciso incluso cuando faltaba un modelo, demostrando que la señal de confianza proviene del acuerdo colectivo del grupo y no de la dependencia de un solo modelo. Esto hace que el enfoque sea práctico para el uso en el mundo real, donde el acceso a modelos de IA específicos puede variar. El estudio concluye que, al cambiar el enfoque de las pruebas simuladas a la prueba matemática formal de acuerdo, los ingenieros pueden construir un flujo de trabajo más fiable para el uso de la inteligencia artificial en el diseño de hardware. Esto permite a la industria aprovechar la velocidad de la generación por IA mientras mantiene los rigurosos estándares de seguridad requeridos para los complejos chips que impulsan la tecnología moderna.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →