← Últimos artículos
💻 computer science

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

VeriTrace introduce un sistema multiagente que presenta la "Exploración Temporal Agéntica", la cual otorga a un agente Inspector el control completo sobre la selección de señales, las ventanas de tiempo y la profundidad de iteración para realizar una depuración impulsada por hipótesis similar a la humana, logrando así un Pass@1 del 100% en VerilogEval-V2 y superando los benchmarks previos del estado del arte.

Autores originales: Yu-Tung Liu, Cunxi Yu

Publicado 2026-08-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yu-Tung Liu, Cunxi Yu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot a construir una máquina compleja, como un juguete de relojería, utilizando solo una descripción escrita. Le das al robot las instrucciones y este intenta construir el objeto. Pero, a veces, el juguete no funciona. En el mundo de la informática, esto se llama "diseño de hardware", y las instrucciones se escriben en un lenguaje especial llamado Verilog. Durante mucho tiempo, programas informáticos inteligentes conocidos como Modelos de Lenguaje Extensos (LLM) se han vuelto muy buenos leyendo estas instrucciones y escribiendo el código para construir la máquina. Sin embargo, cuando la máquina se rompe, estos programas suelen quedarse estancados. Pueden ver que el juguete está roto, pero no logran entender por qué, porque no se les permite observar de cerca las piezas móviles internas. Son como un mecánico que puede oír un golpe en el motor, pero que no tiene permitido abrir el capó o usar una llave para revisar engranajes específicos. Este artículo, escrito por investigadores de la Universidad de Maryland, aborda exactamente este problema: cómo dar a estos "mecánicos" de IA la libertad de investigar los mecanismos internos de la máquina tal como lo haría un experto humano.

Los investigadores, Yu-Tung Liu y Cunxi Yu, notaron que, si bien la IA puede escribir el código inicial, le cuesta arreglarlo cuando algo sale mal. Los intentos previos para ayudar a la IA a depurar implicaban darle una "forma de onda": un mapa visual de cómo cambian las señales de la máquina a lo largo del tiempo. Pero estos sistemas antiguos eran como darle a un detective una foto de la escena de un crimen pero prohibirle elegir qué pistas examinar o en qué momento del día centrarse. La IA se veía obligada a mirar una vista estrecha y preseleccionada, lo que a menudo pasaba por alto la verdadera causa del error. Los autores llaman a esta limitación un "espacio de acción incompleto". Argumentan que, para arreglar realmente el código, la IA debe ser capaz de elegir qué señales inspeccionar, cuándo mirarlas y cuánto tiempo seguir investigando, imitando la forma en que piensa un ingeniero humano.

Para resolver esto, el equipo creó un nuevo sistema llamado VeriTrace. Piensa en VeriTrace como un equipo de trabajadores de IA especializados. Un trabajador escribe el código, otro comprueba si funciona y un tercero, llamado el "Inspector", actúa como un detective curioso. A diferencia de los sistemas anteriores, este Inspector tiene total libertad. Puede decir: "Creo que el problema está en este engranaje específico, pero solo durante el segundo segundo de funcionamiento", y luego hacer zoom para comprobar exactamente eso. Si la primera suposición es errónea, el Inspector no se rinde; formula una nueva teoría, elige una ventana de tiempo diferente y vuelve a mirar. Este proceso se denomina "Exploración Temporal Agéntica". Permite que la IA construya una hipótesis, la contraste con la evidencia y refine su comprensión paso a paso, tal como lo haría un humano.

Los resultados de este nuevo enfoque son bastante impresionantes. Al ser probado en un conjunto estándar de 156 desafíos de codificación llamado VerilogEval-V2, VeriTrace logró una puntuación perfecta de 100% Pass@1. Esto significa que, en el primer intento de su código corregido final, acertó todos los problemas. Esta es la primera vez que un sistema de código abierto alcanza este nivel de perfección en este benchmark específico. Incluso cuando se comparó con otros sistemas robustos que utilizan el mismo cerebro de IA subyacente (Claude Sonnet 4.0), VeriTrace superó a los demás por un 5,1%, demostrando que darle a la IA la libertad de explorar e investigar es la clave para cerrar la brecha final de precisión.

Curiosamente, los investigadores descubrieron que esta libertad no solo hizo a la IA más inteligente, sino que también la hizo más eficiente. Al solicitar únicamente las piezas de información específicas que necesitaba en cada paso, en lugar de volcar todo el historial de operación de la máquina en su memoria, VeriTrace redujo la cantidad de datos que tenía que procesar en un 18%. Esto sugiere que dejar que la IA haga las preguntas correctas no solo es mejor para encontrar la respuesta, sino que también ahorra mucha energía computacional. El artículo concluye que, si bien los modelos de IA son potentes, el verdadero avance proviene de cómo les permitimos usar sus herramientas. Al darles la agencia para explorar el tiempo y las señales libremente, podemos transformarlos de rígidos generadores de código en verdaderos solucionadores de problemas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →