← Últimos artigos
💻 computer science

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

A VeriTrace introduz um sistema multiagente apresentando a "Exploração Temporal Agêntica", que concede a um agente Inspetor controle total sobre a seleção de sinais, janelas de tempo e profundidade de iteração para realizar uma depuração baseada em hipóteses semelhante à humana, alcançando assim 100% de Pass@1 no VerilogEval-V2 e superando os benchmarks de estado da arte anteriores.

Autores originais: Yu-Tung Liu, Cunxi Yu

Publicado 2026-08-05
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yu-Tung Liu, Cunxi Yu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um robô a construir uma máquina complexa, como um brinquedo de engrenagens, usando apenas uma descrição escrita. Você dá ao robô as instruções, e ele tenta construir o brinquedo. Mas, às vezes, o brinquedo não funciona. No mundo da ciência da computação, isso é chamado de "design de hardware", e as instruções são escritas em uma linguagem especial chamada Verilog. Por muito tempo, programas de computador inteligentes conhecidos como Grandes Modelos de Linguagem (LLMs) têm se tornado muito bons em ler essas instruções e escrever o código para construir a máquina. No entanto, quando a máquina quebra, esses programas costumam ficar travados. Eles conseguem ver que o brinquedo está quebrado, mas não conseguem descobrir o porquê, porque não têm permissão para olhar de perto as peças móveis internas. Eles são como um mecânico que consegue ouvir um barulho estranho no motor, mas não tem permissão para abrir o capô ou usar uma chave para verificar engrenagens específicas. Este artigo, escrito por pesquisadores da Universidade de Maryland, aborda exatamente este problema: como dar a esses "mecânicos" de IA a liberdade de investigar o funcionamento interno da máquina, exatamente como um especialista humano faria.

Os pesquisadores, Yu-Tung Liu e Cunxi Yu, notaram que, embora a IA consiga escrever o código inicial, ela tem dificuldade em corrigi-lo quando algo dá errado. Tentativas anteriores de ajudar a IA a depurar envolveram fornecer uma "forma de onda" (waveform) — um mapa visual de como os sinais da máquina mudam ao longo do tempo. Mas esses sistemas antigos eram como dar a um detetive uma foto de uma cena de crime, mas proibi-lo de escolher quais pistas examinar ou em qual hora do dia focar. A IA era forçada a olhar para uma visão estreita e pré-selecionada, o que frequentemente perdia a verdadeira causa do erro. Os autores chamam essa limitação de um "espaço de ação incompleto". Eles argumentam que, para realmente corrigir o código, a IA precisa ser capaz de escolher quais sinais inspecionar, quando olhar para eles e por quanto tempo continuar investigando, espelhando a forma como um engenheiro humano pensa.

Para resolver isso, a equipe criou um novo sistema chamado VeriTrace. Pense no VeriTrace como uma equipe de trabalhadores de IA especializados. Um trabalhador escreve o código, outro verifica se ele funciona e um terceiro, chamado "Inspetor", age como um detet everioso. Ao contrário dos sistemas anteriores, este Inspetor tem total liberdade. Ele pode dizer: "Eu acho que o problema está nesta engrenagem específica, mas apenas durante o segundo segundo de operação", e então dar um zoom para verificar exatamente isso. Se a primeira suposição estiver errada, o Inspetor não desiste; ele forma uma nova teoria, escolhe uma janela de tempo diferente e olha novamente. Esse processo é chamado de "Exploração Temporal Agêntica". Isso permite que a IA construa uma hipótese, teste-a contra as evidências e refine seu entendimento passo a passo, exatamente como um humano faria.

Os resultados desta nova abordagem são bastante impressionantes. Ao ser testado em um conjunto padrão de 156 desafios de codificação chamado VerilogEval-V2, o VeriTrace alcançou uma pontuação perfeita de 100% de Pass@1. Isso significa que, na primeira tentativa de seu código corrigido final, ele acertou todos os problemas. Esta é a primeira vez que um sistema de código aberto atinge esse nível de perfeição neste benchmark específico. Mesmo quando comparado com outros sistemas fortes usando o mesmo cérebro de IA subjacente (Claude Sonnet 4.0), o VeriTrace superou-os em 5,1%, provando que dar à IA a liberdade de explorar e investigar é a chave para fechar a lacuna final de precisão.

Curiosamente, os pesquisadores descobriram que essa liberdade não apenas tornou a IA mais inteligente; também a tornou mais eficiente. Ao solicitar apenas as partes específicas de informação de que precisava em cada etapa, em vez de despejar todo o histórico de operação da máquina em sua memória, o VeriTrace reduziu a quantidade de dados que precisava processar em 18%. Isso sugere que deixar a IA fazer as perguntas certas não é apenas melhor para encontrar a resposta, mas também economiza muita energia computacional. O artigo conclui que, embora os modelos de IA sejam poderosos, o verdadeiro avanço vem de como permitimos que eles usem suas ferramentas. Ao dar a eles a agência para explorar o tempo e os sinais livremente, podemos transformá-los de geradores de código rígidos em verdadeiros solucionadores de problemas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →