← Últimos artigos
🤖 AI

Trace2Policy: From Expert Behavior Traces to Self-Evolving Decision Agents

O Trace2Policy introduz um framework de refinamento iterativo de habilidades baseado em erro (EISR) que recupera e melhora sistematicamente regras de decisão de especialistas em código Python determinístico de alta precisão, superando tanto a destilação estática de LLM quanto os baselines de puro LLM em tarefas sensíveis à conformidade, ao mesmo tempo em que reduz significativamente os custos de refinamento.

Autores originais: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

Publicado 2026-06-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Junli Zha, Jinbo Wang, Chao Zhou, Xiang Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine uma empresa de logística movimentada onde auditores especialistas passam seus dias revisando milhares de reclamações de envio. Eles analisam fotos, leem relatórios e decidem: "Este dano é culpa da transportadora ou do remetente?". Esses especialistas tomam essas decisões com base em um conjunto complexo e não escrito de regras mentais que aprenderam ao longo dos anos. Eles sabem coisas como: "Se a foto mostra uma caixa rasgada, mas o sistema diz 'intacta', confie na foto" ou "Se o revisor escreveu uma nota começando com 'C:', isso significa que ele está secretamente reatribuindo a responsabilidade".

O problema é que essas regras estão presas dentro da cabeça dos especialistas. Se você tentar ensinar um computador (uma IA) a fazer esse trabalho apenas mostrando a ele alguns exemplos, ele ficará confuso. Ele perderá os truques sutis e ocultos que os especialistas utilizam.

O Trace2Policy é um novo sistema projetado para resolver isso. Pense nele como uma "Máquina de Extração e Refinamento de Regras". Veja como ele funciona, usando analogias simples:

1. A Fase de Detetive (Capturando o Comportamento)

Primeiro, o sistema atua como um detetive silencioso. Ele observa os auditores especialistas trabalhando em seus computadores, registrando cada clique, cada tela que eles visualizam e cada nota que digitam. Ele não registra apenas o que eles clicaram; ele tenta entender por que o fizeram.

  • Analogia: Imagine um treinador gravando um mestre chef cozinhando um prato complexo. O treinador não apenas escreve "adicione sal"; ele nota: "O chef provou a sopa, franziu a testa e adicionou uma pitada de sal porque o caldo estava muito ácido".

2. A Fase de Rascunho (A Primeira Tentativa)

O sistema pega essas gravações e pede a uma IA inteligente que escreva as regras que ela acha que o chef está seguindo.

  • O Problema: O primeiro rascunho é geralmente superficial. Ele captura os passos óbvios ("Verificar a caixa"), mas perde a lógica profunda e oculta ("Verificar o código atual, não o código original, porque o sistema é atualizado em tempo real").
  • O Resultado: Este primeiro rascunho (chamado de "v1 Skills") é aceitável, mas acerta apenas cerca de 70% das decisões. É como um aluno que memorizou o livro didático, mas não aprendeu as perguntas pegadinha do exame final.

3. O Mecanismo "EISR" (O Loop Mágico)

Esta é a inovação central. O sistema utiliza um processo chamado EISR (Error-driven Iterative Skill Refinement — Refinamento de Habilidade Iterativo Baseado em Erros).

  • Como funciona: O sistema executa as regras do rascunho contra um conjunto de teste de casos. Quando comete um erro, ele não diz apenas "Errado". Ele age como um editor rigoroso:
    1. Diagnosticar: Ele agrupa os erros. São "Ausentes" (nenhuma regra cobriu isso)? "Errados" (a regra existia, mas deu a resposta errada)? Ou "Conflitantes" (duas regras entraram em conflito)?
    2. Corrigir (Patch): Ele escreve uma correção específica para aquele grupo de erros.
    3. Verificação de Segurança (O Portão de Regressão): Antes de salvar a correção, o sistema executa novamente os casos que estavam corretos anteriormente. Se a nova correção quebrar algo que estava funcionando antes, ele descarta a correção.
  • Analogia: Imagine um mecânico consertando o motor de um carro. Cada vez que ele aperta um parafuso para corrigir um ruído, ele testa imediatamente o motor para garantir que não afrouxou acidentalmente as velas de ignição. Eles continuam fazendo isso até que o carro funcione perfeitamente sem quebrar mais nada.

4. A Descoberta de "Regras Armadilha" (Trap Rules)

Através deste loop, o sistema encontrou "Regras Armadilha" — conhecimentos profundos que ninguém conseguiria escrever em uma única entrevista.

  • Exemplo: Uma das armadilhas era que um código específico na tela poderia parecer "Responsabilidade Compartilhada", mas era na verdade apenas um rótulo temporário que mudou de "Dano de Embalagem" cinco minutos atrás. Os especialistas sabiam que deveriam ignorar o rótulo e observar a ação que o revisor tomou. A IA só aprendeu isso após errar repetidamente e ser corrigida.

5. O Produto Final: Compilado vs. Prompt

O artigo faz uma afirmação muito específica e surpreendente sobre como as regras são usadas:

  • O Método de Prompt: Você pode fornecer as regras para uma IA como uma longa lista de instruções (um "prompt"). Isso funciona, mas é como pedir a um gênio para resolver um problema matemático enquanto ele lê um manual de 50 páginas. Isso acerta cerca de 70%.
  • O Método Compilado: O sistema traduz essas regras em um programa de computador estrito (código Python). Isso é como transformar o manual em uma calculadora que simplesmente faz o cálculo.
  • O Resultado: A versão "Compilada" saltou para 79,6% de precisão. O artigo argumenta que, para essas tarefas específicas e ricas em regras, a qualidade das regras importa mais do que a inteligência da IA. Uma IA inteligente seguindo regras ruins falha; um computador simples seguindo regras perfeitas tem sucesso.

6. O "Flywheel" (Autoaperfeiçoamento)

Uma vez implantado, o sistema não para.

  • O Loop: Os auditores humanos ainda revisam cada caso (como parte de seu trabalho normal). O sistema compara a resposta dele com a resposta do humano. Se houver divergência, o sistema a sinaliza, analisa o erro e aciona automaticamente outro ciclo de "EISR" para corrigir a regra.
  • Custo: Fazer isso manualmente levaria 70 horas por ciclo para um especialista humano. A versão automatizada (Auto-EISR) faz isso por US$ 5 a US$ 10 e leva algumas horas.

Resumo das Alegações

  • O que faz: Transforma o comportamento do especialista em regras de decisão que se autoaperfeiçoam.
  • O que descobriu:
    • O aprendizado de tentativa única (one-shot learning — perguntar à IA uma única vez) falha em capturar regras profundas e ocultas.
    • A correção iterativa de erros (EISR) encontra "regras armadilha" que aumentam significativamente a precisão.
    • Para essas tarefas específicas, executar as regras como um programa de computador estrito é muito melhor do que pedir a uma IA para ler as regras como um prompt.
    • Adicionar uma "rede de segurança" de IA (deixar a IA corrigir as regras quando ela não tem certeza) na verdade diminuiu a precisão neste caso específico, porque a IA estava ansiosa demais para rejeitar reivindicações, enquanto as regras estavam perfeitamente ajustadas às necessidades específicas da empresa.
  • Escopo: Isso foi testado em reclamações de danos de uma empresa de logística (3.349 casos) e em alguns benchmarks de raciocínio jurídico. Os autores não afirmam que isso funciona para todo tipo de decisão, mas especificamente para tarefas onde especialistas seguem regras sistemáticas e implícitas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →