Runtime Continuation after Faults in Partially Executed Agent Workflows
Este artigo propõe um mecanismo de continuação em tempo de execução para fluxos de trabalho de agentes de modelos de linguagem parcialmente executados que garante a recuperação segura de falhas ao reconstruir uma fronteira confiável, derivar obrigações residuais de um contrato canônico e avançar o estado apenas por meio de efeitos autorizados apoiados por evidências válidas, novas e exclusivamente correspondentes.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No cenário digital moderno, a inteligência artificial evoluiu de um sistema que simplesmente escreve texto para um que realiza tarefas ativamente. Esses agentes inteligentes podem pesquisar na web, editar arquivos, enviar mensagens e atualizar bancos de dados em nome de um usuário. Eles operam seguindo uma sequência de etapas, frequentemente chamada de fluxo de trabalho (workflow), onde cada ação altera o estado do mundo real. No entanto, essa capacidade de agir cria uma vulnerabilidade única. Se um agente comete um erro, é enganado por um truque ou encontra um erro de sistema após já ter alterado um arquivo ou enviado uma mensagem, simplesmente tentar novamente ou recomeçar pode ser perigoso. Repetir uma sequência falha pode repetir uma ação prejudicial, enquanto continuar a partir de um estado de confusão pode construir sobre uma premissa falsa. O desafio central é determinar exatamente qual parte do histórico é confiável, qual trabalho resta para ser concluído e qual prova é necessária para avançar com segurança sem repetir erros ou cair em decepções.
Os pesquisadores Li Zeng e sua equipe, do Instituto de Tecnologia da Informação da Administração Nacional de Imigração e da Universidade de Ciência e Tecnologia de Hong Kong, desenvolveram um novo método para resolver este problema. Eles chamam seu sistema de AgentMirror. Em vez de tratar um fluxo de trabalho interrompido como um simples erro a ser corrigido por uma nova tentativa, o AgentMirror trata o processo de recuperação como uma verificação rigorosa e passo a passo da realidade. O sistema opera sob o princípio de que, uma vez que um agente realizou uma ação, o histórico dessa ação torna-se um ponto fixo de verdade. Se o agente falhar ou for enganado após esse ponto, o sistema não pede à inteligência artificial que decida o que aconteceu. Em vez disso, ele observa um registro verificado do que realmente ocorreu, identifica exatamente quais tarefas ainda restam para serem feitas e exige provas concretas antes de permitir que qualquer nova ação altere o estado do mundo novamente.
Os pesquisadores construíram este sistema em torno de um conceito que chamam de "fronteira de confiança" (trusted frontier). Imagine uma linha traçada na areia que marca o momento exato em que o histórico do agente é confirmado como seguro e correto. Tudo antes desta linha é aceito como verdadeiro; tudo depois é não verificado. Quando ocorre uma falha, o sistema não permite que a inteligência artificial reescreva esta linha ou finja que um erro não aconteceu. Ele reconstrói o estado do agente baseando-se apenas no histórico verificado até aquela linha. A partir deste ponto, o sistema calcula uma lista de "obrigações residuais" — as tarefas específicas e obrigatórias que o agente ainda precisa completar para finalizar o trabalho. Ele então apresenta esta lista à inteligência artificial como um guia, dizendo o que falta fazer, mas sem dar à inteligência o poder de simplesmente executá-lo.
A inovação crítica reside em como o sistema lida com o próximo passo. Quando a inteligência artificial propõe uma nova ação, essa proposta é tratada como não confiável. O sistema força a ação através de uma verificação de segurança padrão, conhecida como "admissão ordinária", para garantir que ela seja permitida para execução. Se a ação for executada, o sistema não aceita imediatamente que a tarefa foi concluída. Ele espera por um "recibo de tempo de execução" (runtime receipt), que é um certificado digital emitido por uma autoridade confiável confirmando que a ação realmente aconteceu e foi observada corretamente. Este recibo deve ser recente, o que significa que acabou de ser criado, e deve estar vinculado à fronteira de confiança atual, o que significa que não pode ser uma repetição de uma ação antiga ou um falso de uma sessão diferente. Somente quando este recibo é verificado e corresponde exatamente a uma das tarefas restantes é que o sistema permite que o registro oficial do progresso do agente avance.
Para testar sua ideia, os pesquisadores utilizaram um benchmark chamado AgentDojo, que simula várias tarefas e introduz deliberadamente falhas e ataques para observar como os agentes se comportam. Eles compararam seu sistema AgentMirror com outros métodos de recuperação, como simplesmente tentar novamente o último passo ou deixar a inteligência artificial adivinhar o caminho para sair de problemas. Os resultados mostraram que o AgentMirror foi significativamente melhor em completar tarefas de forma segura. Ele recuperou-se com sucesso de falhas sem permitir que ações não autorizadas passassem despercebidas e impediu que o agente caísse em instruções de truque que tentavam fazê-lo repetir operações prejudiciais. O estudo demonstrou que, ao separar a orientação dada à inteligência artificial da autoridade para executar ações, e ao exigir evidências frescas para cada etapa, o sistema poderia manter um caminho seguro mesmo quando o próprio agente estivesse comprometido.
Os pesquisadores também exploraram o que aconteceria se removessem partes específicas de suas regras de segurança. Eles descobriram que, se pulassem a etapa de verificar o recibo, o sistema aceitaria evidências falsas ou antigas, levando a um progresso incorreto. Se permitissem que o guia de recuperação atuasse como uma permissão, o sistema deixaria ações não confiáveis rodarem. Se não verificassem se a ação correspondia exatamente a uma tarefa específica, o sistema poderia encerrar a tarefa errada ou deixar o trabalho incompleto. Esses testes confirmaram que cada parte de seu processo é necessária; nenhum único controle pode substituir os outros. O sistema funciona porque força uma cadeia de confiança onde a inteligência artificial pode sugerir, mas o sistema decide, e apenas a realidade verificada pode alterar o registro.
Este trabalho não afirma tornar a inteligência artificial perfeita ou resolver todos os seus possíveis problemas. O sistema depende de que o contrato inicial ou o conjunto de regras esteja correto; se as regras forem erradas, o sistema seguirá fielmente o caminho errado. Ele também não pode desfazer ações que já foram realizadas no mundo real se a prova dessas ações for perdida. No entanto, ele oferece uma estrutura robusta para gerenciar o momento em que as coisas dão errado. Ao tratar o processo de recuperação como uma transição rigorosa de um estado conhecido e seguro para um novo estado verificado, o AgentMirror oferece uma maneira de manter agentes inteligentes trabalhando com segurança, mesmo quando encontram erros ou interferências maliciosas. O estudo conclui que a chave para uma continuação segura não é um melhor palpite, mas uma melhor verificação.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.