Deterministic vs. LLM-Controlled Orchestration for COBOL-to-Python Modernization
Este artigo apresenta um estudo empírico controlado demonstrando que a orquestração determinística supera os fluxos de trabalho agênticos controlados por LLM na modernização de COBOL para Python ao alcançar uma precisão de tradução comparável, enquanto melhora significativamente a robustez, reduz a variabilidade de desempenho e reduz os custos operacionais em até 3,5x.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Por décadas, os setores financeiro e governamental têm dependido de programas de computador massivos e intrincados escritos em uma linguagem chamada COBOL. Esses sistemas executam as transações bancárias e os pagamentos da previdência social do mundo, mas os especialistas que os construíram estão se aposentando, e o código em si é frequentemente de décadas atrás, mal documentado e difícil de alterar. Para manter esses serviços vitais funcionando, as organizações devem traduzir esse código antigo para linguagens modernas como Python, um processo que exige extrema precisão porque até um erro minúsculo pode fazer com que um sistema falhe. Recentemente, um novo tipo de inteligência artificial conhecido como modelo de linguagem de grande escala surgiu como uma ferramenta potencial para essa tarefa. Esses modelos podem ler código e escrever novo código, mas frequentemente trabalham agindo como agentes autônomos: eles decidem por si mesmos quais passos tomar, quando repetir uma tarefa e como corrigir erros conforme avançam. Isso levanta uma questão crítica para os engenheiros: é melhor deixar a inteligência artificial dirigir todo o processo, decidindo cada movimento em tempo real, ou é mais eficaz manter o processo em uma trilha estrita e predefinida onde o computador segue um conjunto fixo de regras?
Uma equipe de pesquisadores da Universidade Bucknell e da Astrio decidiu responder a essa pergunta conduzindo um experimento controlado para ver como essas duas abordagens diferentes lidam com o difícil trabalho de converter código COBOL em Python. Eles construíram um sistema chamado ATLAS para atuar como o tradutor, mas projetaram o experimento de modo que a única coisa que mudava entre os testes era quem estava no assento do motorista. Em uma versão, a inteligência artificial tinha controle total, sendo permitida a escolher seu próprio caminho, selecionar suas próprias ferramentas e decidir quando parar ou recomeçar. Na outra versão, a mesma inteligência artificial era usada para escrever o código, mas um conjunto rígido e imutável de regras ditava exatamente quais passos seguir, em que ordem e quantas vezes tentar novamente se algo desse errado. Ao manter o cérebro do sistema — o modelo de linguagem — exatamente o mesmo em ambos os cenários, os pesquisadores puderam isolar o efeito do método de controle em si, eliminando todas as outras variáveis para ver qual estratégia realmente funcionava melhor.
Os resultados deste estudo revelaram uma clara troca entre flexibilidade e confiabilidade. Quando a inteligência artificial foi permitida a controlar o processo, ela frequentemente conseguiu produzir um programa funcional, muitas vezes obtendo sucesso ao gerar um resultado que poderia rodar sem travar. No entanto, esse sucesso veio com um custo oculto: os resultados eram inconsistentes. Como o modelo estava tomando suas próprias decisões sobre como proceder, o mesmo código inicial poderia levar a resultados muito diferentes em diferentes tentativas, às vezes produzindo uma tradução perfeita e outras vezes falhando de maneiras imprevisíveis. Além disso, essa abordagem "agêntica" era incrivelmente cara. O modelo frequentemente percorria caminhos longos e sinuosos de raciocínio, fazendo perguntas a si mesmo e tentando múltiplas estratégias que não eram necessárias, consumindo vastas quantidades de recursos computacionais. Em alguns casos, a abordagem flexível usou mais de três vezes tantos tokens — as unidades básicas de informação que o modelo processa — quanto a abordagem fixa para alcançar um resultado semelhante.
Em contraste, o sistema que seguiu um caminho fixo e determinístico produziu resultados que eram muito mais estáveis e previsíveis. Embora a capacidade geral de traduzir o código fosse tão boa quanto a da versão flexível, o sistema rígido raramente falhava nos piores casos. Ele não se perdia em loops de pensamento desnecessário e não variava seu comportamento de uma execução para outra. Mais importante ainda, era significativamente mais barato de operar. Ao aderir a um cronograma estrito de etapas e usar a inteligência artificial apenas para escrever o código, em vez de planejar a jornada, o sistema reduziu o custo de tradução por um fator de três a três e meio. Os pesquisadores descobriram que, para tarefas como a modernização de software legado, onde os passos são bem definidos e os resultados podem ser verificados contra regras estritas, deixar a inteligência artificial dirigir o carro não era apenas mais caro, mas também menos confiável do que ter um mapa desenhado por humanos guiando o caminho.
Este estudo sugere que o futuro do uso de inteligência artificial em tarefas de engenharia complexas pode não residir em dar às máquinas total liberdade para decidir como trabalhar. Em vez disso, a abordagem mais eficaz parece ser incorporar esses modelos poderosos dentro de uma estrutura estruturada, onde as regras de engajamento são fixas e o caminho é claro. A inteligência artificial permanece como o escritor especialista, capaz de compreender instruções complexas e gerar novo código, mas a orquestração do trabalho — o planejamento, o tempo e as verificações de segurança — permanece sob controle estrito e determinístico. Isso garante que o processo seja não apenas capaz de produzir resultados de alta qualidade, mas também permaneça robusto, previsível e economicamente viável para os grandes sistemas críticos que mantêm nosso mundo moderno funcionando.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.