Agentic AI Systems and Financial Stability, From Model Risk to Systemic Risk
Este artigo argumenta que a mudança de sistemas de IA preditivos para agentes transforma o risco financeiro de erros idiossincráticos diversificáveis em ameaças sistêmicas não diversificáveis, demonstrando através de seis estruturas matemáticas que tais riscos não podem ser mitigados por detecção ou controles post-hoc e requerem prevenção estrutural ex-ante.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
A estabilidade financeira baseia-se em uma suposição reconfortante: que, quando uma parte do sistema falha, o restante pode absorver o choque. Se um banco falha, os outros sobrevivem; se um operador comete um erro, o mercado se corrige. Isso funciona porque as falhas são geralmente únicas àquela instituição específica, espalhadas e não relacionadas. Mas um novo tipo de risco está emergindo que estraçalha essa rede de segurança. Ele vem da inteligência artificial "agêntica" — sistemas que não apenas preveem o futuro, mas tomam ações no mundo real, como movimentar dinheiro, escrever código ou gerenciar o atendimento a pacientes. Quando muitos desses agentes são construídos sobre a mesma base de software subjacente, um único erro ou um único ataque não permanece local. Em vez disso, ele atinge todos os agentes de uma só vez, transformando uma pequena falha técnica em um colapso sistêmico.
Pesquisadores do Federal Reserve passaram anos estudando como gerenciar o risco no setor bancário tradicional, onde medem a chance de um empréstimo entrar em inadimplência e reservam fundos para cobrir a perda. Eles aplicaram agora esse mesmo pensamento rigoroso a esses novos sistemas de IA, mas descobriram que as velhas regras não funcionam. O problema central é que esses agentes de IA são diferentes de trabalhadores humanos ou de softwares tradicionais. Eles agem com velocidade e autonomia e, quando cometem um erro, o dano é frequentemente irreversível. Não se pode "desenviar" uma transferência bancária fraudulenta ou "desexcluir" um banco de dados crítico. Como o dano é permanente e acontece instantaneamente, as redes de segurança usuais — como ter um plano de contingência ou esperar para ver o que acontece antes de reagir — são inúteis. Os pesquisadores descobriram que a única maneira de impedir uma catástrofe é impedir que ela seja possível desde o princípio, removendo as capacidades perigosas antes que o sistema seja executado.
O estudo, que abrange seis investigações matemáticas distintas, começa analisando um único agente de IA. Nas finanças tradicionais, o risco é calculado multiplicando a probabilidade de um evento pelo tamanho da perda. Os pesquisadores adaptaram isso para a IA, decompondo o dano em três partes: quão provável é que o agente tome uma ação prejudicial, quão severa é essa ação e quão longe chega o seu alcance. Eles descobriram que, quando um agente está sob ataque, esses três fatores não atuam de forma independente. Um único evento malicioso pode, simultaneamente, tornar o agente mais propenso a agir, tornar o dano pior e expandir o escopo do dano. Isso cria um risco de "via errada", onde o perigo se agrava rapidamente. Mais importante ainda, eles provaram que, para danos irreversíveis, nenhum nível de monitoramento ou capacidade de reverter erros pode corrigir o problema. Se uma ação não pode ser desfeita, a única solução é garantir que o agente nunca tenha a capacidade de realizar tal ação.
Os pesquisadores ampliaram então sua visão de um único agente para uma frota de milhares, todos rodando na mesma fundação de modelo. É aqui que o risco se torna verdadeiramente sistêmico. Em uma carteira normal, se você tem muitos investimentos diferentes, uma falha em um não prejudica os outros. Mas se cada agente em uma frota compartilha o mesmo cérebro, uma falha nesse cérebro afeta a todos simultaneamente. Os pesquisadores mostraram que, não importa quantos agentes você adicione à frota, o risco não diminui. Em vez disso, ele atinge um "piso" que não pode ser diversificado. Mesmo que os agentes estejam em empresas ou países diferentes, se dependerem do mesmo software subjacente, uma única falha pode derrubar todo o grupo. Isso é o que chamam de "monocultura": um sistema onde todos estão vulneráveis à exata mesma ameaça.
O estudo também examinou como esses agentes interagem entre si. No mundo real, os agentes frequentemente conversam entre si, compartilhando informações ou coordenando tarefas. Os pesquisadores descobriram que essa interação cria um novo perigo oculto. Mesmo que os agentes sejam construídos em softwares diferentes, se forem programados para ouvir uns aos outros, podem começar a agir em uníssono durante uma crise. Se um agente entra em pânico e muda seu comportamento, os outros o seguem, criando uma reação em cadeia que espalha o risco. Isso acontece mesmo sem uma falha de software compartilhada. Além disso, um agente comprometido pode usar a linguagem para persuadir seus pares a fazer algo prejudicial, criando um contágio que se espalha através da conversa, em vez de código. Isso significa que simplesmente separar as redes técnicas não é suficiente; a forma como os agentes se comunicam também deve ser controlada.
Para entender como esses riscos se desenrolam ao longo do tempo, os pesquisadores modelaram o sistema como um fluxo contínuo de eventos, semelhante à forma como terremotos ou colapsos financeiros são estudados. Eles descobriram que o risco se comporta como um salto massivo e raro, em vez de um desvio lento. O sistema pode parecer estável por muito tempo e, de repente, colapsar. Eles também observaram como controlar esses sistemas enquanto eles estão em execução, usando "grades de proteção" (guardrails) para interromper ações ruins. Eles provaram que, para eventos irreversíveis, esses controles de tempo de execução são fundamentalmente limitados. Se uma ação já é irreversível, esperar para detectá-la e interrompê-la é tarde demais. A probabilidade de um desastre depende inteiramente do design inicial do sistema, não de quão bem você o monitora enquanto ele roda. Nenhum monitoramento pode corrigir uma falha que foi incorporada desde o início.
Os capítulos finais do estudo introduziram um adversário — um hacker ou atacante que também utiliza IA avançada. Os pesquisadores trataram isso como um jogo onde o atacante tenta encontrar o ponto mais fraco e o defensor tenta bloqueá-lo. Eles descobriram que, quando os atacantes usam IA, o sistema se torna um alvo muito mais atraente. Uma fundação de software compartilhada é como uma chave única que abre todas as portas de um edifício; se um ladrão encontra essa chave, ele pode entrar em todos os lugares de uma só vez. O estudo mostrou que, em um mercado descentralizado, onde cada empresa tenta proteger a si mesma individualmente, todos investirão pouco no controle de segurança mais importante: a prevenção estrutural. Eles gastarão dinheiro em detecção e reação porque essas são medidas mais fáceis de visualizar e medir, mas ignorarão o trabalho árduo de remover as capacidades perigosas por completo. Isso deixa todo o sistema vulnerável.
Os pesquisadores concluíram que a única maneira eficaz de gerenciar esse risco é através da "prevenção estrutural". Isso significa projetar o sistema de modo que ações catastróficas sejam fisicamente impossíveis de realizar, em vez de esperar capturá-las depois que acontecerem. Envolve remover ferramentas perigosas, limitar permissões e garantir que os agentes não possam acessar as partes do sistema que poderiam causar danos irreversíveis. O estudo provou que essa abordagem é a única que funciona contra um adversário inteligente e crescente. À medida que a tecnologia de IA melhora e os atacantes se tornam mais capazes, o custo de tentar detectar e reagir a cada nova ameaça torna-se infinito. Em contraste, o custo de remover uma capacidade perigosa é um investimento único que protege o sistema para sempre, independentemente de quão inteligente o atacante se torne.
O artigo termina com uma mensagem clara para reguladores e designers de sistemas. A estabilidade financeira na era da IA não pode ser alcançada vigiando cada instituição mais de perto ou esperando que uma única falha não se espalhe. O risco é profundo demais e interconectado demais. A única maneira de assegurar o sistema é fazer escolhas estruturais antes mesmo de o sistema começar a rodar. Isso significa limitar o quanto qualquer fundação de software única pode ser utilizada, garantir que os agentes não possam realizar ações irreversíveis e projetar o sistema de modo que um único ponto de falha não possa derrubar toda a rede. A matemática é clara: você não pode diversificar um erro compartilhado, não pode se livrar de um erro irreversível através da detecção e não pode reagir rápido o suficiente para deter um ataque coordenado. A única solução é construir o sistema de modo que o desastre nunca tenha a chance de acontecer.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.