Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack
Este artigo apresenta uma pilha LLMOps consciente da carga de trabalho, adaptada para conformidade com fraudes e AML, que aproveita modelos de pesos abertos, otimizações avançadas de serviço como PagedAttention e cache de prefixo, e controle rigoroso de qualidade para alcançar melhorias significativas em throughput, latência e utilização de GPU em comparação com abordagens genéricas de serviço de LLM.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está operando uma biblioteca massiva e de alta velocidade, onde o objetivo não é apenas ler livros, mas encontrar padrões específicos e perigosos em milhões de páginas de transações financeiras para pegar lavadores de dinheiro. Este é o mundo da Fraude e Combate à Lavagem de Dinheiro (AML).
Os autores deste artigo argumentam que a "biblioteca" padrão (o sistema de IA) que normalmente construímos para conversar com amigos é terrível para esta tarefa específica. É como tentar usar um caminhão de entregas de uso geral para transportar caixas frágeis, pesadas e pré-empacotadas. Você precisa de um veículo especializado.
Aqui está a divisão de sua solução, usando analogias simples:
1. O Problema: O Caminhão "Tamanho Único"
A maioria dos sistemas de IA é construída para conversar. Em uma conversa, cada diálogo é único, longo e imprevisível.
- A Realidade da Fraude: A detecção de fraudes é diferente. Cada solicitação enviada à IA parece quase a mesma. É como enviar um formulário onde os 80% superiores da página são sempre as mesmas regras e instruções legais (o "prefixo"), e apenas os 20% inferiores mudam (os detalhes específicos da transação).
- O Resultado: Os sistemas de IA padrão desperdiçam uma enorme quantidade de tempo relendo as mesmas regras legais repetidamente, como um estudante relendo o mesmo capítulo de um livro didático antes de cada pergunta de tarefa de casa. Isso os torna lentos e caros.
2. A Solução: Uma Pilha de Atendimento "Inteligente"
Os autores construíram uma "pilha de atendimento" especializada (o motor que executa a IA) projetada especificamente para essas tarefas repetitivas e carregadas de regras. Pense nisso como atualizar de um caminhão de entregas padrão para uma instalação de triagem automatizada de alta velocidade.
Aqui estão as principais atualizações que eles fizeram:
A "Cola de Truques" (Cache de Prefixo):
Em vez de reler as 2.000 palavras de instruções legais toda vez, o sistema as memoriza. É como ter uma cola de truques colada na parede. Quando um novo caso chega, a IA apenas olha para a cola de truques (que já está carregada na memória) e foca apenas nos detalhes da nova transação. Isso economiza quantidades massivas de tempo.O "Arquivo Inteligente" (PagedAttention):
A memória padrão de IA é como uma mesa bagunçada onde você não consegue encaixar novos papéis sem bagunçar tudo ao redor. Os autores usaram um sistema "Paginado", que é como um arquivo perfeitamente organizado. Ele divide a memória em blocos pequenos e gerenciáveis para que a IA possa acomodar milhares de casos em seu espaço de trabalho sem ficar desorganizada ou travar.A "Estratégia de Agrupamento" (Loteamento Multi-Adapter):
Imagine um correio onde você precisa classificar correspondências para 10 cidades diferentes. Um sistema ingênuo classifica uma carta para a Cidade A, depois uma para a Cidade B, e volta para a Cidade A.
O sistema dos autores agrupa todas as cartas da "Cidade A" juntas, depois todas as cartas da "Cidade B". Em termos de IA, eles agrupam solicitações que precisam do mesmo "adaptador" específico (uma ferramenta especializada para uma tarefa específica) e as processam em um único lote. Isso é 3,9 vezes mais rápido do que a maneira antiga.O "Modo de Repouso" (Gerenciamento de Ciclo de Vida):
Às vezes, uma investigação de fraude precisa de três modelos de IA diferentes trabalhando em sequência: um para encontrar evidências, um para classificá-las e um para escrever um relatório. Manter os três funcionando em velocidade total 24/7 é um desperdício de eletricidade (e dinheiro).
O sistema dos autores coloca os modelos não utilizados em repouso (liberando memória) e os acorda instantaneamente quando necessário. É como um carro híbrido que desliga o motor nos semáforos, mas acelera instantaneamente quando o sinal fica verde. Isso reduz o tempo de "acordar" de quase um minuto para alguns segundos.O "Impulso de Velocidade" (Decodificação Especulativa):
Para respostas curtas (como um simples "Sim/Não" ou um código JSON), a IA às vezes leva muito tempo para pensar. Os autores adicionaram uma etapa de "rascunho" onde uma IA menor e mais rápida chuta a resposta, e a IA grande apenas a verifica. É como ter um leitor rápido que folheia o texto e destaca a resposta para o professor verificar.
3. O "Portão de Qualidade" (O Juiz)
Velocidade é inútil se a IA cometer erros. Na detecção de fraudes, uma resposta errada pode significar deixar escapar um criminoso ou acusar uma pessoa inocente.
- Os autores criaram um sistema "Juiz". Antes que qualquer atualização de IA seja lançada, um painel de juízes de IA (e especialistas humanos) verifica o trabalho.
- Eles não verificam apenas se a IA é rápida; eles verificam se a saída é válida (por exemplo: é um JSON correto? Seguiu as regras?).
- É como um inspetor de segurança em uma fábrica. Se o produto é rápido, mas quebrado, ele não sai do prédio.
4. Os Resultados: Os Números "Mágicos"
Usando dados públicos e falsos (para que não vazassem segredos bancários reais), eles testaram este novo sistema. Os resultados foram dramáticos:
- Velocidade: Eles passaram de lidar com cerca de 600 solicitações por hora para 3.600 solicitações por hora (uma melhoria de 5,5x a 6x).
- Tempo de Espera: O tempo necessário para obter uma resposta caiu de 31–38 segundos para 6–8 segundos.
- Eficiência: O hardware do computador (GPUs) passou de estar ocioso 88% do tempo para estar ocupado 78% do tempo.
- Custo: Como eles conseguiram fazer muito mais com o mesmo hardware, precisaram de menos da metade do número de computadores para fazer o mesmo trabalho.
A Conclusão
O artigo conclui que, para trabalhos de alto risco como pegar lavadores de dinheiro, você não pode simplesmente usar o "melhor" modelo de IA. Você precisa construir um sistema de entrega especializado que entenda que o trabalho é repetitivo, carregado de regras e exige precisão estrita. Ao tratar o "prefixo" (as regras) como reutilizável e organizar o fluxo de trabalho como uma fábrica inteligente, você pode tornar o sistema mais rápido, mais barato e mais confiável, sem alterar o cérebro subjacente da IA.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.