Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation
Este artigo apresenta o Krone-viz, um sistema de visualização interativa que aproveita uma nova abstração hierárquica de logs e um framework de orquestração modular para permitir detecção precisa de anomalias, localização e explicação por meio de augmentação seletiva com LLMs e refinamento com participação humana.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um detetive tentando resolver um crime, mas, em vez de algumas declarações de testemunhas, você recebe uma transcrição de 10.000 páginas de uma transmissão de rádio caótica e sem interrupções. Cada frase é um pequeno fragmento de uma conversa, mas todas estão misturadas em uma única lista plana. É assim que os "logs" de computador geralmente se parecem: fluxos intermináveis de texto que dizem a um sistema o que ele está fazendo, mas de uma forma incrivelmente difícil para os humanos entenderem.
O artigo apresenta o Krone (e sua ferramenta visual, o Krone-viz), uma nova maneira de dar sentido a esse caos. Veja como funciona, explicado através de analogias simples:
1. O Problema: A Lista "Plana" vs. A "História"
A maioria das ferramentas atuais trata os logs como uma lista plana de ingredientes. Se um bolo queima, elas apenas dizem: "O bolo está estragado". Elas não dizem qual ingrediente estava errado, quando estragou ou por quê.
- O Jeito Antigo: Olhar para uma lista plana de 10.000 entradas de log e tentar encontrar o único erro de digitação que causou uma falha. É como tentar encontrar uma frase específica em um romance onde cada palavra está escrita em uma única linha.
- O Jeito Krone: O Krone percebe que computadores não fazem coisas aleatórias; eles seguem uma estrutura de história. Cada ação tem um Quem (Entidade), um O Que (Ação) e um Resultado (Status).
2. A Solução: Construindo uma "Árvore Genealógica" para Logs
O Krone pega essa lista plana e bagunçada e a organiza em uma árvore genealógica hierárquica (chamada de Krone-Tree).
- A Analogia: Imagine pegar uma pilha bagunçada de blocos de Lego e organizá-los em caixas: "Rodas", "Janelas" e "Portas". Depois, você agrupa essas caixas em "Peças de Carro", e essas em "O Carro Inteiro".
- Como funciona: O Krone usa uma IA (um Modelo de Linguagem Grande, ou LLM) para ler os logs e dizer: "Ah, esta entrada de log é sobre uma 'Sessão' (Quem) que 'Abriu' (O Que) e 'Iniciou' (Resultado)". Ele constrói um mapa onde cada entrada de log sabe exatamente onde se encaixa no quadro geral.
3. O Trabalho de Detetive: "Dividir e Conquistar"
Uma vez que os logs estão organizados nessa árvore, o Krone não verifica cada tijolo individualmente. Ele usa uma estratégia inteligente, passo a passo, para encontrar o problema.
- O Filtro "Leve": Primeiro, o Krone usa um verificador de regras simples e rápido (como um corretor ortográfico) para escanear os logs. Se uma entrada de log parecer normal, ele a ignora. Isso é como um guarda de segurança acenando rapidamente para pessoas com IDs claros.
- O Detetive "IA": Se o verificador simples encontrar algo estranho, então ele chama o detetive de IA caro e superinteligente (o LLM) para investigar.
- A Estratégia "De Baixo para Cima": O Krone começa verificando os detalhes menores (o nível de "Status", como "Iniciado" ou "Falhou"). Se encontrar um problema ali, ele para imediatamente. Ele não perde tempo verificando os níveis maiores de "Ação" ou "Entidade" porque o problema já foi encontrado. Isso economiza uma quantidade massiva de dinheiro e poder de computação.
4. A "Cola de Trapaça": Aprendendo Conforme Anda
Uma das características mais legais do Krone é que ele lembra do que aprendeu.
- A Analogia: Imagine um detetive que mantém um caderno. Se ele resolver um mistério sobre uma "dobradiça de porta quebrada" hoje, ele anota. Na próxima vez que vir uma "dobradiça de porta quebrada", ele não precisa chamar o detetive de IA caro novamente; ele apenas olha para o caderno.
- Como funciona: O Krone constrói uma Base de Conhecimento. Se ele analisar um tipo específico de sequência de log e descobrir que é normal (ou anormal), ele salva esse resultado. Se essa mesma sequência aparecer novamente mais tarde, o Krone reutiliza a resposta. Isso torna o sistema mais rápido e barato ao longo do tempo.
5. A Ferramenta Visual: Krone-viz
O artigo apresenta o Krone-viz, um painel que permite que engenheiros humanos vejam tudo isso acontecendo em tempo real.
- O que você pode fazer:
- Ver a Árvore: Você pode assistir aos logs planos se transformando na árvore genealógica organizada.
- Identificar o Glitch: Você pode ver exatamente qual "ramo" da árvore está quebrado.
- Ler a Explicação: A IA escreve uma explicação em inglês simples de por que ela acha que algo está errado.
- Corrigir a IA: Se a IA cometer um erro, você pode corrigi-lo. O sistema aprende com sua correção e atualiza seu "caderno" para não cometer o mesmo erro novamente.
Resumo
Em resumo, o Krone para de tratar logs de computador como um muro caótico de texto. Em vez disso, ele os organiza em uma história estruturada, usa uma estratégia inteligente de "verificar primeiro, perguntar depois" para encontrar erros e lembra de suas descobertas para ficar mais inteligente e barato ao longo do tempo. O Krone-viz é a janela que permite que humanos observem esse processo, entendam o raciocínio da IA e o corrijam se necessário.
Nota: O artigo testou especificamente este sistema em um conjunto de dados padrão chamado HDFS (um tipo de log de sistema de armazenamento de arquivos) para provar que funciona melhor e custa menos do que métodos anteriores. Ele não afirma ser usado para diagnóstico médico ou outras indústrias específicas ainda.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.