← Últimos artigos
💻 computer science

Schema-Agnostic Process Trace Construction: From Raw Tables to Execution Behavior

Este artigo propõe um pipeline agnóstico a esquemas que reconstrói automaticamente traços de execução de processos de alta fidelidade a partir de tabelas relacionais brutas e frouxamente conectadas, identificando estatisticamente atributos chave e temporais, descobrindo conexões entre tabelas e utilizando uma Rede Convolucional Temporal para modelar a ordenação de eventos, eliminando, assim, a necessidade de esquemas predefinidos ou modelos de domínio em sistemas de informação dinâmicos.

Autores originais: Joel Lim Zhi Quan, Tan Kar Way, Lau Hoong Chuin

Publicado 2026-06-16
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Joel Lim Zhi Quan, Tan Kar Way, Lau Hoong Chuin

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive tentando reconstruir a história de um assalto a banco. Em um mundo perfeito, a polícia lhe entregaria um diário cronológico impecável, onde cada entrada diz exatamente quem fez o quê e quando.

Mas, no mundo real, as evidências estão espalhadas. Você tem uma pilha de recibos soltos, uma pilha de registros de câmeras de segurança, algumas notas manuscritas e uma planilha de chamadas telefônicas. Nenhum desses documentos conversa entre si. Os recibos não têm nomes, os registros de câmera não têm carimbos de data/hora e as notas de telefone estão escritas em uma língua diferente. Além disso, o banco muda seu sistema de arquivamento toda semana.

Este é o problema que os autores deste artigo estão resolvendo. Eles estão lidando com sistemas de computação modernos (como bancos ou grandes empresas) onde os dados são bagunçados, espalhados por muitas tabelas diferentes e mudam constantemente. Os métodos tradicionais para analisar esses sistemas falham porque exigem um mapa perfeito e pré-organizado (um "esquema" ou schema) que simplesmente não existe.

Veja como a solução deles funciona, dividida em etapas simples:

O Problema: O "Arquivo Bagunçado"

Nos sistemas de computação da antiga guarda, os dados eram como uma biblioteca bem organizada. Cada livro tinha um rótulo claro e você sabia exatamente em qual prateleira ele pertencia.
Nos sistemas modernos, os dados são como o sótão de um acumulador.

  • Sem Rótulos: Você não consegue dizer facilmente a qual cliente pertence cada dado (falta de "chaves").
  • Pistas Espalhadas: A história de uma única transação está dividida em cinco tabelas diferentes.
  • Linhas do Tempo Confusas: Uma tabela diz "10:00 AM", outra diz "10:05 AM" e uma terceira diz apenas "Ontem".
  • Reforma Constante: O sótão está sendo reorganizado enquanto você tenta limpá-lo.

Por causa disso, construir uma linha do tempo clara do que aconteceu (chamada de "traço de processo") geralmente exige que um especialista humano costure tudo manualmente, o que é lento, caro e propenso a erros.

A Solução: Um Detetive "Agnóstico ao Esquema"

Os autores construíram um pipeline automatizado que atua como um detetive superinteligente que não precisa de um mapa. Em vez de perguntar: "Onde está o mapa?", ele apenas observa as evidências em si para descobrir a história.

Aqui estão as quatro etapas que o seu "detetive" realiza:

1. Identificando as Pistas (Perfilamento)

Primeiro, o sistema varre cada coluna de dados para adivinhar o que ela é.

  • A Caça aos IDs: Ele procura colunas que pareçam nomes únicos (como um ID de cliente). Ele verifica: "Este valor é único? Ele está sempre presente? Parece um nome?"
  • A Caça ao Tempo: Ele procura colunas que pareçam datas. Ele verifica: "Isso parece um carimbo de data/hora? É consistente?"
  • Analogia: Imagine separar uma pilha de peças de quebra-cabeça misturadas. O detetive não precisa da imagem na caixa; ele apenas olha para o formato das peças para adivinhar quais são o céu e quais são a grama.

2. Conectando os Pontos (Descoberta de Relacionamentos)

Como não existem linhas oficiais de "ligue os pontos" (chaves estrangeiras), o sistema utiliza sinais estatísticos.

  • Ele compara colunas de tabelas diferentes. Se a Tabela A tem uma lista de números e a Taabela B tem uma lista de números que coincidem perfeitamente, o sistema assume que elas estão conectadas.
  • Ele ignora as regras "oficiais" e observa os padrões reais dos dados.
  • Analogia: Se você encontra um recibo em um bolso e um extrato de cartão de crédito correspondente em outro, você sabe que eles pertencem à mesma pessoa, mesmo que não estejam grampeados juntos.

3. Construindo a Linha do Tempo (Sequenciamento)

Uma vez que o sistema sabe quais tabelas estão conectadas, ele reúne todos os eventos de um único "caso" (como o pedido de um cliente específico).

  • Ele ordena esses eventos por tempo.
  • Se os tempos forem confusos ou estiverem ausentes, ele usa a lógica para deduzir a ordem.
  • Analogia: O detetive pega todas as notas, recibos e registros espalhados de um assalto específico e os organiza sobre uma mesa para ver a sequência de eventos.

4. Aprendendo o Padrão (O "Cérebro" - TCN)

Esta é a parte mais avançada. Às vezes, os carimbos de data/hora são muito bagunçados para dizer qual evento aconteceu primeiro.

  • O sistema utiliza um tipo especial de IA chamado Rede Neural Convolucional Temporal (TCN). Pense nisso como um motor de reconhecimento de padrões.
  • Ele observa milhares de exemplos passados para aprender: "Geralmente, quando o Evento A acontece, o Evento B se segue."
  • Mesmo que o relógio esteja quebrado, a IA pode prever o próximo passo com base no fluxo da história.
  • Analogia: Se você vê alguém vestindo um casaco, pegando as chaves e abrindo a porta, você sabe que a pessoa está prestes a sair, mesmo que você não tenha visto o momento exato em que ela atravessou a porta. A IA aprende esses "fluxos de história".

Os Resultados: Quão Bom é o Detetive?

Os autores testaram este sistema em dados falsos (simulando bancos bagunçados), em benchmarks padrão e em um conjunto de dados real da indústria.

  • Precisão: Ele previu corretamente a próxima etapa de um processo 85% das vezes.
  • Recuperação: O sistema conseguiu encontrar e reconstruir cerca de 82% da ordem correta dos eventos, mesmo quando os dados estavam faltando ou bagunçados.
  • Resiliência: Quando os dados sofreram "deriva" (mudança de nomes, datas ausentes), o sistema continuou funcionando, enquanto os métodos tradicionais falharam.

Por Que Isso Importa

O artigo argumenta que precisamos parar de esperar por dados perfeitos antes de poder analisá-los. Em vez de forçar dados bagunçados do mundo real em uma caixa rígida e pré-definida, devemos deixar os dados falarem por si mesmos.

Ao remover a necessidade de um "esquema" perfeito (o mapa), esta abordagem permite que as empresas entendam seus próprios sistemas automaticamente, mesmo que esses sistemas sejam desorganizados, em constante mudança ou mal documentados. Ela transforma uma pilha caótica de evidências em uma história clara e legível sem precisar que um humano faça todo o trabalho pesado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →