← Últimos artigos
💻 computer science

Scene-aware Transformer encoder with Multi Instance Learning-guided Attention Mechanism for Anomaly Detection in Video Surveillance

Este artigo propõe o framework STAM, que integra o aprendizado contrastivo para embeddings conscientes de cena com um codificador transformer guiado pela atenção de Aprendizado de Multi-Instância, para abordar eficazmente as limitações contextuais e temporais na detecção de anomalias em vídeo e alcançar uma precisão superior em conjuntos de dados de referência.

Autores originais: Rifa Nizam Khan, Mohd. Amjad

Publicado 2026-08-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Rifa Nizam Khan, Mohd. Amjad

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o chefe dos seguranças de uma praça imensa e movimentada de uma cidade. Você tem centenas de câmeras transmitindo vídeo ao vivo, mas não pode assistir a todas as telas ao mesmo tempo. Seu trabalho é detectar algo estranho — uma briga, um roubo ou uma pessoa correndo na direção errada. O detalhe complicado é que "estranho" depende inteiramente de onde você está. Em uma biblioteca, alguém correndo é um enorme sinal de alerta. Em um estádio de futebol, isso é apenas parte do jogo. Por muito tempo, programas de computador tentando fazer esse trabalho eram como guardas que olhavam apenas para o movimento. Se alguém corresse, o alarme disparava, mesmo que estivesse em um estádio. Eles não entendiam o contexto da cena. Eles também tinham dificuldade em lembrar o que aconteceu alguns segundos atrás para conectar os pontos. Este artigo aborda esse problema ensinando os computadores não apenas a ver o movimento, mas a entender a "vibe" do lugar que estão vigiando.

Os pesquisadores Rifa Nizam Khan e Mohd. Amjad, da Universidade Jamia Millia Islamia, construíram um novo sistema chamado STAM. Pense nele como um detetive superinteligente que possui duas formas distintas de pensar. Primeiro, ele usa um módulo especial de "percepção de cena" para descobrir exatamente onde está — como saber a diferença entre um parque silencioso e uma estação de trem movimentada. Segundo, ele usa uma ferramenta de memória poderosa (um Transformer) para assistir a clipes curtos de vídeo e identificar quais são suspeitos. A mágica acontece quando essas duas partes conversam entre si. O sistema não olha apenas para um clipe isoladamente; ele pergunta: "Esta ação faz sentido aqui?" Se a resposta for não, ele toca o alarme.

Aqui está como o novo detetive deles funciona, dividido em etapas simples:

A Abordagem de Dois Cérebros
A maioria dos sistemas antigos tentava fazer tudo com um único cérebro, muitas vezes se confundindo. O STAM divide o trabalho.

  1. O Detetive de Cena: Antes de observar a ação, o sistema tira uma instantâneo do ambiente. Ele usa uma técnica de "aprendizado contrastivo" para construir um mapa mental da cena. Imagine como um bibliotecário que sabe que um livro caindo de uma prateleira é normal em uma biblioteca, mas estranho em uma academia. O sistema aprende a reconhecer a "forma" do lugar, criando um cartão de identidade único para cada localização.
  2. O Observador de Ações: Esta parte utiliza uma ferramenta chamada "Rede Convolucional 3D Inflada" (ou I3D). Se você imaginar uma câmera de vídeo normal como uma foto 2D que muda ao longo do tempo, esta ferramenta é como um scanner 3D que vê o vídeo como um bloco sólido de espaço e tempo. Ela captura o movimento e a aparência das pessoas, transformando-os em um relatório detalhado.

O Jogo do "Saco de Trechos"
O sistema não assiste a uma hora inteira de vídeo de uma vez. Em vez disso, ele fatia o vídeo em pequenos pedaços chamados "trechos" (snippets). Ele trata o vídeo inteiro como um "saco" desses trechos. É aqui que o "Aprendizado Multinstância" (MIL) entra em jogo. Pense nisso como um professor corrigindo uma turma. Se um aluno da classe (um trecho) for sinalizado por irregularidades, a classe inteira (o vídeo) é marcada como suspeita. O sistema examina todos os trechos e pergunta: "Qual destes é o encrenqueiro?"

O Mecanismo de Atenção Mágica
Esta é a parte mais legal. O sistema possui um "Token de Cena" (um token CLS) que contém o cartão de identidade do local. Quando o sistema revisa o "saco" de trechos, ele usa esse ID de localização para guiar sua atenção. É como um segurança que sabe que, "Neste corredor específico, as pessoas costumam caminhar devagar. Se eu vir alguém correndo, é nela que preciso focar". O sistema usa um mecanismo de atenção para pesar a importância de cada trecho. Se um trecho parece estranho para aquela cena específica, o sistema lhe dá uma pontuação alta. Se ele parece estranho, mas se encaixa na cena (como correr em um estádio), o sistema o ignora.

Os Resultados: Uma Pontuação Quase Perfeita
Os pesquisadores testaram seu novo sistema STAM em um conjunto de dados famoso de vídeos de vigilância chamado UCF Crime, que contém mais de 1.900 vídeos de eventos do mundo real, como prisões, incêndios criminosos e furtos em lojas. Eles também testaram em um conjunto de dados diferente, o UCF101, para ver se ele conseguiria lidar com ambientes novos e não vistos.

Os resultados foram impressionantes. O sistema STAM alcançou uma precisão de 99,85% e uma pontuação de Área Sob a Curva (AUC) de 99,98%. Para colocar em perspectiva, eles compararam o STAM com outros sistemas inteligentes como "I3D-MIL" e "GAN-MIL", que pontuaram muito abaixo (em torno de 90% a 96%). O artigo sugere que a razão pela qual o STAM vence é que ele finalmente entende o contexto. Ele não apenas vê uma pessoa correndo; ele vê uma pessoa correndo em um lugar onde correr é perigoso.

Por Que Isso Importa
Os autores descobriram que, ao ensinar explicitamente o computador sobre o layout da cena e usar um mecanismo de atenção "consciente da cena", eles puderam reduzir drasticamente os alarmes falsos. No passado, um sistema poderia gritar "Emergência!" porque alguém estava correndo em um parque, embora fosse apenas um corredor. O STAM, porém, sabe a diferença. O estudo mostra que essa abordagem não é apenas um pequeno ajuste, mas um passo significativo para tornar a vigilância por vídeo realmente inteligente o suficiente para lidar com a realidade complexa e desordenada do mundo real. Embora o sistema exija um pouco mais de poder computacional para rodar (levando cerca de 8 minutos por época de treinamento em seu hardware específico), a compensação é um sistema que é muito mais confiável e menos propenso a dar alarmes falsos.

Em resumo, este artigo propõe que, para pegar os bandidos, você não precisa apenas de olhos que vejam o movimento; você precisa de um cérebro que entenda a história do lugar. E com o STAM, os computadores estão finalmente começando a entender a história.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →