← Últimos artigos
💻 computer science

Hybrid 3D-CNN, Bi-LSTM, and Transformer-Based Framework for Anomaly Detection of Human Behaviour in Video Surveillance with Adaptive Error Minimization

Este artigo propõe um novo framework de aprendizado profundo híbrido que integra arquiteturas 3D-CNN, Bi-LSTM e Transformer com um módulo de limiar adaptativo e otimização de perda multiobjetivo para alcançar a detecção de anomalias em tempo real e de estado da arte em vigilância de vídeo, reduzindo significativamente os alarmes falsos em diversas condições ambientais.

Autores originais: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

Publicado 2026-08-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Sameera yasam, Syed Ali Hussain, Vijaya Kumar Koppula

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo moderno, câmeras de segurança vigiam nossas ruas, estações e edifícios, gerando um fluxo de dados visuais que nenhuma equipe humana seria capaz de monitorar. O desafio para os sistemas de segurança não é apenas ver, mas compreender o que estão vendo em tempo real. Eles devem distinguir entre movimentos comuns e inofensivos e eventos raros e perigosos, como o início de uma briga ou um roubo em andamento. Esta tarefa é notoriamente difícil porque o comportamento "normal" muda constantemente dependendo da hora do dia, da iluminação, da densidade da multidão e do ângulo da câmera. Um sistema que seja sensível demais disparará o alarme para cada sombra ou rajada de vento repentina, criando uma inundação de alertas falsos que esgota os operadores humanos. Por outro lado, um sistema que seja rigoroso demais pode perder uma ameaça genuína por completo. Durante anos, pesquisadores tentaram construir programas de computador que pudessem aprender a diferença entre o mundano e o perigoso, mas a maioria das soluções existentes tem dificuldade em equilibrar esses dois riscos, falhando frequentemente quando a qualidade do vídeo cai ou a cena se torna caótica.

Uma equipe de pesquisadores da SR University e da Koneru Lakshmaiah Education Foundation, na Índia, propôs uma nova abordagem para resolver este problema persistente. Eles projetaram um sistema de computador híbrido que imita a maneira como diferentes partes do céreão humano poderiam processar uma cena, combinando três tipos distintos de inteligência artificial em um único framework cooperativo. Em vez de depender de um único método para observar o vídeo, seu sistema utiliza três "observadores" especializados trabalhando em paralelo. O primeiro observador foi construído para detectar detalhes locais e surtos curtos de movimento, de forma muito semelhante a notar um gesto rápido de mão ou um passo súbito. O segundo observador foca na sequência de eventos ao longo do tempo, compreendendo como uma ação começa, evolui e termina, garantindo que uma pausa ou uma reversão no movimento seja reconhecida como significativa. O terceiro observador observa a cena inteira como um todo, conectando partes distantes do vídeo para entender o contexto mais amplo, como um grupo de pessoas movendo-se junto em um padrão incomum.

A genialidade deste novo framework reside em como esses três observadores trabalham juntos. Em vez de forçá-los a concordar com uma única regra rígida, o sistema aprende a pesar suas opiniões dinamicamente. Se a cena for uma rua movimentada onde o fluxo geral de pessoas é o que mais importa, o sistema ouve mais o observador "global". Se a cena envolver uma ação específica e rápida, ele se apoia no observador "local". Essa flexibilidade permite que o sistema se adapte a diferentes ambientes sem a necessidade de ser reprogramado para cada novo local. Além disso, os pesquisadores abordaram a questão da mudança na qualidade do vídeo, como o granulado de uma filmagem noturna ou o borrão da chuva. Eles construíram um mecanismo de feedback que verifica constantemente a clareza da imagem. Se o vídeo ficar borrado ou ruidoso, o sistema aumenta automaticamente seus padrões para o que conta como um alarme, evitando que ele "toque o alarme em falso" devido à má qualidade da imagem. Se a imagem estiver cristalina, ele se torna mais sensível, pronto para captar até os sinais mais sutis de problemas.

Quando os pesquisadores testaram este sistema em três grandes coleções de filmagens de vigilância do mundo real, os resultados foram impressionantes. O sistema identificou anomalias com um alto grau de precisão, superando os melhores métodos existentes por uma margem significativa. No conjunto de dados mais desafiador, que continha mais de mil horas de vídeos não editados cobrindo treze tipos diferentes de crimes, o novo sistema alcançou uma taxa de sucesso de quase noventa por cento. Em um conjunto de dados de campus com rótulos detalhados quadro a quadro, atingiu uma precisão de quase noventa e oito por cento. Talvez o mais importante para a segurança do mundo real, o sistema reduziu drasticamente o número de alarmes falsos. Ele baixou a taxa de falsos positivos em quase quarenta por cento em comparação com a tecnologia anterior mais avançada, o que significa que os guardas de segurança seriam interrompidos muito menos frequentemente por eventos inofensivos. Ao mesmo tempo, ele perdeu menos ameaças reais, reduzindo a taxa de falsos negativos em mais de trinta por cento.

O sistema também provou ser capaz de operar em tempo real, processando vídeo a uma velocidade de trinta e dois quadros por segundo, o que é rápido o suficiente para acompanhar feeds de vigilância ao vivo. Os pesquisadores confirmaram que a melhoria veio da combinação de todos os três componentes trabalhando juntos; remover qualquer um deles causou uma queda perceptível no desempenho do sistema. Eles também verificaram que o mecanismo adaptativo para lidar com a qualidade do vídeo foi a chave para reduzir erros, pois permitiu que o sistema permanecesse confiável mesmo quando a iluminação mudava ou a câmera tremia. Embora o sistema exija um breve momento para processar um clipe curto de vídeo, introduzindo um atraso de uma fração de segundo, essa troca é considerada aceitável diante do enorme ganho em precisão e confiabilidade.

Este trabalho representa um passo significativo para tornar a vigilância automatizada verdadeiramente prática. Ao se afastar de regras rígidas e universais e caminhar em direção a uma abordagem flexível e de múltiplas perspectivas, os pesquisadores criaram um sistema que é tanto sensível ao perigo quanto robusto contra as imperfeições inevitáveis do vídeo do mundo real. As descobertas sugerem que o futuro da segurança de vídeo não reside na construção de um observador único e perfeito, mas na criação de uma equipe de observadores especializados que podem aprender uns com os outros e se adaptar ao mundo conforme ele muda.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →