← Últimos artigos
🤖 AI

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

Este artigo apresenta um sistema de monitoramento de segurança de construção passivo e de fim de turno que integra detecção YOLO11 ajustada, segmentação SAM 3 e um protocolo inovador de cadeia de pensamento adversarial com andaime de persona usando Qwen3-VL-8B para melhorar significativamente a precisão da verificação de conformidade e reduzir alucinações ao gerar relatórios de segurança mapeados para a OSHA a partir de imagens de câmeras fixas e da perspectiva de trabalho.

Autores originais: Ananth Sriram, Neel Mokaria, Rajveer Singh

Publicado 2026-05-20
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ananth Sriram, Neel Mokaria, Rajveer Singh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um canteiro de obras como uma cozinha movimentada e caótica. Normalmente, para manter todos seguros, é necessário um chef de cozinha supervisionando o local 24 horas por dia, 7 dias por semana, observando cada pessoa para garantir que estejam usando seus aventais (capacetes), luvas de forno (luvas) e não estejam muito perto da chama aberta (máquinas). Mas contratar um chef para cada turno é caro, e eles não podem estar em todos os lugares ao mesmo tempo.

Este artigo propõe uma nova maneira de gerir a cozinha: A Auditoria de Segurança "Fim de Turno".

Em vez de vigiar a cozinha em tempo real, o sistema grava tudo em dois tipos de câmeras:

  1. Câmeras de Parede: Como câmeras de segurança no teto, observando toda a sala.
  2. Câmeras Corporais: Como uma GoPro presa ao peito de um trabalhador, mostrando exatamente o que eles veem e fazem com as mãos.

No final do dia, o sistema revisa as imagens de vídeo para gerar um relatório de segurança para cada trabalhador. Veja como funciona, dividido em três etapas simples:

Etapa 1: O "Olho de Águia" (YOLO)

Primeiro, um programa de computador rápido (chamado YOLO11) analisa o vídeo. É como um estagiário muito rápido e ávido que identifica coisas, mas não é perfeito.

  • Ele aponta para pessoas e diz: "Isso é um trabalhador!"
  • Ele aponta para equipamentos e diz: "Isso é um capacete!" ou "Isso é um colete!"
  • O Truque: Este estagiário recebe a instrução de ser excessivamente sensível. É melhor sinalizar 100 coisas que podem estar erradas do que perder um perigo real. Portanto, ele sinaliza tudo, mesmo que seja apenas uma sombra que se assemelhe a uma luva. Ele cria uma longa lista de "possíveis violações".

Etapa 2: O Especialista em "Zoom" (SAM 3)

Em seguida, uma segunda ferramenta (SAM 3) pega a lista do estagiário e faz o zoom.

  • Cortando a Bagunça: Se dois trabalhadores estiverem muito próximos, o estagiário pode ficar confuso sobre quem está usando o capacete. Esta ferramenta recorta a forma exata de cada pessoa, separando-as do fundo e umas das outras.
  • Vinculando Equipamentos às Pessoas: Ela garante que o capacete pertença à pessoa que está exatamente embaixo dele, e não à pessoa que está ao lado.
  • O Resultado: Ela cria uma imagem limpa e isolada de cada trabalhador com seus equipamentos claramente visíveis, pronta para o juiz final.

Etapa 3: O "Júri de Três Pessoas" (O VLM Adversarial)

Esta é a maior inovação do artigo. Em vez de pedir a uma única IA que tome a decisão final (o que às vezes pode "alucinar" ou inventar coisas que não viu), o sistema utiliza um júri de três pessoas composto por uma única IA avançada (Qwen3-VL) desempenhando três papéis diferentes.

Pense nisso como um drama judicial onde o mesmo ator interpreta três personagens diferentes que não conversam entre si até o veredito final:

  1. O Inspetor de Campo (Passagem 1): Este personagem observa o vídeo bruto sem nenhuma anotação do computador. Ele anota o que vê com seus próprios olhos, assim como um oficial de segurança humano caminhando pelo canteiro. Ele pode dizer: "Vi alguém correndo" ou "Acho que aquela luva está faltando".
  2. O Oficial Sênior (Passagem 2): Este personagem observa o vídeo com as anotações do computador (as caixas delimitadoras e as pontuações de confiança). Ele verifica o trabalho do computador. "O computador diz que um colete está faltando. O vídeo confirma isso?"
  3. O Juiz (Passagem 3): Este personagem lê as anotações do Inspetor de Campo e do Oficial Sênior. Ele não olha o vídeo novamente; ele só examina as evidências que os outros dois escreveram. Ele precisa decidir: "Uma violação realmente aconteceu?"

Por que fazer assim?
O artigo descobriu que, se você pedir à IA apenas uma vez, ela fica excessivamente confiante e inventa violações (alucinações). Ao forçar a IA a debater consigo mesma a partir de três ângulos diferentes, ela se torna muito mais cuidadosa.

  • Se o Inspetor de Campo diz "Sem luva", mas o Oficial Sênior (olhando os dados do computador) diz "Não, o computador tem certeza de que está lá", o Juiz precisa pensar muito antes de tomar uma decisão.
  • O sistema usa regras especiais: Se o computador estiver muito inseguro, o Juiz espera que o observador humano confirme. Se o observador ver algo perigoso (como alguém correndo), o Juiz confia nele, mesmo que o computador tenha perdido.

O Relatório Final

Assim que o "Juiz" toma uma decisão, o sistema gera um relatório para cada trabalhador.

  • Pontuação de Segurança: Verifica se eles estão curvando as costas demais (usando um método chamado REBA, que é como um fisioterapeuta verificando sua postura).
  • Regras da OSHA: Vincula cada erro a leis específicas de segurança governamentais (como "Proteção contra Quedas").
  • Evidência: Inclui um carimbo de data e hora e um quadro específico do vídeo mostrando exatamente o que aconteceu, para que o trabalhador possa ver a prova.

A Conclusão

Os autores testaram isso em um conjunto de vídeos de construção. Eles descobriram que usar este método de "Júri de Três Pessoas" tornou o sistema 12% mais preciso do que apenas pedir à IA para olhar uma vez. Ele detectou mais perigos reais e impediu que a IA inventasse falsos.

Nota Importante: O artigo admite que esta ainda é uma versão "beta". Eles ainda não testaram em milhares de horas de vídeo, e o "júri" foi julgado pelas pessoas que o construíram (e não por especialistas independentes). Mas os resultados sugerem que esperar até o final do turno para executar essa verificação complexa e multifacetada é uma maneira inteligente e acessível de manter os canteiros de obras mais seguros, sem precisar de um humano vigiando as telas 24 horas por dia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →