← Nieuwste papers
🤖 AI

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

Dit artikel introduceert een passief, aan het einde van de dienst ingezet systeem voor het bewaken van bouwveiligheid dat fijnafgestemde YOLO11-detectie, SAM 3-segmentatie en een nieuw door persona-gestructureerd protocol voor adversariale ketens van denken met Qwen3-VL-8B integreert om de precisie van nalevingsverificatie aanzienlijk te verbeteren en hallucinaties te verminderen, terwijl er OSHA-gekartelde veiligheidsrapporten worden gegenereerd op basis van beelden vanuit het perspectief van de werknemer en van vaste camera's.

Oorspronkelijke auteurs: Ananth Sriram, Neel Mokaria, Rajveer Singh

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ananth Sriram, Neel Mokaria, Rajveer Singh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een bouwplaats voor als een drukke, chaotische keuken. Normaal gesproken heb je om iedereen veilig te houden een chef-kok nodig die 24/7 aanwezig is, die elke persoon in de gaten houdt om ervoor te zorgen dat ze hun schorten (helmen) dragen, ovenwanten (handschoenen) gebruiken en niet te dicht bij de open vlam (machines) staan. Maar het inhuren van een kok voor elke shift is duur, en ze kunnen niet overal tegelijk zijn.

Dit artikel stelt een nieuwe manier voor om de keuken te runnen: De "Einde-Shift" Veiligheidsaudit.

In plaats van de keuken in real-time te bewaken, neemt het systeem alles op met twee soorten camera's:

  1. Muurcamera's: Zoals beveiligingscamera's aan het plafond, die de hele ruimte in de gaten houden.
  2. Lijfcamera's: Zoals een GoPro die op de borst van een werknemer is bevestigd, en precies laat zien wat zij zien en doen met hun handen.

Aan het einde van de dag bekijkt het systeem de videobeelden om een veiligheidsrapport voor elke werknemer te schrijven. Hier is hoe het werkt, opgesplitst in drie eenvoudige stappen:

Stap 1: Het "Adoog" (YOLO)

Eerst scant een snel computerprogramma (YOLO11) de video. Het is als een zeer snelle, enthousiaste stagiair die dingen opmerkt maar niet perfect is.

  • Hij wijst naar mensen en zegt: "Dat is een werknemer!"
  • Hij wijst naar uitrusting en zegt: "Dat is een helm!" of "Dat is een hesje!"
  • De Truc: Deze stagiair krijgt de opdracht om te gevoelig te zijn. Het is beter om 100 dingen te markeren die misschien verkeerd zijn dan één echt gevaar te missen. Dus markeert hij alles, zelfs als het slechts een schaduw is die op een handschoen lijkt. Hij maakt een lange lijst van "misschien-overtredingen".

Stap 2: De "Inzoomen"-Specialist (SAM 3)

Vervolgens neemt een tweede tool (SAM 3) de lijst van de stagiair en zoomt in.

  • De Rommel Wegwerken: Als twee werknemers dicht bij elkaar staan, kan de stagiair in de war raken over wie de helm draagt. Deze tool snijdt de exacte vorm van elke persoon uit, scheidt hen van de achtergrond en van elkaar.
  • Uitrusting Koppelen aan Mensen: Het zorgt ervoor dat de helm toebehoort aan de persoon die er direct onder staat, niet aan de persoon ernaast.
  • Het Resultaat: Het creëert een schone, geïsoleerde afbeelding van elke werknemer met hun uitrusting duidelijk zichtbaar, klaar voor de finale rechter.

Stap 3: De "Drie-Persoonsjury" (De Adversariële VLM)

Dit is de grootste innovatie van het artikel. In plaats van één AI te vragen de uiteindelijke beslissing te nemen (wat soms kan "hallucineren" of dingen verzint die het niet zag), gebruikt het systeem een drie-persoonsjury bestaande uit één geavanceerde AI (Qwen3-VL) die drie verschillende rollen speelt.

Stel je dit voor als een rechtszaal-drama waar dezelfde acteur drie verschillende personages speelt die niet met elkaar praten tot het definitieve vonnis:

  1. De Veldinspecteur (Doorgang 1): Dit personage kijkt naar de ruwe video zonder enige computernotities. Ze schrijft op wat ze met eigen ogen ziet, net als een menselijke veiligheidsfunctionaris die over de bouwplaats loopt. Ze kunnen zeggen: "Ik zag iemand rennen," of "Ik denk dat die handschoen ontbreekt."
  2. De Senior Functionaris (Doorgang 2): Dit personage kijkt naar de video met de computernotities (de omkaderende vakken en betrouwbaarheidsscores). Ze controleren het werk van de computer. "De computer zegt dat een hesje ontbreekt. Bevestigt de video dit?"
  3. De Rechter (Doorgang 3): Dit personage leest de notities van de Veldinspecteur en de Senior Functionaris. Ze kijken niet opnieuw naar de video; ze kijken alleen naar het bewijs dat de andere twee hebben opgeschreven. Ze moeten beslissen: "Is er echt een overtreding gepleegd?"

Waarom dit doen?
Het artikel vond dat als je de AI slechts één keer vraagt, het oververzekerd raakt en overtredingen verzonnen (hallucinaties). Door de AI te dwingen zichzelf vanuit drie verschillende hoeken te betwisten, wordt het veel voorzichtiger.

  • Als de Veldinspecteur zegt "Geen handschoen" maar de Senior Functionaris (die naar de computerdata kijkt) zegt "Nee, de computer is zeker dat het er is", moet de Rechter goed nadenken voordat ze een beslissing neemt.
  • Het systeem gebruikt speciale regels: Als de computer erg onzeker is, wacht de Rechter tot de mensachtige waarnemer bevestigt. Als de waarnemer iets gevaarlijks ziet (zoals iemand rennen), vertrouwt de Rechter hen, zelfs als de computer het gemist heeft.

Het Eindrapport

Zodra de "Rechter" een beslissing neemt, schrijft het systeem een rapport voor elke werknemer.

  • Veiligheidsscore: Het controleert of ze te veel naar achteren buigen (met een methode genaamd REBA, die lijkt op een fysiotherapeut die je houding controleert).
  • OSHA-regels: Het koppelt elke fout aan specifieke overheidsveiligheidswetten (zoals "Valbeveiliging").
  • Bewijs: Het bevat een tijdstempel en een specifiek frame uit de video dat precies laat zien wat er gebeurd is, zodat de werknemer het bewijs kan zien.

De Conclusie

De auteurs hebben dit getest op een reeks bouwvideo's. Ze ontdekten dat het gebruik van deze "Drie-Persoonsjury"-methode het systeem 12% nauwkeuriger maakte dan het AI slechts één keer laten kijken. Het pakte meer echte gevaren op en voorkwam dat de AI neppe verzint.

Belangrijke Opmerking: Het artikel geeft toe dat dit nog steeds een "beta"-versie is. Ze hebben het nog niet getest op duizenden uren video, en de "jury" werd beoordeeld door de mensen die het bouwden (niet door onafhankelijke experts). Maar de resultaten suggereren dat wachten tot het einde van de shift om deze complexe, meerstapscontrole uit te voeren, een slimme, betaalbare manier is om bouwplaatsen veiliger te houden zonder dat er een mens nodig is om 24/7 naar de schermen te kijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →