Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification
본 논문은 YOLO11 정밀 조정 탐지, SAM 3 분할, 그리고 Qwen3-VL-8B 를 활용한 새로운 페르소나-비계적 적대적 연쇄 사고 프로토콜을 통합하여 작업자 시점 및 고정 카메라 영상으로부터 OSHA 매핑 안전 보고서를 생성할 때 준수 검증 정밀도를 크게 향상시키고 환각을 줄이는 수동형 교대 종료 건설 안전 모니터링 시스템을 소개합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
건설 현장을 바쁘고 혼란스러운 주방으로 상상해 보세요. 보통 모든 사람의 안전을 지키기 위해서는 24 시간 내내 그곳에 서서, 모든 사람이 앞치마 (헬멧) 을 착용하고, 오븐 장갑 (장갑) 을 사용하고, 열린 화염 (기계) 에 너무 가까이 서 있지 않는지 확인하는 수석 셰프가 필요합니다. 하지만 모든 교대 근무마다 셰프를 고용하는 것은 비용이 많이 들고, 그들은 한 번에 모든 곳에 있을 수 없습니다.
이 논문은 주방을 운영하는 새로운 방식을 제안합니다: 교대 근무 종료 후 안전 감사.
주방을 실시간으로 감시하는 대신, 이 시스템은 두 가지 유형의 카메라로 모든 것을 기록합니다:
- 벽면 카메라: 천장에 설치된 보안 카메라처럼, 방 전체를 감시합니다.
- 바디 카메라: 작업자의 가슴에 고정된 GoPro 처럼, 그들이 무엇을 보고 손으로 무엇을 하는지 정확히 보여줍니다.
하루가 끝날 때, 시스템은 비디오 영상을 검토하여 모든 작업자에 대한 안전 보고서를 작성합니다. 작동 방식은 세 가지 간단한 단계로 나뉩니다:
단계 1: "독수리 눈" (YOLO)
먼저, 빠른 컴퓨터 프로그램 (YOLO11 이라고 함) 이 비디오를 스캔합니다. 이는 매우 빠르고 열정적이지만 완벽하지는 않은 인턴과 같습니다.
- 사람을 가리키며 "저게 작업자야!"라고 말합니다.
- 장비를 가리키며 "저게 헬멧이야!" 또는 "저게 조끼야!"라고 말합니다.
- 요령: 이 인턴은 너무 민감하도록 지시받습니다. 실제 위험 하나를 놓치는 것보다 100 개의 잠재적 문제를 표기하는 것이 낫기 때문입니다. 따라서 손가락처럼 보이는 그림자조차도 표기하여 "아마도 위반" 목록을 길게 만듭니다.
단계 2: "확대" 전문가 (SAM 3)
다음으로, 두 번째 도구 (SAM 3) 가 인턴의 목록을 받아 확대합니다.
- 불필요한 것 제거: 두 명의 작업자가 가까이 서 있으면, 인턴은 누가 헬멧을 쓰고 있는지 혼동할 수 있습니다. 이 도구는 각 사람의 정확한 모양을 잘라내어 배경과 서로 분리합니다.
- 장비를 사람과 매칭: 헬멧이 옆에 서 있는 사람이 아닌, 바로 아래에 서 있는 사람의 것임을 확인합니다.
- 결과: 각 작업자의 장비가 명확하게 보이는 깨끗하고 분리된 이미지를 만들어 최종 심판자에게 준비시킵니다.
단계 3: "세 명의 배심원" (적대적 VLM)
이것이 이 논문의 가장 큰 혁신입니다. 한 번의 AI 에게 최종 결정을 내리게 하는 것 (때로는 "환각"을 일으켜 본 적이 없는 것을 만들어내는 경우) 대신, 시스템은 세 가지 다른 역할을 수행하는 단일 고급 AI(Qwen3-VL) 로 구성된 세 명의 배심원을 사용합니다.
마치 같은 배우가 최종 판결이 나올 때까지 서로 대화하지 않는 세 가지 다른 역할을 연기하는 법정 드라마를 생각해 보세요:
- 현장 검사관 (1 차 통과): 이 캐릭터는 컴퓨터 메모 없이 원본 비디오를 봅니다. 마치 현장의 안전 관리자가 현장을 걷는 것처럼 자신의 눈으로 본 것을 기록합니다. "누군가 뛰는 것을 보았다" 또는 "저 장갑이 없는 것 같다"고 말할 수 있습니다.
- 시니어 관리관 (2 차 통과): 이 캐릭터는 컴퓨터의 메모 (바운딩 박스 및 신뢰도 점수) 와 함께 비디오를 봅니다. 컴퓨터의 작업을 확인합니다. "컴퓨터가 조끼가 없다고 한다. 비디오가 이를 확인하는가?"
- 판사 (3 차 통과): 이 캐릭터는 현장 검사관과 시니어 관리관의 메모를 읽습니다. 다시 비디오를 보지 않고, 다른 두 사람이 작성한 증거만 봅니다. "위반이 실제로 발생했는가?"를 결정해야 합니다.
왜 이렇게 하는가?
논문에 따르면, AI 에게 한 번만 물어보면 과신하여 위반 사항을 만들어냅니다 (환각). AI 를 세 가지 다른 각도에서 스스로 논쟁하게 함으로써 훨씬 더 신중해집니다.
- 현장 검사관이 "장갑 없음"이라고 말하지만 시니어 관리관 (컴퓨터 데이터를 보고 있음) 이 "아니오, 컴퓨터는 그것이 확실하다고 한다"고 말하면, 판사는 결정을 내리기 전에 깊이 생각해야 합니다.
- 시스템은 특별한 규칙을 사용합니다: 컴퓨터가 매우 불확실하면, 판사는 인간과 같은 관찰자의 확인을 기다립니다. 관찰자가 누군가 뛰는 것과 같은 위험한 것을 보이면, 컴퓨터가 놓쳤더라도 판사는 관찰자를 신뢰합니다.
최종 보고서
"판사"가 결정을 내리면, 시스템은 모든 작업자에 대한 보고서를 작성합니다.
- 안전 점수: 등 굽힘이 너무 심한지 확인합니다 (REBA 라는 방법을 사용하는데, 이는 물리 치료사가 자세를 확인하는 것과 같습니다).
- OSHA 규정: 모든 실수를 특정 정부 안전 법규 (예: "낙하 방지") 와 연결합니다.
- 증거: 정확히 무슨 일이 일어났는지 보여주는 비디오의 타임스탬프와 특정 프레임을 포함하여 작업자가 증거를 볼 수 있도록 합니다.
결론
저자들은 이 방법을 건설 현장 비디오 세트로 테스트했습니다. 그 결과, AI 에게 한 번만 보게 하는 것보다 이 "세 명의 배심원" 방식을 사용하면 시스템의 정확도가 12% 향상된 것을 발견했습니다. 실제 위험을 더 많이 포착하고 AI 가 가짜 위험을 만들어내는 것을 막았습니다.
중요한 참고 사항: 논문은 이것이 여전히 "베타" 버전임을 인정합니다. 아직 수천 시간의 비디오로 테스트되지 않았으며, "배심원"은 이를 구축한 사람들 (독립된 전문가가 아님) 에 의해 평가받았습니다. 하지만 결과는 교대 근무가 끝날 때까지 기다려서 이 복잡하고 다단계 검사를 수행하는 것이, 사람이 24 시간 내내 화면을 감시할 필요 없이 건설 현장을 더 안전하게 유지하는 현명하고 저렴한 방법임을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.