← 최신 논문
💻 computer science

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

이 논문은 AI City Challenge 2026의 교통 비디오 추론 과제를 해결하기 위해 관찰-추론-행동-검증 워크플로를 사용하는 통합 프레임워크인 UniTraffic-Agent를 소개하며, 교통 이상 징후 추론과 어안 렌즈 이벤트 및 보행자 의도에 대한 두 가지 도메인 외 평가에서 최상위권의 성능을 달성했습니다.

원저자: Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 마치 탐정이 되어 미스터리를 풀고 있다고 상상해 보십시오. 다만 범죄 현장 대신, 당신의 증거는 복잡하게 움직이는 도시 거리의 영상입니다. 이것이 바로 컴퓨터가 도로 위에서 벌어지는 일을 이해하려고 노력하는 분야인 **교통 영상 이해(traffic video understanding)**의 세계입니다. 오랫동안 컴퓨터는 정지된 사진 속에서 빨간 자동차나 정지 표지판 같은 단일 객체를 포착하는 데 뛰어난 능력을 보여왔습니다. 하지만 현실 세계는 사진이 아니라 영화입니다. 교통사고나 충돌 직전의 상황을 이해하기 위해서 컴퓨터는 단순히 '보는' 것을 넘어, 시간을 두고 **관찰하고, 생각하며, 점들을 연결(connect the dots)**해야 합니다. 컴퓨터는 누가, 무엇을, 했는지, 그리고 언제 일어난 일인지를 파악해야 합니다. 이는 교통 영상이 매우 무질서하기 때문에 까다로운 작업입니다. 카메라가 특이한 어안 렌즈일 수도 있고, 사건이 찰나의 순간에 발생할 수도 있으며, 동일한 클립이 여러 가지 서로 다른 질문에 답해야 할 수도 있기 때문입니다. 이 연구의 목표는 카메라 설정이 어떻게 되어 있든 세부 사항을 절대 놓치지 않는, 매우 똑똑하고 인내심 강한 탐정처럼 행동하는 컴퓨터 시스템을 구축하는 것입니다.

여기에 "교통 이상 징후 추론(Traffic Anomaly Reasoning)" 과제에 도전하기 위해 연구진이 만든 새로운 디지털 탐정, UniTraffic-Agent가 등장했습니다. 이 에이전트를 하나의 고도로 조직화된 조사관이라고 생각하십시오. 이 조사관은 영상을 힐끗 보고 추측하는 것이 아니라, **관찰(Observe), 추론(Reason), 실행(Act), 검증(Verify)**이라는 엄격한 4단계 절차를 따릅니다.

먼저, 관찰(Observe) 단계에서 에이전트는 영상을 보는 방식부터 영리하게 접근합니다. 모든 프레임을 다 처리하려고 하는 대신(이는 줄거리 요약만 필요할 때 책의 모든 단어를 읽는 것과 같습니다), 가장 중요한 순간들을 골라냅니다. 만약 특정 시간에 일어난 일에 대한 질문이 있다면, 에이전트는 그 순간의 직전과 직후 몇 초를 확대하여 살펴보는 동시에, 전체적인 맥락을 유지하기 위해 시작과 끝 부분의 프레임도 함께 가져옵니다. 이는 결정적인 단서를 잡기 위해 보안 테이프의 정확히 어느 초 단위 구간을 되감아야 할지 알고 있는 탐정과 같습니다.

다음은 추론(Reason) 단계입니다. 여기서 에이전트의 진가가 드러납니다. 흔히 하나의 영상 클립에는 "누가 신호를 위반했는가?", "날씨는 어떠했는가?", "차량은 얼마나 대기했는가?"와 같이 여러 질문이 붙습니다. 기존 시스템들은 각 질문에 하나씩 답하려고 시도할 수 있는데, 이는 "차량이 빨간색이었다"라고 했다가 다음 답변에서는 "파란색이었다"라고 말하는 것과 같은 모순을 초래할 수 있습니다. UniTraffic-Agent는 방식이 다릅니다. 에이전트는 전체 클립을 한 번에 관찰하여 일어난 일에 대한 단일한 공유 스토리를 구축한 뒤, 그 동일한 이야기를 사용하여 모든 질문에 한꺼번에 답합니다. 이를 통해 탐정의 이야기가 처음부터 끝까지 일관성을 유지하도록 보장합니다.

그다음 실행(Act) 단계가 작동합니다. 서로 다른 작업에는 서로 다른 형식이 필요합니다. 어떤 작업은 단순한 "예/아니오"를 요구할 수 있고, 다른 작업은 교통 위반 사항을 설명하는 13개의 서로 다른 필드가 포함된 상세한 JSON 파일을 요구할 수도 있습니다. 에이전트는 특수한 "어댑터(adapter)"—이를 번역가나 변신 능력자로 생각하십시오—를 사용하여 자신의 공유 스토리를 각 특정 작업에 필요한 정확한 형식으로 재구성합니다.

마지막으로 검증(Verify) 단계는 품질 관리 검사관 역할을 합니다. 에이전트는 답변을 재확인하고, 이름과 시간이 일치하는지 확인하며, 만약 무언가 이상하다면 캐시된 비디오 프레임으로 돌아가 다시 시도합니다. 이 "재시도(retry)" 메커니즘은 에이전트가 인간의 도움 없이도 스스로 실수를 바로잡을 수 있게 해줍니다.

연구진은 이 에이전트를 표준 감시 영상, 왜곡된 어안 렌즈 영상, 그리고 차량용 블랙박스 영상이라는 세 가지 매우 다른 유형의 교통 영상에 테스트했습니다. 결과는 인상적이었습니다. 어안 렌즈 작업에서 에이전트는 모든 경쟁자 중 2위를 차지했으며, 보행자 의도 파악 작업에서는 4위를 기록했습니다. 가장 어렵고 주요한 과제에서도 16위를 차지했습니다. 연구팀은 에이전트가 등장인물을 포착하고 사건의 전반적인 흐름을 파악하는 데는 탁월했지만, 매우 길고 상세한 묘사를 수행하거나 어안 렌즈의 왜곡된 기하학적 구조를 해석하는 데는 때때로 어려움을 겪었다는 것을 발견했습니다. 그러나 이 연구는 스마트한 관찰과 통합된 추론 과정을 결结合함으로써, 이전보다 훨씬 더 신뢰할 수 있고 일관된 교통 AI를 구축할 수 있음을 시사합니다. 이 "탐정"의 코드는 다른 이들이 배우고 개선할 수 있도록 공개되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →