Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning
이 논문은 약한 지도 학습 비디오 장면 그래프 생성 (WS-VSGG) 의 성능을 향상시키기 위해, 오프더셸 검출기로 인한 노이즈가 많은 객체 쌍을 억제하고 상호작용 가능성이 높은 쌍에 집중할 수 있도록 '쌍 친화도 학습 (PALS)'과 '관계 인식 매칭 (RAM)' 기법을 제안합니다.
원저자:Minseok Kang, Minhyeok Lee, Minjung Kim, Jungho Lee, Donghyeong Kim, Sungmin Woo, Inseok Jeon, Sangyoun Lee
비디오를 분석할 때, 우리는 화면에 있는 사람, 사물, 그리고 그들 사이의 관계 (예: "사람이 컵을 들고 있다") 를 찾아내야 합니다. 이를 비디오 장면 그래프 생성이라고 합니다.
기존 방식 (완전 감독): 모든 프레임에 "누가, 무엇을, 어떻게" 하고 있는지 **정확한 박스 (Bounding Box)**를 일일이 그려서 가르쳐야 합니다. 마치 배우에게 대본을 하나하나 외우게 하는 것처럼 비용이 너무 많이 듭니다.
이 연구의 방식 (약한 감독): 비용 절감을 위해 "중간 프레임에 '사람이 컵을 들고 있다'는 문장만" 알려주고, 박스는 그립니다. 하지만 문제는 박스를 직접 그려주지 않기 때문에, 컴퓨터가 화면에서 사물을 찾을 때 **무작위 탐지기 (Off-the-shelf detector)**를 쓴다는 점입니다.
🕵️♂️ 문제: "소음"이 너무 많아요!
기존의 완전 감독 방식은 관계가 있는 사물만 골라내지만, 약한 감독 방식은 화면에 보이는 모든 사물을 다 찾아냅니다.
상황: 화면에 '사람'이 있고, '컵'이 여러 개 있습니다. 하나는 사람이 들고 있는 컵 (진짜 컵), 다른 하나는 바닥에 떨어진 컵 (무관한 컵) 입니다.
기존 방식의 실수: 컴퓨터는 "사람"과 "컵"이라는 단어만 보고, 바닥에 있는 컵과도 관계를 맺으려 합니다. "사람이 바닥 컵을 들고 있다"라고 잘못 추측하는 거죠.
결과: 관계 예측 모델은 **진짜 관계 (Interactive)**와 **가짜 관계 (Non-interactive)**를 구별하지 못해 엉뚱한 결론을 내립니다.
💡 해결책: "상호작용 친밀도 (Pair Affinity)"를 배우다
저자들은 이 문제를 해결하기 위해 세 가지 핵심 기술을 개발했습니다.
1. RAM (관계 인식 매칭): "진짜 컵을 찾아라!"
비유: 수사관이 "사람이 들고 있는 컵"이라는 단서를 가지고 수색할 때, 단순히 '컵'이라고 적힌 모든 물건을 다 잡지 않고, 사람의 손과 연결된 컵을 찾아내는 기술입니다.
원리: 컴퓨터가 "사람이 들고 있는 컵"이라는 문장을 보고, **시각 - 언어 모델 (Vision-Language Model)**을 이용해 화면 속 실제 컵 중 어떤 컵이 그 문장과 가장 잘 어울리는지 찾아냅니다.
효과: 바닥에 떨어진 컵은 제외하고, 진짜 들고 있는 컵만 '정답'으로 가르쳐 줍니다.
2. PALS (상호작용 친밀도 학습): "이 두 사물은 친한가?"
비유: 파티에 초대된 사람들과 사물들을 볼 때, **"이 두 사람은 서로 대화하고 있는가?"**를 판단하는 능력입니다.
원리: 컴퓨터는 사물 두 개가 서로 **상호작용 (Interaction)**하고 있는지, 아니면 그냥 우연히 같은 화면에 있는 것인지 **점수 (Affinity Score)**를 매기도록 훈련합니다.
효과: "사람"과 "바닥 컵"은 점수가 낮아 (친하지 않아) 무시하고, "사람"과 "들고 있는 컵"은 점수가 높아 (친해서) 중요하게 다룹니다.
3. PAM (상호작용 친밀도 조절): "소음 차단 필터"
비유: 회의실 안에서 진짜 중요한 대화만 들을 수 있도록, 소음 (무관한 사물들) 을 차단하는 필터입니다.
원리: 컴퓨터가 사물들 사이의 관계를 추론할 때 (Attention), 점수가 낮은 (상호작용 없는) 사물들은 무시하고, 점수가 높은 (상호작용 있는) 사물들끼리만 정보를 주고받게 합니다.
효과: 화면에 수많은 사물이 있어도, 컴퓨터는 진짜 관계에 집중할 수 있게 됩니다.
🏆 결과: 왜 이 연구가 중요한가요?
이 세 가지 기술을 합치면, 박스 (정답) 없이도 거의 박스가 있는 수준 (완전 감독) 의 성능을 낼 수 있습니다.
기존: "사람이 컵을 들고 있다"라고 말할 때, 바닥 컵까지 포함해서 엉뚱한 답을 많이 냈습니다.
이 연구: "사람이 들고 있는 컵"만 정확히 찾아내고, 바닥 컵은 무시합니다.
성능: 기존 약한 감독 방식보다 정확도가 크게 향상되었으며, 완전 감독 방식의 성능을 **88%~94%**까지 따라잡았습니다.
📝 한 줄 요약
"비디오 속 사물들이 서로 '친한지 (상호작용하는지)'를 판별하는 능력을 가르쳐서, 컴퓨터가 엉뚱한 사물들과 관계를 맺는 실수를 줄이고, 진짜 중요한 관계만 찾아내게 만든 연구입니다."
이 기술은 비디오 분석, 로봇이 세상을 이해하는 능력, 그리고 비디오 검색 등 다양한 분야에서 비용은 줄이고 성능은 높이는 혁신이 될 것입니다.
1. 연구 배경 및 문제 정의 (Problem)
비약적 약지도 학습 (Weakly-Supervised Learning) 의 한계: 비디오 장면 그래프 생성 (VSGG) 은 비디오 콘텐츠를 <주체, 관계, 객체> 형태의 구조화된 삼중항 (triplets) 으로 파싱하는 작업입니다. 완전 지도 학습 (Fully-Supervised) 은 모든 프레임에 대한 바운딩 박스와 관계 레이블이 필요하여 비용이 매우 높습니다. 이를 해결하기 위해 약지도 학습 (WS-VSGG) 이 제안되었는데, 이는 중간 프레임의 '위치 불명 (unlocalized)' 삼중항 레이블만 사용합니다.
핵심 문제: 검출기 (Detector) 와 관계 모델 간의 불일치 기존 WS-VSGG 방법론은 오프더셸 (off-the-shelf) 객체 검출기를 사용하여 객체 후보를 생성한 후, 클래스 매칭을 통해 관계 레이블을 할당합니다. 그러나 이 과정에서 다음과 같은 근본적인 문제가 발생합니다.
노이즈가 많은 객체 제안: 완전 지도 학습용 검출기는 상호작용이 있는 객체 위주로 학습되지만, 오프더셸 검출기는 프레임 내 모든 가시 객체를 탐지합니다. 이로 인해 상호작용과 무관한 객체 쌍 (non-interactive pairs) 이 관계 모델에 대량으로 유입됩니다.
훈련 - 추론 분포 격차 (Train-Test Distribution Gap): 기존 방법은 훈련 시 '매칭된 (상호작용 있는) 쌍'만 학습하고 '매칭되지 않은 쌍'은 완전히 폐기합니다. 하지만 추론 시에는 훈련 중 보지 못한 수많은 '비상호작용 쌍'이 입력으로 들어오게 되어, 모델이 노이즈에 취약해지고 성능이 저하됩니다.
클래스 수준 매칭의 모호성: 위치 정보가 없는 레이블과 객체 검출 결과를 클래스 이름만으로 매칭할 때, 같은 클래스의 객체가 여러 개 존재하면 잘못된 매칭 (False Match) 이 발생하여 레이블 노이즈를 유발합니다.
2. 제안 방법론 (Methodology)
저자들은 **Pair Affinity Learning and Scoring (PALS)**을 중심으로 한 통합 프레임워크를 제안하며, 세 가지 핵심 구성 요소로 이루어져 있습니다.
A. 관계 인식 매칭 (Relation-Aware Matching, RAM)
목적: 클래스 이름만 있는 약지도 레이블과 검출된 객체 간의 매칭 오류를 줄이고, 더 깨끗한 감독 신호를 생성합니다.
작동 원리:
비전 - 언어 (Vision-Language, VL) 모델 (예: GroundingDINO) 을 활용하여 관계 설명 텍스트 (예: "사람이 들고 있는 컵") 를 특정 객체 인스턴스에 지상화 (grounding) 합니다.
VL 모델의 크로스 어텐션 맵을 분석하여, 관계 설명과 가장 일치하는 객체 인스턴스를 선택합니다.
신뢰도 추정: 어텐션 맵의 공간적 집중도를 기반으로 매칭의 신뢰도를 평가하여, 신뢰도가 낮은 경우 클래스 수준 매칭으로 백업하거나 삼중항을 폐기합니다.
효과: 동일한 클래스 내에서도 상호작용에 참여하는 올바른 객체만 양수 (positive) 레이블로 선별하여, PALS 학습을 위한 깨끗한 데이터 분할을 제공합니다.
B. 쌍 친밀도 학습 및 점수화 (Pair Affinity Learning and Scoring, PALS)
목적: 상호작용 유무를 명시적으로 학습하여, 추론 시 비상호작용 쌍을 억제합니다.
작동 원리:
관계 예측 모델 내부에 **관계 임베딩 (Relation Embedding)**과 **쌍 친밀도 임베딩 (Pair Affinity Embedding)**이라는 두 가지 병렬 표현을 도입합니다.
학습: RAM 을 통해 정제된 '매칭된 쌍 (Positive)'과 '매칭되지 않은 쌍 (Negative)'을 모두 활용합니다. Positive 쌍은 관계 분류와 친밀도 학습에, Negative 쌍은 친밀도 학습 (부정 샘플) 에 사용됩니다.
추론: 최종 삼중항 점수 계산 시, 검출 신뢰도와 관계 분류 점수 외에 학습된 **쌍 친밀도 점수 (Pair Affinity Score)**를 곱하여 반영합니다.
Score(s,p,o)=confs⋅confo⋅PCp⋅PA(s,o)
효과: 상호작용 가능성이 낮은 객체 쌍은 점수가 낮아져 상위 순위에서 제외됩니다.
C. 쌍 친밀도 변조 (Pair Affinity Modulation, PAM)
목적: 모델 내부의 컨텍스트 추론 (Contextual Reasoning) 과정에서 비상호작용 쌍이 주는 노이즈를 차단합니다.
작동 원리:
현대적인 VSGG 아키텍처 (Spatial/Temporal Attention) 는 모든 객체 쌍 간의 상호작용을 고려하여 표현을 정제합니다. 이때 비상호작용 쌍이 포함되면 관계적 맥락이 희석됩니다.
PAM 은 학습된 쌍 친밀도 임베딩을 기반으로 **어텐션 로짓 (Attention Logits) 을 게이트 (Gate)**합니다.
상호작용이 있는 쌍끼리는 강한 어텐션을, 비상호작용 쌍은 어텐션 흐름을 차단하도록 변조합니다.
효과: 프레임 내 (Spatial) 및 프레임 간 (Temporal) 컨텍스트 추론의 정확도를 높여, 노이즈가 많은 환경에서도 안정적인 예측을 가능하게 합니다.
3. 주요 기여 (Key Contributions)
문제 인식 및 해결: 약지도 비디오 장면 그래프 생성에서 발생하는 '검출기 분포의 변화'와 '비상호작용 쌍의 노이즈' 문제를 최초로 체계적으로 분석하고 해결책을 제시했습니다.
새로운 학습 패러다임: 기존에 폐기되던 '매칭되지 않은 쌍'을 쌍 친밀도 학습을 위한 부정 샘플로 적극 활용하여, 훈련 - 추론 분포 격차를 해소했습니다.
RAM, PALS, PAM 통합 프레임워크:
RAM: VL 모델을 활용한 정밀한 레이블 정제.
PALS: 추론 시 순위 재배열을 위한 상호작용 확률 학습.
PAM: 내부 어텐션 메커니즘을 통한 노이즈 필터링.
이 세 가지 요소가 시너지를 내어 성능을 극대화합니다.
플러그 앤 플레이 (Plug-and-Play) 특성: 제안된 모듈 (특히 PAM) 은 기존 어텐션 기반 아키텍처 (STTran, DSG-DETR 등) 에 쉽게 적용 가능하며, 추론 시 추가적인 계산 오버헤드가 거의 없습니다.
4. 실험 결과 (Results)
데이터셋: Action Genome (AG) 데이터셋을 사용했습니다.
성능:
기존 최첨단 (SOTA) 약지도 방법론 (PLA, TRKT) 과 다양한 백본 (STTran, DSG-DETR) 에서 일관된 개선을 보였습니다.
With Constraint 설정에서 R@10 기준 평균 +5.47 포인트, No Constraint 설정에서 +6.43 포인트 향상.
완전 지도 학습 (Fully-Supervised) 모델의 성능 대비 88.3% (With Constraint) 및 94.3% (No Constraint) 수준까지 약지도 학습의 성능 격차를 좁혔습니다.
Ablation Study:
RAM 만 적용하면 미미한 향상, PALS 만 적용하면 큰 향상, PAM 추가 시 추가적인 개선이 확인되었습니다.
특히 PAM 은 비상호작용 쌍 비율이 높은 비디오에서 성능 향상이 두드러졌습니다.
클래스 불균형 문제를 해결하기 위한 Class-Balanced BCE 손실 함수가 쌍 친밀도 학습의 분포 분리 (Separation) 에 결정적인 역할을 했습니다.
5. 의의 및 결론 (Significance)
이 논문은 약지도 비디오 장면 그래프 생성 분야에서 객체 간 상호작용 (Interactivity) 을 명시적으로 모델링하는 것이 핵심임을 증명했습니다.
비용 효율성: 바운딩 박스 없이도 완전 지도 학습에 근접하는 높은 성능을 달성하여, 대규모 비디오 데이터에 대한 구조적 이해의 실용성을 높였습니다.
일반화 가능성: 제안된 '쌍 친밀도 학습' 및 '어텐션 변조' 기법은 장면 그래프 생성뿐만 아니라, 약지도 환경에서의 다른 비전 - 언어 태스크에도 적용 가능한 일반적인 원리로 확장 가능성이 있습니다.
기술적 통찰: 단순히 더 많은 데이터를 학습하는 것을 넘어, 어떤 데이터 (상호작용 쌍 vs 비상호작용 쌍) 를 어떻게 학습하고 추론에 활용하느냐가 약지도 학습의 성패를 좌우한다는 중요한 통찰을 제공했습니다.
요약하자면, 이 연구는 약지도 학습의 한계를 극복하기 위해 **정제된 레이블 (RAM), 상호작용 확률 학습 (PALS), 그리고 노이즈 필터링 어텐션 (PAM)**을 결합한 강력한 프레임워크를 제시함으로써, 비디오 이해 분야의 새로운 기준을 설정했습니다.