← 최신 논문
💻 computer science

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

이 논문은 비디오 MLLM을 위한 확장 가능한 강화 학습 프레임워크인 OraRL을 소개하며, 이는 어드밴티지 반전(advantage inversion)을 극복하기 위해 주석을 분리된 어드밴티지 추정 메커니즘 내의 오라클 롤아웃(oracle rollouts)으로 취급함으로써, 기존 방법들과 비교하여 현저히 높은 훈련 효율성과 더 빠른 추론을 통해 시간적 및 공간적 벤치마크에서 우수한 성능을 달성한다.

원저자: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

게시일 2026-08-24
📖 1 분 읽기☕ 가벼운 읽기

원저자: Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기술 요약: 어노테이션을 롤아웃으로 (OraRL)

문제 정의

통합 비디오 인지는 멀티모달 대규모 언어 모델(MLLM)이 시간적 국지화(temporal localization), 공간적 그라운딩(spatial grounding), 객체 추적(object tracking), 세그멘테이션(segmentation)과 같은 세밀한 작업을 수행할 것을 요구합니다. 최근의 범용 MLLM들이 이러한 능력들을 통합하고 있지만, 종종 특정 작업 전문 모델들보다 성능이 떨어지는데, 이는 모델 규모 자체만으로는 불충분하며 사후 학습 정렬(post-training alignment)이 핵심적인 병목 구간임을 시사합니다.

현재의 사후 학습 패러다임은 두 가지 주요 한계점에 직면해 있습니다:

  1. 지도 미세 조정(Supervised Fine-Tuning, SFT): SFT는 어노테이션을 최대 우도 타겟(maximum-likelihood targets)으로 취급하여 출력 형식을 강제하지만, 거의 정답에 가까운 예측과 명백히 틀린 예측을 구분하지 못합니다. 이는 모델이 정밀한 구간이나 마스크를 향하도록 유도하는 작업 수준의 감독(task-level supervision)이 결여되어 있습니다.
  2. 그룹 상대 정책 최적화(Group Relative Policy Optimization, GRPO)를 이용한 강화 학습(RL): 기존의 비디오 RL 방식(예: GRPO)은 프롬프트당 여러 개의 온-폴리시(on-policy) 롤아웃을 샘플링하고 이들의 보상을 비교합니다. 그러나 이러한 방식은 오직 샘플링된 온-폴리시 그룹의 품질에만 의존합니다. 온-폴리시 롤아웃이 정답(GT) 어노테이션이 지정하는 정밀한 구간, 박스 또는 마스크를 복구하는 경우는 드물기 때문에, 많은 학습 그룹이 신뢰할 수 있는 양의 앵커(positive anchor)를 갖지 못하게 됩니다.
  3. 사고 사슬(Chain-of-Thought, CoT)의 한계: CoT 생성은 추론 능력을 향상시키기 위해 사용되지만, 이는 롤아웃을 길게 만들어 학습 및 추론 비용을 증가시키며, 세밀한 인지 작업에서 성능 향상을 보장하지 못합니다.

정답(GT) 어노테이션을 RL 롤아웃 그룹에 "오라클(oracle)" 롤아웃으로 직접 포함하려는 시도는 이득 역전(advantage inversion) 현상 때문에 실패합니다. 고보상 오라클이 그룹 정규화에 포함되면 베이스라인 보상이 높아집니다. 결과적으로, 원래 정책보다는 낫지만 오라클보다는 못한 온-폴리시 롤아웃들은 음의 이득(negative advantage)을 받게 되어, 유용한 탐색을 억제하고 단순 모방을 향해 학습이 붕괴되는 결과를 초래합니다.

방법론: OraRL

본 논문은 모든 어노테이션을 신뢰할 수 있는 양의 타겟(오라클 롤아웃)으로 취급하면서도, 이득 역전을 일으키는 베이스라인 변화를 방지하는 패러다임인 OraRL(Annotation-as-Rollout Reinforcement Learning)을 소개합니다.

핵심 메커니즘

  1. 어노테이션-투-롤아웃 구성:
    어노테이션을 단순히 점수 참조용으로 사용하는 대신, OraRL은 각 어노테이션 yy를 모델의 응답 형식으로 직렬화하여 오라클 롤아웃 ogto_{gt}를 생성합니다. 이 오라클은 nn개의 온-폴리시 롤아웃 그룹에 추가되어 크기가 n+1n+1인 확장된 그룹을 형성합니다. 이는 온-폴리시 탐색을 줄이지 않으면서도 모든 쿼리에 대해 신뢰할 수 있는 양의 타겟을 제공합니다.

  2. 디커플링된 이득 추정(Decoupled Advantage Estimation):
    이득 역전 문제를 해결하기 위해, OraRL은 이득 계산을 분리합니다:

  • 정책 베이스라인(Policy Baseline): 베이스라인 μop\mu_{op}와 표준 편차는 오라클을 제외하고 오직 온-폴리시 보상으로부터만 계산됩니다. 이는 현재 정책보다 뛰어난 성능을 보이는 온-폴리시 롤아웃이 음의 이득을 받지 않도록 보장합니다.
  • 방향성 이득(Directional Gain): 오라클 보상과 온-폴리시 분포 사이의 격차는 방향성 이득 gqg_q로 인코딩됩니다. 이 이득은 온-폴리시 평균보다 높은 성능을 보이는 온-폴리시 롤아웃의 이득을 스케일링하여, 오라클이 현재 정책보다 훨씬 뛰어날 때 신호를 증폭시킵니다.
  • 분리된 오라클 이득(Detached Oracle Advantage): 오라클 롤아웃 자체를 위해 별도의 제한된 이득 항 AgtA_{gt}가 계산됩니다. 이 스케일은 가중치 wqw_q(정책과 오라클 사이의 남은 격차에 기반함)에 의해 보정되며, 오라클이 업데이트를 지배하는 것을 방지하기 위해 가장 강력한 온-폴리시 신호에 의해 캡핑(capped)됩니다.
  1. 부호 균형 프루닝(Sign-Balanced Pruning):
    효율성을 높이기 위해, OraRL은 역전파 전에 롤아웃 그룹을 프루닝합니다. 크기만을 기준으로 하는 프루닝(양의 샘플 혹은 음의 샘플만 남길 수 있음)과 달리, OraRL은 부호 균형 프루닝을 채택합니다:
  • 오라클은 항상 유지됩니다.
  • 나머지 슬롯은 가장 강력한 양의 온-폴리시 롤아웃과 음의 온-폴리시 롤아웃을 각각 유지하여 채워지며, 이를 통해 그래디언트 업데이트가 강화 및 억제 신호를 모두 보존하도록 합니다.
  • **사후 선택 모멘트 보정(Post-selection moment correction)**이 적용되어 이득을 재중심화하고 프루닝 전의 통계치에 맞게 재스케일링함으로써 업데이트 크기의 편향을 방지합니다.
  1. 효율성:
    그룹을 프루닝하고(예: 9개 중 4개 유지) CoT 생성을 피함으로써, OraRL은 CoT를 사용하는 GRPO의 4.9×4.9\times 대비 단 2.2×2.2\times의 스텝 타임(step time)을 달립니다.

주요 기여

  1. 어노테이션-투-롤아웃: CoT를 요구하거나 온-폴리시 탐색을 희생하지 않고도 신뢰할 수 있는 양의 감독을 제공하는 태스크 독립적 메커리즘입니다.
  2. 이득 역전 분석: 나이브한 오라클 혼합 시 발생하는 "이득 역전" 현상을 식별하고, 정책 이득과 오라클 가이드를 분리하는 디커플링된 이득 추정을 통해 해결책을 제시했습니다.
  3. 부호 균형 프루닝: 이득의 부호와 오라클을 모두 유지하는 프루닝 전략을 제안하였으며, 모멘트 보정을 결려 전체 그룹 최적화 대비 1.48×1.48\times의 속도 향상을 달성했습니다.
  4. Video-ORA: OraRL로 훈련된 통합 비디오 인지 모델로, 다양한 모델 규모(0.8B ~ 9B)와 데이터 예산 전반에서 일관된 성능 향상을 입증했습니다.

실험 결과

저자들은 Video-ORA(Qwen3.5 백본 기반)를 훈련하고 7가지 작업군(시간적 그라운딩, 공간적 그라운딩, 세그멘테이션, 시각적 추적, 시공간적 그라운딩, 비디오 QA, 공간 지능)에 대해 평가했습니다.

  • 성능 향상:

    • 시간적 그라운딩(Temporal Grounding): Video-ORA-9B는 세 가지 TimeLens 벤치마크에서 mIoU 61.8, 63.6, 72.5를 달성하여, 시간적 전문 모델인 TimeLens2-8B와 GPT-5, Gemini-3-Pro와 같은 독점 모델들을 능가했습니다.
    • 시각적 추적(Visual Tracking): GOT-10k에서 Video-ORA-9B는 AO(Average Overlap) 78.2를 기록하며, 이전 최고 오픈 소스 모델인 OneThinker-8B를 5.2 포인트 차이로 앞질렀습니다.
    • 세그멘테이션(Segmentation): RefCOCO(cIoU 79.4) 및 MeViS(J&F 61.3)에서 선두 성적을 거두었습니다.
    • 공간 지능(Spatial Intelligence): VSI-Bench에서 Video-ORA-9B는 73.1점을 기록하여 GPT-5(55.0)와 Gemini-3-Pro(55.1)를 능가했습니다.
    • 비디오 QA(Video QA): 7개 중 5개 비디오 QA 벤치마크에서 오픈 소스 모델 중 1위를 차지했습니다.
  • 스케일링 및 효율성:

    • 모델 스케일링: Video-ORA는 모든 규모(0.8B, 2B, 4B, 9B)에서 백본보다 개선된 성능을 보였으며, 매크로 평균 이득은 모델 크기에 따라 증가했습니다.
    • 데이터 스케일링: OraRL은 10만 개의 프롬프트까지의 데이터 예산 전반에서 GRPO 및 SFT보다 우수한 성능을 보였습니다.
    • 추론 지연 시간: CoT 없이, Video-ORA-9B는 10분 길이 비디오에 대한 중앙값 엔드-투-엔드 지연 시간을 CoT 백본의 29.0초에서 24.3초로 단축했습니다.

의의 및 주장

본 논문은 OraRL이 통합 비디오 인지를 위한 효율적이고 확장 가능한 강화 학습 원칙으로서 "어노테이션-투-롤아웃"을 확립한다고 주장합니다. 저자들은 다음과 같이 주장합니다:

  • 비디오 인지의 세밀한 정밀도는 모델 규모 자체보다 태스크에 정렬된 사후 학습에 의해 결정됩니다.
  • (디커플링된 이득을 통해 적절히 처리될 경우) 직접적인 오라클 통합은 고품질 온-폴리시 롤아웃의 부족함을 극복할 수 있는 신뢰할 수 있는 양의 타겟을 제공합니다.
  • 이러한 작업에는 CoT 추론이 필수적이지 않으며, 직접적인 오라클 감독이 더 높은 정확도와 효율성을 제공합니다.
  • 이 방법은 다양한 백본 패밀리(Qwen3-VL, Qwen3.5)와 작업 유형(국지화, 추적, QA, 공간 추론)에 걸쳐 일반화될 수 있습니다.

저자들은 한계점 또한 언급했습니다. 구체적으로, 현재의 공식은 어노테이션이 유효한 오라클 롤아웃으로 직렬화될 수 있고 스칼라 보상으로 평가될 수 있음을 가정하며, 모호하거나 노이즈가 섞인 감독 하에서의 동작은 평가되지 않았습니다. 또한, Video-ORA가 많은 오픈 소스 비교에서 앞서고 있지만, 일부 복잡한 공간 추론 작업에서는 여전히 가장 강력한 독점 모델들에 비해 뒤처져 있음을 인정했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →