Crayotter: Learning Long-Horizon Video Editing Agents via Group-Relative Preference Backpropagation
이 논문은 주관적인 장기 편집 피드백을 서열 비교로 효과적으로 변환하여 의미론적 세그먼트 전반에 걸쳐 크레딧을 재분배함으로써 AgenticVBench와 같은 벤치마크에서 독점 시스템보다 뛰어난 성능을 보이는, 그룹 상대적 선호도 역전파(GRPB)를 통해 학습된 9B 비디오 편집 에이전트인 Crayotter를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 영화 감독이 되는 법을 가르치고 있다고 상상해 보십시오. 당신은 로봇에게 한 더미의 가공되지 않은 비디오 클립과 "멋진 스포츠 하이라이트 영상을 만들어줘"라는 간단한 지시를 내립니다. 로봇은 많은 일을 해야 합니다. 적절한 클립을 찾아내고, 자르고, 타임라인에 배치하고, 음악을 넣고, 최종 파일을 내보내야 합니다. 이것은 매우 긴 과정이며 많은 단계로 이루어져 있습니다. 문제는 당신이 이 최종 영화를 맨 마지막에만 볼 수 있다는 점입니다. 만약 영화가 지루하다면, 당신은 로봇의 어떤 특정 단계가 잘못되었는지 쉽게 알 수 없습니다. 클립을 잘못 골랐나요? 너무 짧게 잘랐나요? 아니면 단순히 순서를 잘못 배치했나요? 인공지능의 세계에서 이것은 "롱 호라이즌(long-horizon)" 문제라고 불립니다. 이것은 마치 누군가에게 케이크를 굽는 법을 가르치면서, 그가 이미 케이크를 다 먹어버린 후에야 "맛이 없다"라고 말하는 것과 같습니다. 당신은 결과가 주관적일지라도(즉, 사람마다 같은 영상에 대해 서로 다른 선호도를 가질 수 있더라도), 그 결과를 만들어낸 특정 단계에 공로(또는 과실)를 돌릴 수 있는 방법이 필요합니다.
이 논문은 이러한 AI 편집기들을 가르치기 위한 새로운 방법인 Crayotter를 소개합니다. 연구진은 로봇에게 전체 영상에 대해 단 하나의 "점수"를 주는 대신, "동일한 소스로 만든 두 가지 다른 버전의 영상 중 어느 것이 더 나은가?"라고 물어야 한다는 것을 깨달았습니다. 동일한 시작 자료를 사용하여 만든 영상들을 서로 비교함으로써, AI는 명확한 순위를 학습할 수 있습니다. 하지만 까다로운 점은 여전히 긴 과정 중 어디에서 AI가 좋거나 나쁜 선택을 했는지 알아내는 것입니다. 저자들은 **그룹 상대적 선호도 역전파(Group-Relative Preference Backpropagation, GRPB)**라고 불리는 방법을 제안합니다. 이것은 단순히 게임 끝에 "잘했어!" 또는 "못했어!"라고 외치는 스마트한 심판이 아니라, 팀 전체의 성과를 살펴보고 누가 승리에 기여했는지 파악하여, 특정 플레이어(이 경우에는 특정 편집 단계)에게 가장 중요한 공로를 돌리되, 단 하나의 단계가 너무 많은 공로를 받거나 너무 많은 비난을 받지 않도록 조절하는 방식입니다.
문제: 비디오 편집의 "블랙박스"
AI가 비디오를 편집하려고 할 때, AI는 일련의 결정 과정을 거칩니다. 영상을 분석하고, 클립을 고르고, 타임라인을 구축하고, 최종 결과물을 렌더링합니다. 문제는 최종 영상의 품질—이야기가 얼마나 잘 흐르는지, 속도감이 적절한지, 혹은 스타일이 요청 사항과 일치하는지 등—은 그 모든 결정이 내려진 후에 비로소 눈에 보인다는 것입니다.
만약 당신이 AI에게 마지막에 단 하나의 숫자(예: "이 영상은 10점 만점에 7점입니다")만 준다면, 그것은 혼란을 줍니다. 그 7점이 AI가 나쁜 클립을 골랐기 때문인가요? 아니면 음악 소리가 너무 커서인가요? 아니 아니면 작업 자체가 정말 어려웠기 때문인가요? 각 편집 작업에는 무엇이 "좋은" 영상인지에 대한 서로 다른 규칙이 있으므로, 서로 다른 작업 간에 점수를 비교하는 것은 사과와 오렌지를 비교하는 것과 같습니다.
논문은 완벽한 글로벌 점수를 계산하려고 노력하는 대신, 비교에 집중해야 한다고 주장합니다. 만약 AI가 동일한 스포츠 하이라이트 영상을 세 가지 다른 버전으로 만든다면, 우리는 "버전 C가 버전 A보다 낫고, 버전 A는 버전 B보다 낫다"라고 쉽게 말할 수 있습니다. 이는 모호하고 주관적인 느낌을 명확하고 논리적인 순서로 바꿔줍니다.
해결책: GRPB와 "지연된(Lagged)" 크레딧 시스템
저자들은 **그룹 상대적 선호도 역전파(GRPB)**를 도입합니다. 이것이 어떻게 작동하는지 재미있는 비유를 통해 설명하겠습니다:
세 팀(팀 A, 팀 B, 팀 C)이 정확히 같은 재료를 받고 스튜를 만들라고 요구받는 요리 경연 대회를 상상해 보십시오. 심사위원이 세 가지를 모두 맛보고 순위를 매깁니다: 팀 C가 우승했고, 팀 A가 2위, 팀 B가 패배했습니다.
기존 방식에서는 심사위원이 우승 팀에게 큰 트로피를 주고 패배한 팀에게 참가상 리본을 줄 수도 있습니다. 하지만 그것은 요리사들에게 무엇을 잘했거나 잘못했는지를 알려주지 않습니다. 팀 C가 우승한 이유가 양파를 더 잘 썰었기 때문인가요? 아니면 적절한 타이밍에 향신료를 넣었기 때문인가요?
GRPB는 경기를 분석하는 매우 똑똑한 코치와 같습니다.
- 그룹: 이 방식은 정확히 동일한 재료(동일한 요청과 소스 클립)를 사용한 팀들만을 비교합니다.
- 제로섬 게임: 순위를 제로섬 게임처럼 취급합니다. 팀 C가 승리하면 점수를 얻고, 다른 팀들은 점수를 잃습니다. 방 안의 총점은 항상 0이 됩니다.
- 지연된 할당자(Lagged Allocator): 이것이 영리한 부분입니다. 코치는 단순히 완성된 스튜를 보고 추측하지 않습니다. 코치는 "지연된" 시스템을 사용합니다. 코치는 이번 배치의 공로를 어떻게 돌릴지 결정하기 위해 이전의 요리 수업들을 살펴봅니다. 이는 코치가 자신의 즉각적인 반응에 의해 혼란을 겪는 것을 방지합니다. 이는 마치 교사가 방금 적어 내려간 채점 기준이 아니라, 지난주에 작성했던 루브릭(평가 기준)을 바탕으로 시험을 채점하는 것과 같습니다.
- 세그먼트 수준의 크레딧: 팀 전체에 점수를 주는 대신, GRPB는 요리 과정을 "다지기", "졸이기", "양념하기"와 같은 세그멘트로 나눕니다. 그리고 어떤 특정 세그먼트가 승리나 패배에 가장 많이 기여했는지 파악합니다. 만약 팀 C가 양파를 완벽하게 다졌다면, 그 특정 단계가 공로를 받습니다. 만약 팀 B가 마늘을 태웠다면, 그 특정 단계가 비난을 받습니다.
- 안전 캡(Safety Caps): AI가 너무 들뜨거나 너무 낙담하는 것을 방지하기 위해, 시스템은 단일 단계가 받을 수 있는 공로나 비난의 양에 "캡(제한)"을 씌웁니다. 또한 "신뢰성 게이트"를 사용하여, 자신의 판단 시스템이 제대로 작동하고 있다고 확신할 때만 공로를 배분하기 시작합니다.
연구 결과
연구진은 이 새로운 방법을 사용하여 90억 개의 파라미터를 가진 AI 모델인 Crayotter를 구축하고 훈련시켰습니다. 그들은 단순한 컷 편집부터 복잡한 다단계 수정까지, 현실적인 편집 작업을 포함하는 시뮬레이션 환경에서 이를 테스트했습니다.
결과는 GRPB가 다른 방법들보다 더 효과적임을 보여주었습니다:
- 더 나은 편집: GRPB로 훈련된 모델이 생성한 영상은 표준 방식으로 훈련된 모델보다 인간 심사위원들로부터 더 자주 선호되었습니다. 블라인드 테스트에서 GRPB 모델은 "베이스(Base)" 모델(원래의 AI)을 상대로 67.1%의 승률을 기록했습니다.
- 더 똑똑한 크레딧 배분: 연구진이 AI가 왜 좋은 영상을 만들었는지 테스트했을 때, GRPB는 특정 편집 단계가 중요하다는 것을 훨씬 더 잘 짚어냈습니다. GRPB는 "승리한" 세그먼트를 20.8%의 확률로 정확히 식별한 반면, 다른 방법들은 11.9%에 그쳤습니다.
- 전문가 이기기: 표준 벤치마크인 AgenticVBench에서 9B 규모의 Crayotter 모델은 테스트된 모든 시스템 중 3위를 차지했으며, 여러 대형 기술 기업의 값비싼 독점 시스템들을 제쳤습니다. 이 모델은 평균 **15.7%**를 기록했으며, 특히 비디오 편집과 매우 유사한 "재구성(Repurpose)" 작업에서는 **23.0%**라는 강력한 점수를 기록했습니다.
이것이 중요한 이유
이 논문은 "정답"이 주관적인 복잡하고 창의적인 작업의 경우, 완벽한 점수가 필요한 것이 아니라, 서로 다른 시도들을 비교하고 어떤 특정 단계가 더 나은 결과를 이끌어냈는지 파악할 수 있는 방법이 필요하다는 것을 시사합니다. 유사한 시도들을 비교하고, 편향을 피하기 위해 자신의 판단을 지연시키며, 프로세스의 특정 부분에 공로를 신중하게 배분함으로써, AI는 훨씬 더 나은 편집어가 될 수 있습니다.
저자들은 이것이 비디오 편집과 같이 명확한 단계와 대안적인 결과가 존재하는 작업에 특화된 솔루션임을 명시하고 있습니다. 그들은 이것이 모든 AI 문제를 해결한다고 주장하는 것이 아니라, 이러한 종류의 "롱 호리즌" 창의적 업무를 위해서는 문제를 로컬하고 비교 가능한 선호도로 나누는 것이 기계에게 창작법을 가르치는 강력한 방법임을 보여준 것입니다. 실험에 사용된 코드와 데이터는 공개되어 있어, 다른 이들도 자신들의 창의적인 AI 프로젝트에 이 "지연된 크레딧" 접근 방식을 적용해 볼 수 있도록 초대하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.