← 최신 논문
💬 NLP

Plans You Can Check: Verifier-Grounded Learning of an Open-Weight Planner for Executable Video-Editing

이 논문은 결정론적 검증기를 활용하여 다중 교사(multi-teacher)의 수정을 증류하고 선호도를 정제함으로써, 추론 시 교사 호출 없이도 8B 모델이 새로운 벤치마크에서 프런티어급 교사들을 능가할 수 있도록 하는 실행 가능한 비디오 편집을 위한 오픈 웨이트 플래너인 RefineCut을 소개한다.

원저자: Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoyu Wang, Cheng Feng, Liuyang Bian, Ruiyang Huang, Lei Wei, Yafei Wen, Xiaoxin Chen, Xiaoying Tang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서, 새로운 이미지를 생성하는 행위와 기존의 이미지를 조직하는 행위를 구분하는 흔한 구분이 존재한다. 많은 시스템이 단순한 아이디어를 완전히 새로운 그림으로 바꾸는 것처럼, 아무것도 없는 상태에서 픽셀을 그려내는 법을 배웠지만, 비디오를 편집하는 과제는 다르다. 실제 세상의 비디오 편집은 새로운 빛을 생성하는 것이라기보다 일련의 엄격한 결정을 내리는 것에 가깝다. 편집자는 기존 푸티지(footage)의 더미를 보고, 어떤 클립을 남길지 결정하고, 각 클립을 얼마나 길게 재생할지 정하며, 어디에 배치할지 파악하고, 컷이 사운드트랙의 리듬과 일치하도록 만들어야 한다. 이 과정은 제약 조건의 퍼즐이다. 최종 비디오는 특정 길이를 가져야 하고, 특정 장면을 포함해야 하며, 다른 장면은 제외해야 하고, 음악과 완벽하게 동기화되어야 한다. 컴퓨터가 이 작업을 수행하기 위해서는 단순히 추측하는 것이 아니라, 규칙 목록에 따라 검증할 수 있는 계획을 따라야 한다.

한 연구팀은 비디오 편집을 창의적인 추측 게임이 아닌, 검증 가능한 계획 수립 과제로 다룸으로써 이 문제를 해결했다. 그들은 작고 개방형인 컴퓨터 모델이 이러한 편집 계획을 만들 수 있도록 가르치는 '리파인컷(RefineCut)'이라는 시스템을 구축했다. 거대하고 폐쇄적인 모델에 의존하여 정답을 추측하는 기존 방식들과 달리, 리파인컷은 2단계 학습 과정을 사용한다. 먼저, 이 시스템은 여러 강력한 AI 스승들의 무질서하고 종종 상충하는 제안들을 가져와 엄격한 자동 검사기를 통과시킨다. 이 검사기는 디지털 편집자처럼 작동하며, "비디오는 30초 길이여야 한다" 또는 "이 특정 클립은 반드시 포함되어야 한다"와 같은 명확한 요구 사항 목록에 대해 모든 제안된 변경 사항을 테스트한다. 이 테스트를 통ผ่าน한 제안들만이 학생 모델이 학습할 수 있는 예시로 남는다. 이는 모델이 스승의 실수나 추측을 복제하는 대신, 검증된 성공 사례로부터 배우도록 보장한다.

그 후 연구진은 모델이 자신의 작업물을 스스로 개선하는 법을 배우는 두 번째 훈련 단계를 도입했다. 모델은 인간이나 스승이 편집을 채점하기를 기다리는 대신, 문제에 대한 여러 가지 가능한 해결책을 생성하고, 자동 검사기가 규칙을 얼마나 잘 준수하는지에 따라 점수를 매기게 한다. 모델은 가장 높은 점수를 받은 해결책을 선호하도록 훈련된다. 이 순환 과정을 통해 시스템은 더 크고 비싼 AI의 도움 없이도 완전히 독자적으로 운영될 수 있을 때까지 자신의 계획 능력을 정교하게 다듬을 수 있다. 그 결과, 이 시스템은 비디오에 대한 짧은 설명, 클립 라이브러리, 그리고 일련의 규칙을 입력받아 비디오를 조립하기 위한 상세하고 실행 가능한 계획을 만들어낼 수 있다.

이 접근 방식을 테스트하기 위해 팀은 수천 개의 편집 작업, 실제 비디오 클립, 음악 트랙, 그리고 명시적인 제약 목록을 포함하는 새로운 벤치마크인 '리파인컷-벤치(RefineCut-Bench)'를 제작했다. 그들은 모델이 강력한 AI 스승들의 가공되지 않은 제안으로부터 직접 학습했을 때는 성능이 저조하여 특정 테스트 척도에서 0.620의 점수를 기록했다는 것을 발견했다. 그러나 모델이 검증되고 승인된 제안들로 훈련되었을 때, 성능은 0.858로 크게 뛰어올랐다. 모델이 자신의 수정을 선택하는 법을 배우는 자가 개선 단계 이후에는 점수가 0.924까지 상승했다. 이 최종 버전의 모델은 원래 모방하려고 했던 훨씬 더 크고 복잡한 AI 시스템만큼 혹은 그보다 더 나은 성능을 보여주었다.

이 연구는 단순히 강력한 AI 모델의 출력을 복제하는 것만으로는 이 문제를 해결하기에 충분하지 않다는 점을 명시적으로 배제한다. 연구진은 모델이 스승을 직접 모방하려고 했을 때, 그들의 오류와 불일치를 그대로 물려받는다는 것을 보여주었다. 성공의 핵심은 검증이라는 중간 단계였다. 모든 가능한 편집 결정을 자동 검사기를 통해 다시 재생함으로써, 시스템은 노이즈를 걸러내고 신뢰할 수 있는 경로만을 유지했다. 이 방법은 그들이 시작했던 모델뿐만 아니라 다양한 유형의 AI 모델에서도 견고함을 입증했으며, 이는 작업의 검증 및 확인 능력이 모델의 규모 자체보다 더 강력한 스승이 될 수 있음을 시사한다.

연구진은 또한 이러한 계획 수립의 이점이 실제 시각적 품질로 이어지는지 테스트했다. 그들은 인간 심사위원들에게 새 시스템이 만든 영상과 기존 방식의 영상을 블라인드 방식의 좌우 랜덤 A/B 프리뷰(스토리보드 렌더)로 비교하게 했다. 심사위원들은 일관되게 리파인컷 시스템이 만든 영상을 선호했으며, 이는 향상된 계획 점수가 더 나은 시각적 결과와 일치함을 확인시켜 주었다. 이 시스템은 특정 장면 교체, 비트에 맞춘 속도 조절, 또는 전체 지속 시간의 정확한 준수와 같은 복잡한 요청을 처리할 수 있었으며, 검증되지 않은 모델들이 겪었던 클립 누락이나 길이 불일치와 같은 흔한 오류들을 피할 수 있었다.

이 작업은 엄격한 규칙과 구조화된 결정이 포함된 과제의 경우, 검증된 방식으로 자신의 작업을 확인하도록 훈련받는다면 더 작은 개방형 모델이 거대한 폐쇄형 시스템보다 더 뛰어난 성능을 낼 수 있음을 보여준다. 연구진은 기계가 컷의 예술적 취향을 판단하거나 복잡한 감정적 이야기를 이해하는 것과 같은 비디오 제작의 모든 측면을 해결했다고 주장하지 않았다. 그것들은 여전히 기계에게 어려운 영역이다. 하지만 그들은 클립을 선택하고, 순서를 정하고, 요구 사항을 충족하기 위해 타이밍을 맞추는 편집의 기계적인 측면은 계획, 확인, 그리고 자가 수정의 순환을 통해 학습하는 시스템에 의해 숙달될 수 있음을 성공적으로 보여주었다. 이 실험에 사용된 코드와 데이터셋은 현재 공개되어 있어, 다른 연구자들이 이 검증된 계획 방식 위에서 연구를 발전시킬 수 있도록 하고 있다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →