← 최신 논문
💬 NLP

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing

Crayotter는 장문 비디오 편집을 세 가지 산출물 중심 단계로 구조화하여 진단적 수정을 가능하게 함으로써 기존 베이스라인보다 서사적 일관성과 주제 정렬 측면에서 우수한 성능을 달와성하는 오픈 소스 기반의 추적 가능한 멀티 에이전트 시스템이다.

원저자: Lecheng Yan, Yichong Zhang, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Wenxi Li, Chenyang Lyu

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Lecheng Yan, Yichong Zhang, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Wenxi Li, Chenyang Lyu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 친구를 위해 30초짜리 여행 영상을 만들려고 한다고 상상해 보세요. 당신에게는 산 영상, 길거리 음식 영상, 강아지 영상, 그리고 흐릿한 호텔 로비 영상이 뒤섞인 엉망진창인 원본 푸티지 더미가 있습니다.

만약 당신이 일반적인 AI에게 "여행 영상을 만들어줘"라고 요청한다면, AI는 그저 무작위로 몇 개의 클립을 집어 들어 대충 이어 붙이고는 운 좋게 잘 되기를 바랄 것입니다. 만약 결과물이 이상하다면(예를 들어 산 장면 중간에 갑자기 강아지 영상이 등장하는 경우), 일반적인 AI는 보통 그냥 포기하고 처음부터 다시 시작하려고 할 것입니다.

**Crayotim (크라이오터)**는 AI가 비디오를 편집하는 방식을 바꾸는 새로운 오픈 소스 시스템입니다. 이 시스템은 단순히 "여행 영상을 만들어라"라는 명령에 따라 무작위 클립을 가져와서 대충 이어 붙이는 대신, 매우 정리된 책상과 상세한 노트를 가진 숙련된 인간 영상 편집자처럼 행동합니다.

Crayotter가 어떻게 작동하는지, 단계별로 나누어 설명하겠습니다.

1. 3단계 워크플로우

Crayotter는 단순히 "편집"하는 것이 아닙니다. 이 시스템은 작업을 세 가지 뚜렷한 단계로 나누며, 각 단계마다 **흔적(artifacts)**이라고 불리는 기록을 남깁니다.

  • 1단계: 정찰 작업 (재료 준비)
    편집을 시작하기 전, Crayotter는 정찰대 역할을 합니다. 사용자의 요청(예: "활기찬 문화 행사 보여줘")을 분석하여 무엇이 필요한지 체크리스트를 만듭니다. 와이드 샷, 클로즈업, 군중 장면 등이 필요할 것입니다. 이 시스템은 특정 태그와 일치하는 영상을 검색합니다. 만약 "군중 장면"을 찾을 수 없다면, 멋대로 추측하지 않고 적절한 증거를 찾을 때까지 다시 검색합니다.

    • 비유: 이것은 요리사가 요리를 하기 전에 식재료를 확인하는 것과 같습니다. 만약 신선한 바질이 필요한데 없다면, 말린 허브만 가지고 파스타를 만들려 애쓰는 대신 시장에 가서 바질을 구해오는 것과 같습니다.
  • 2단계: 설계도 작성 (편집 연구)
    클립이 모두 모였다고 해서 바로 자르기 시작하는 것은 아닙니다. Crayotksi는 먼저 설계도를 작성합니다. 클립의 순서, 음악이 고조되어야 할 지점, 내레이션이 들어가야 할 위치, 각 샷의 길이 등을 결정합니다.

    • 비유: 이것은 벽돌을 한 장 쌓기도 전에 집의 평면도를 그리는 건축가와 같습니다. AI는 타이밍과 전환 효과가 포함된 영상의 "대본"을 만듭니다.
  • 3단계: 건설 (도구 실행)
    이제 AI가 실제로 작업을 수행합니다. 디지털 도구를 사용하여 클립을 자르고, 전환 효과를 넣고, 오디오를 동기화합니다. 하지만 여기서 마법이 일어납니다. AI는 모든 움직임에 대해 실시간 로그를 기록합니다.

    • 비유: 매 단계마다 사진을 찍는 건축가를 상상해 보세요. 만약 창문을 잘못된 위치에 설치했다면, 집 전체를 허물 필요가 없습니다. 그저 사진을 보고 어느 부분이 잘못되었는지 확인한 뒤, 그 창문만 수정하면 됩니다.

2. 초능력: "추적 가능성 (Traceability)"

Crayotter의 가장 큰 혁신은 편집 과정을 가시화하고 수정 가능하게 만든다는 점입니다.

기존의 AI 시스템에서는 영상이 잘못 나오면 "다시 해줘"라고 말하고 AI가 두 번째에는 운이 좋기를 바라야 했습니다. 하지만 Crayotter를 사용하면, 영상이 실패하더라도 시스템(또는 사람)이 로그, 설계도, 중간 초안과 같은 "흔적(artifacts)"을 살펴보고 정확히 어디서 문제가 발생했는지 확인할 수 있습니다.

  • "되감기" 기능: AI의 사고 과정을 되감아 볼 수 있습니다. "아, AI가 내레이션에 비해 너무 짧은 클립을 골랐구나"라거나 "이 두 장면 사이의 전환이 너무 급작스럽구나"라는 것을 알 수 있습니다.
  • 수정 방법: 처음부터 다시 시작하는 대신, 특정 단계로 돌아가서 잘못된 클립을 교체하고 작업을 계속할 수 있습니다. 이는 책 전체를 다시 쓰는 대신 오타 하나를 고치는 문서 편집과 같습니다.

3. 얼마나 잘 작동하는가?

연구진은 23가지의 서로 다른 비디오 테마(여행, 캠퍼스 생활, 반려동물, 음식 등)를 대상으로 Crayotter를 테스트했으며, 이를 두 가지 다른 인기 있는 비디오 편집 도구(CapCut-Mate 및 CutClaw)와 비교했습니다.

  • 결과: 인간들은 Crayotter가 다른 도구들(각각 2.44와 1.70)보다 훨씬 높은 점수(3.40점 만점에 5점 만점 기준)를 받았다고 평가했습니다.
  • 이유는 무엇일까요? Crayotter는 다음 항목에서 더 뛰어났습니다:
    • 테마 준수: 이야기에 맞지 않는 무작위 클립을 실수로 포함하지 않았습니다.
    • 스토리 흐름: 영상이 단순한 무작위 샷의 모음이 아니라 일관된 이야기를 가진 것처럼 느껴졌습니다.
    • 매끄러움: 컷과 전환이 자연스러웠습니다.

4. "Crayotter"의 철학

이 논문은 AI가 영상 편집과 같은 창의적인 작업에서 진정으로 유용해지려면, "마법 생성기"가 아닌 협력적인 파트너가 되어야 한다고 주장합니다.

자신의 작업물(artifacts)을 공개함으로써, Crayotter는 인간이 다음과 같은 일을 할 수 있게 해줍니다:

  1. 어떤 단계에서든 작업을 **검사(Inspect)**할 수 있습니다.
  2. 무엇이 잘못되었는지 정확히 **진단(Diagnose)**할 수 있습니다.
  3. 전체 프로젝트를 버리지 않고 고장 난 부분만 **수리(Repair)**할 수 있습니다.

요약하자면, Crayotter는 비디오 편집을 "주사위를 던지는 게임"에서, 실수를 쉽게 찾고 수정할 수 있는 추적 가능하고 단계적인 공예로 변화시켜 훨씬 더 나은 최종 영상을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →