← 최신 논문
💻 computer science

Aurora: Unified Video Editing with a Tool-Using Agent

이 논문은 원시 사용자 요청을 구조화된 편집 계획으로 변환하여 텍스트 및 시각적 미지정성을 해결하고 통합 비디오 확산 트랜스포머의 성능을 향상시키는 도구 증강 비전-언어 모델을 활용하는 에이전트 기반 비디오 편집 프레임워크인 Aurora 를 제시합니다.

원저자: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가정해 보세요. 홈 비디오를 편집하고 싶지만 머릿속에 막연한 생각만 있는 상황을요. 비디오 편집자에게 "배경에 있는 남자를 슈퍼히어로처럼 만들어 줘"라고 말하지만, 어떤 슈퍼히어로인지 말해주지 않고, 그 남자가 정확히 어디 서 있는지 가리켜 주지도 않습니다.

현재의 AI 비디오 편집 세계에서는 이것이 문제입니다. 대부분의 고급 AI 모델은 재능은 뛰어나지만 너무 직설적인 요리사들처럼 행동합니다. 완벽한 레시피와 정확한 재료, 정밀한 계량이 주어지면 무엇이든 요리할 수 있지만, 단순히 "매콤하게 만들어 줘"라고만 하면 후추 대신 소금을 넣거나, "매콤함"이 어떤 모습인지 모르겠다며 아예 요리를 거부할 수도 있습니다.

Aurora는 요리사 앞에 스마트 어시스턴트를 추가함으로써 이 문제를 해결하는 새로운 시스템입니다.

문제: "빠진 재료"의 간극

현재의 비디오 편집 AI 모델들은 강력합니다. 사물을 교체하거나, 사람을 제거하거나, 배경을 변경할 수 있습니다. 하지만 엄격한 규칙이 하나 있습니다: 시작하기 전에 모든 것이 준비되어 있어야 합니다.

  • 셔츠를 "버버리 체크 스카프"로 교체하고 싶다면, AI는 그 특정 스카프의 사진이 필요합니다.
  • 사람을 제거하고 싶다면, AI는 그 사람이 정확히 어디에 있는지 보여주는 지도 (마스크) 가 필요합니다.
  • "더 빠르게 만들어 줘"라고 말하면, AI는 "그것"이 무엇인지 알아야 합니다.

실제 사람들은 보통 이런 세부 사항을 제공하지 않습니다. 우리는 막연한 지시만 내립니다. 논문은 이를 **"미세부족 (underspecification)"**이라고 부릅니다. AI 는 작업을 할 준비가 되어 있지만, 사용자는 시작하는 데 필요한 도구를 제공하지 않은 것입니다.

해결책: "Aurora" 팀

연구자들은 Aurora를 만들었습니다. 이는 두 명의 인원으로 구성된 팀처럼 작동합니다:

  1. 에이전트 (스마트 어시스턴트): 이는 프로젝트 매니저 역할을 하는 대규모 AI 모델 (VLM) 입니다. 당신의 막연한 요청 ("여자의 셔츠를 버버리 스카프처럼 만들어 줘") 을 듣고, "잠깐, 그 스카프 사진이 없고, 여자의 셔츠가 정확히 어디에 있는지 알아야 해"라고 깨닫습니다.

    • 쇼핑을 나갑니다: 버버리 스카프 사진을 찾기 위해 웹을 검색하는 도구를 사용합니다.
    • 지도를 그립니다: 비디오 속 여자의 셔츠 정확한 윤곽을 찾는 도구를 사용합니다.
    • 레시피를 다시 씁니다: 당신의 일상적인 요청을 비디오 편집기가 완벽하게 이해할 수 있는 초정밀 기술 지시문으로 번역합니다.
  2. 비디오 모델 (요리사): 이는 실제 비디오 편집 엔진 ("확산 트랜스포머") 입니다. 사용자와 직접 대화하지 않습니다. 에이전트로부터 완벽하게 포장된 지시문만 받습니다. 원본 비디오, 새로운 스카프 사진, 셔츠 윤곽을 받아서 마법 같은 편집을 수행합니다.

실제 생활에서 어떻게 작동하는가

논문은 이를 실제 적용한 예시들을 보여줍니다:

  • 시나리오 A: "여자의 셔츠를 버버리 스카프로 바꿔 줘"라고 말합니다.
    • Aurora 없이: AI 는 일반적인 스카프를 추측하거나 실패할 수 있습니다.
    • Aurora 로: 에이전트가 실제 버버리 스카프 이미지를 검색하고, 비디오 속 셔츠를 찾아낸 뒤 비디오 모델에게 말합니다. "여기가 비디오고, 여기가 정확한 스카프 이미지고, 여기가 정확한 셔츠 위치야. 시작해."
  • 시나리오 B: "보행자를 제거해 줘"라고 말합니다.
    • Aurora 없이: AI 는 잘못된 사람을 제거하거나 지저분한 구멍을 남길 수 있습니다.
    • Aurora 로: 에이전트가 누가 보행자인지 파악하고, 그 사람 주위에 정밀한 윤곽을 그린 뒤, 비디오 모델에게 무엇을 지우고 배경을 무엇으로 채워야 하는지 정확히 지시합니다.

결과: 새로운 벤치마크

연구자들은 AgentEdit-Bench라는 새로운 테스트를 구축했습니다. 이 테스트는 막연한 지시로 AI 를 속이도록 특별히 설계되었습니다.

  • 표준 AI 모델들을 이러한 막연한 요청으로 테스트했을 때, 점수는 낮게 나왔습니다 (약 67~70%).
  • Aurora 에이전트를 추가하자 점수가 크게 상승했습니다 (최대 87.9%).

논문은 또한 이 "스마트 어시스턴트"가 특정 비디오 모델에만 좋은 것이 아님을 보여주었습니다. 다른 비디오 편집 모델들과 테스트했을 때도 에이전트는 여전히 그들의 성능을 향상시켰습니다. 이는 어떤 요리사에게나 보편적인 번역기를 제공하는 것과 같습니다. 누가 요리하든 재료가 올바르게 준비되면 음식의 맛은 더 좋아집니다.

요약

Aurora는 단순히 비디오를 편집하는 것이 아니라, 편집을 시작하기 전에 당신이 무엇을 의미하는지 이해합니다. 이 시스템은 빠진 사진을 수집하고, 빠진 지도를 그리며, 명확한 지시문을 작성하는 도구 사용 에이전트로 행동함으로써 인간의 막연함과 기계의 정밀성 사이의 간극을 메워줍니다. 이를 통해 최종 비디오가 당신의 비전을 정확히 반영하도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →