← 최신 논문
💻 computer science

Stable Velocity: A Variance Perspective on Flow Matching

본 논문은 분산이 감소된 목적 함수와 적응형 감독을 학습에 도입하고, 추론을 위한 폐쇄형 샘플링 가속화를 제공함으로써, 샘플 품질을 저하시키지 않으면서도 학습 효율과 샘플링 속도를 모두 크게 향상시키는 통합 프레임워크인 "Stable Velocity"를 제안한다.

원저자: Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

게시일 2026-02-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 그림 그리는 법을 가르치고 있다고 상상해 보세요. 정적 노이즈로 가득 찬 빈 캔버스에서 시작하여 점차 선명한 이미지를 만들어가는 과정입니다. 이 과정을 "플로우 매칭(Flow Matching)"이라고 부릅니다. 로봇은 매 아주 작은 단계마다 픽셀을 이동시켜야 할 방향을 추측하며 학습합니다.

"스테이블 벨로시티(Stable Velocity)"라는 논문은 현재 우리가 이 로봇들을 가르치는 방식이 다소 혼란스럽다고 주장합니다. 다음은 쉬운 비유를 사용한 분석입니다.

문제점: "소음이 가득한 교실"

현재 로бо트가 이동 방향(속도, velocity)을 배우려고 할 때, 완성된 그림의 예시를 단 하나만 보고 경로를 추측합니다.

  • 비유: 목적지로 가는 최선의 경로를 배우기 위해 단 한 명에게 길을 묻는다고 상상해 보세요. 만약 그 사람이 기분이 안 좋거나 이상한 지름길을 알려준다면, 당신은 길을 잃을 수도 있습니다.
  • 결과: 그림을 그리는 초기 단계(이미지가 대부분 노이즈인 상태)에서, 단 한 명에게만 길을 묻는 것은 **높은 분산(high variance)**을 초래합니다. 로봇은 혼란에 빠지고, 학습은 불안정해지며, 배우는 데 오랜 시간이 걸립니다. 이는 마치 모든 학생이 서로 다르고 상충하는 답변을 내놓아 선생님이 올바른 수업을 진행하기 어렵게 만드는 교실과 같습니다.

발견: 두 가지 서로 다른 구역

저자들은 그림을 그리는 과정이 자동차 운전처럼 두 개의 뚜렷한 구역으로 나뉜다는 것을 깨달았습니다.

  1. "고분산" 구역 (안개 낀 시작 단계): 이미지가 대부분 노이즈일 때, 로봇은 매우 불확실한 상태입니다. 이때 한 명에게 길을 묻는 것은 도박과 같습니다. 어떤 "노이즈" 샘플을 선택하느냐에 따라 방향이 크게 달라집니다.
  2. "저분산" 구역 (탁 트인 도로): 이미지가 점점 더 선명해지고 최종 그림에 가까워질수록, 로봇은 매우 확신을 갖게 됩니다. 이 구역에서는 로봇이 가야 한다고 생각하는 방향이 실제 방향과 거의 일치합니다. 이는 마치 모두가 같은 길로 가기로 동의한, 직선으로 뻗은 텅 빈 고속도로를 달리는 것과 같습니다.

해결책: "스테이블 벨로시티(Stable Velocity)"

이 논문은 이 두 구역을 다르게 취급하는 스테이블 벨로시티라는 새로운 프레임워크를 제안합니다.

1. 더 똑똑한 학습 (Stable Velocity Matching)

안개 낀 구역에서 단 한 명에게 길을 묻는 대신, 이제 로봇은 그룹 전체에게 물어보고 그 답변들을 평균 냅니다.

  • 비유: 선생님이 학생 한 명에게 묻는 대신, 20명의 학생에게 물어본 뒤 이상한 답변(아웃라이어)은 제외하고 평균을 내는 것과 같습니다.
  • 이점: 이는 노이즈를 완화합니다. 로봇은 단 하나의 잘못된 추측에 휘둘리지 않으므로 더 빠르고 안정적으로 학습합니다. 논문은 이 방법이 수학적으로 편향되지 않으면서도 훨씬 덜 흔들린다는 것을 증명합니다.

2. 더 똑똑한 감독 (VA-REPA)

논문은 또한 로봇이 안개 낀 구역에 있을 때는 복잡한 "의미론적(semantic)" 레슨(예: "이것은 고양이의 귀다")을 가르치려 해서는 안 된다고 제안합니다.

  • 비유: 학생이 여전히 빈 캔버스를 바라보고 있는 동안에는 그림의 세부 사항을 가르치는 것은 무의미합니다. 스케치가 보이기 시작할 때부터 세부 사항을 가르쳐야 합니다.
  • 이점: 이 시스템은 이미지를 이해할 수 있을 만큼 충분히 선명해질 때만 추가적인 "도움이 되는 힌트"를 자동으로 활성화합니다. 이는 로봇이 너무 빨리 너무 많은 것을 배우려다 혼란에 빠지는 것을 방지합니다.

3. 더 빠른 그리기 (Stable Velocity Sampling)

로봇이 실제로 이미지를 생성할 때(추론 단계), 저자들은 "탁 트인 도로(저분산)" 구역에서는 경로가 매우 예측 가능하기 때문에 아주 작은 단계 대신 큰 폭의 도약을 할 수 있다는 것을 발견했습니다.

  • 비유: 짙은 안개 속을 걸을 때는 작고 조심스러운 발걸음을 내디뎌야 합니다. 하지만 탁 트인 고속도로에 들어서면 달릴 수 있습니다.
  • 이점: 이 새로운 방법은 로봇이 선명한 구역에서 실수 없이 많은 작은 단계들을 건너뛸 수 있게 해줍니다. 이 덕분에 최종 그림의 품질을 해치지 않으면서도 그림 생성 과정을 2배 이상 빠르게 만듭니다.

결과

저자들은 이미지와 비디오를 생성하는 유명한 AI 모델들(SD3.5, Flux, Wan2.2 등)에 대해 이를 테스트했습니다.

  • 학습: 모델들이 더 빠르게 학습되었고 더 좋은 이미지를 만들어냈습니다.
  • 속도: 기존 방식보다 (단계 수를 줄여) 절반의 시간 혹은 그 이하의 단계만으로 이미지와 비디오를 생성할 수 있었으며, 품질 저하는 눈에 띄지 않았습니다.

요약하자면: 이 논문은 과정 중 안개 낀 부분에서 방향을 평균 내고, 맑은 부분에서는 로봇이 빠르게 달릴 수 있게 함으로써 "소음이 가득한 교실" 문제를 해결하여, AI 이미지 생성을 더 안정적이고 훨씬 빠르게 만들었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →