← 최신 논문
📊 statistics

Heavy-Tailed Flow Matching via Random Clocks

본 논문은 표준 플로우 매칭(flow matching)의 효율성을 유지하면서도 모드 커버리지, 샘플 품질 및 꼬리 통계량 회복을 개선하기 위해 절단된 로그 시그니처(truncated logsignature) 특징을 사용하여 헤비 테일 데이터를 클락 조건부 가우시안 소스들의 혼합으로 모델링하는 무작위 시계 기반 헤비 테일 플로우 매칭(Heavy-Tailed Flow Matching via Random Clocks, HTFM) 프레임워크를 제안한다.

원저자: Zhouhao Yang, Yezhen Wang, Kenji Kawaguchi, Vladimir Braverman, Haoyang Cao

게시일 2026-07-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Zhouhao Yang, Yezhen Wang, Kenji Kawaguchi, Vladimir Braverman, Haoyang Cao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 세상의 그림을 그리는 법을 가르치려 한다고 상상해 보십시오. 대부분의 경우, 로봇은 빈 캔버스에 덮인 정적 노이즈—마치 오래된 TV의 흐릿한 회색 눈보라 같은 것—에서 시작하여 이미지가 나타날 때까지 천천히 깨끗하게 만드는 방식으로 학습합니다. 이것은 카펫 위에 앉아 있는 고양이나 화창한 날과 같은 "정상적인" 것들을 그릴 때는 아주 잘 작동합니다. 하지만 만약 당신이 로봇에게 아주 드물고 극단적인 것을 그리게 하고 싶다면 어떨까요? 백 년에 한 번 올까 말까 한 허리케인, 거대한 금융 위기, 또는 번개와 같은 것들 말입니다. 이것들은 현실의 "헤비 테일(heavy tails, 두꺼운 꼬리)"입니다. 즉, 매우 드물게 발생하지만 엄청난 영향을 미치는 사건들입니다.

문제는 표준적인 페인팅 로봇들이 "라이트 테일(light-tailed, 얇은 꼬리)" 노이즈를 기반으로 훈련된다는 점입니다. 그들은 평균적이고 예측 가능한 것을 기대합니다. 당신이 허리케인을 그려달라고 요청하면, 그들은 극단적인 날씨가 거의 불가능하다는 것이 그들의 훈련 데이터에 암시되어 있기 때문에 혼란에 빠질 수 있습니다. 그들은 폭풍 대신 부드러운 미풍을 그리거나, 드문 사건들을 아예 놓쳐버릴 수도 있습니다. 이를 해결하기 위해 과학자들은 로봇에게 "헤비 테일" 노이즈—자연스럽게 거칠고 극단적인 변동을 포함하는 노이즈—를 가지고 시작하도록 가르치려고 시도했습니다. 하지만 이는 까다로운 일입니다. 이러한 거친 노이즈의 수학은 복잡하고 계산하기 어려우며, 로봇이 단 하나의 그림을 완성하기 위해 수천 번의 작고 느린 단계를 거쳐야 할 때가 많습니다. 이는 마치 눈을 가린 채 허리케인 속을 걷는 것과 같습니다. 결국 도착할 수는 있겠지만, 매우 지치고 비효율적인 일입니다.

이 논문은 이 로봇들이 복잡한 수학에 길을 잃지 않고도 극단적인 상황을 다루는 법을 배우는 영리한 새로운 방법을 소개합니다. 저자인 Zhouhao Yang과 동료들은 **무작위 시계를 이용한 헤비 테일 플로우 매칭(HTFM)**이라는 방법을 제안합니다. 로봇에게 극단적인 사건의 복잡한 수학을 직접 배우도록 강요하는 대신, 그들에게 "마법의 시계"를 주는 것입니다.

이 마법의 시계가 어떻게 작동하는지 알아봅시다. 로봇이 그림을 그리고 있다고 상상해 보십시오. 그런데 로봇이 일정하고 지루한 속도로 움직이는 대신, 속도가 빨라지거나, 느려지거나, 심지어 무작위로 앞으로 건너뛰는 시계를 가지고 있습니다. 때때로 시계는 천천히 흘러가서 차분하고 집중된 시작점을 만들어냅니다. 다른 때에는 시계가 격렬하게 요동치며 시작 노이즈를 넓고 혼란스러운 구름으로 확장시킵니다. 핵심적인 트릭은 로봇이 그 미친 듯한 시계 자체를 이해할 필요가 없다는 것입니다. 로봇은 단지 특정 시계 설정이 주어졌을 때 어떻게 그려야 하는지만 배우면 됩니다. 시계가 차분하면 로봇은 차분하게 그리고, 시계가 격렬하면 로봇은 격렬하게 그립니다. 이 다양한 "시계 설정"들을 모두 섞음으로써, 로봇은 일반적인 장면과 드문 극단적인 사건들 모두를 완벽하게 생성하는 법을 배웁니다.

저자들은 이 접근 방식이 게임 체인저라는 것을 발견했습니다. 그들은 세 가지 과제를 통해 테스트했습니다: 불균형한 모양이 있는 간단한 2D 수학 퍼즐, 매우 희귀한 카테고리가 존재하는 이미지 데이터셋(예: 트럭들 사이의 특정한 종류의 자동차), 그리고 강한 폭우를 추적하는 실제 기상 데이터입니다. 모든 경우에서, 그들의 "무작위 시계" 방식은 이전의 헤비 테일 모델들보다 더 나은 결과를 만들어냈습니다. 그것은 드문 극단적 사건들을 훨씬 더 정확하게 포착해 냈으며, 아마도 가장 인상적인 점은 훨씬 더 빠르게 수행했다는 것입니다. 다른 방법들은 단 하나의 이미지를 생성하는 데 수백 단계가 필요했던 반면, 그들의 방법은 품질 저하 없이 단 몇 단계만으로도 해낼 수 있었습니다.

그들은 또한 시계의 "모양"이 중요하다는 것을 발견했습니다. 단순히 꼬리가 얼마나 두꺼운지의 문제가 아니라, 시계가 행동하는 구체적인 방식(개처럼 뛰는지, 혹은 강처럼 흐르는지)에 따라 로봇이 학습하는 드문 사건의 종류가 달라집니다. 이는 과학자들에게 모델을 조절할 수 있는 새로운 "다이얼"을 제공하여, 생성된 데이터가 얼마나 극단적이어야 하는지를 정확하게 제어할 수 있게 해줍니다. "로그 시그니처(log-signatures)"라는 수학적 도구를 사용하여 시계의 경로를 요약함으로써, 그들은 시스템을 단순하고 빠르게 유지할 수 있었으며, 가장 거친 데이터를 생성하기 위해 반드시 가장 어려운 수학 문제를 풀어야 하는 것은 아니라는 점을 증证明했습니다. 단지 적절한 시계가 필요할 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →