← 최신 논문
🤖 machine learning

Paris: A Decentralized Trained Open-Weight Diffusion Model

이 논문은 격리된 전문가 모델과 동적 라우터를 활용하여 동기화된 그래디언트 없이도 고품질의 텍스트-이미지 생성을 달성하는 동시에, 이전 베이스라인들에 비해 훈련 데이터와 연산 요구량을 크게 줄이면서 전체를 탈중앙화된 프레임워크를 통해 훈련된 최초의 공개 오픈 웨이트 확산 모델인 Paris를 소개한다.

원저자: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

게시일 2026-08-03
📖 5 분 읽기🧠 심층 분석

원저자: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 명의 천재가 작업실에 앉아 예술을 창조하는 것이 아니라, 서로 대화할 필요도 없이 전 세계의 수많은 예술가가 함께 협력하여 예술을 만드는 세상을 상상해 보십시오. 이것이 바로 '디퓨전 모델링(diffusion modeling)'이라 불리는 분야의 핵심입니다. 디퓨전 모델링은 혼돈스러운 정적 노이즈 구름에서 시작하여, 마치 조각가가 돌을 깎아내어 조각상을 드러내는 것처럼 단계별로 정교하게 다듬어 선명한 이미지를 만들어내는 인공지능의 한 종류입니다. 수년간 이 분야의 가장 큰 장애물은 '중앙 통제 센터'의 필요성이었습니다. 이 강력한 AI 예술가들을 훈련시키기 위해 연구자들은 보통 수천 대의 초고속 컴퓨터를 한곳에 모으고, 값비싼 고속 케이블로 연결하여 모두가 완벽하게 발을 맞춰 일하게 해야 했습니다. 만약 컴퓨터 한 대라도 뒤처지면, 팀 전체가 기다려야 했습니다. 이는 오직 가장 부유하고 자금력이 풍부한 기관들만이 최고의 이미지 생성기를 구축할 수 있게 만들었으며, 다른 이들은 이 게임에서 소외되게 했습니다.

Bagel Labs의 새로운 프로젝트인 'Paris'는 대담한 질문을 던집니다. "만약 중앙 통제 센터가 전혀 필요 없다면 어떨까?"라고 말이죠. "만약 우리가 여러 개의 작은 팀들이 각자의 컴퓨터에서 완전히 격리된 채 작업하고, 아주 마지막 단계에서만 그 결과물을 하나로 모음으로써 세계적인 수준의 AI 예술가를 훈련시킬 수 있다면 어떨까?" Paris는 완전히 이런 방식으로 훈련된 최초의 공개 이미지 생성기임을 입증하며, 아름다운 그림을 만들기 위해 반드시 슈퍼컴퓨터 클러스터가 필요한 것은 아님을 증명합니다. 대신, 이 모델은 AI를 각기 다른 스타일을 배우는 전문가 팀으로 나누고, 당신이 그림을 요청할 때 어떤 전문가의 말을 들을지 결정하는 똑똑한 '교통 관제사(traffic controller)'를 사용하는 영리한 기법을 사용합니다.

핵심 아이디어: 고독한 천재들의 팀

보통 거대한 AI를 훈련시키는 것은 1,000명의 가수가 완벽하게 화음을 맞추도록 하는 것과 같습니다. 그들은 모두 같은 방에 서서 지휘자의 지시를 들어야 하며, 누군가 음이 이탈하면 즉시 목소리를 조정해야 합니다. 만약 방이 너무 크거나 마이크가 느리면, 노래 전체가 망가집니다. 이것이 전통적인 AI 훈련 방식입니다. 수천 개의 그래픽 카드(GPU)가 끊임없이 자신들의 진행 상황을 서로에게 외치며, 다음 단계로 넘어가기 전에 모두가 따라잡을 때까지 기다립니다. 이는 비용이 많이 들고 특수한 고속 인터넷이 필요하며, 오래된 컴퓨터와 최신 컴퓨터가 섞여 있는 환경에서는 불가능합니다.

Paris는 이 공식을 뒤집습니다. 하나의 거대한 합창단 대신, 각자 방음실에 갇힌 여덟 명의 솔로리스트를 상상해 보십시오. 그들은 서로 대화하지 않고, 악보를 공유하지도 않으며, 다른 사람이 끝날 때까지 기다리지도 않습니다.

  • 솔로리스트 (전문가들): Paris 모델은 8개의 작은 AI '전문가'로 구성됩니다. 각 전문가는 인터넷 이미지 라이브러리의 서로 다른 조각을 학습합니다. 어떤 이는 오직 노을에 대해서만 배우고, 다른 이는 개에 대해, 또 다른 이는 건축물에 대해 배울 수 있습니다. 그들은 완전한 격리 상태에서 사용 가능한 어떤 하드웨어에서든 각자의 속도로 훈련합니다. 한 명은 미국의 빠른 서버에서, 다른 한 명은 유럽의 느린 기계에서 훈련하더라도 상관없습니다.
  • 교통 관제사 (라우터): 이 전문가들이 훈련 중에 서로 대화하지 않는다면, 당신이 "초원을 달리는 골든 리트리버"라고 입력했을 때 어떤 전문가를 사용해야 할지 어떻게 알 수 있을까요? 여기서 '라우터'가 등장합니다. 라우터는 똑똑한 교통 경찰 역할을 하는 작고 가벼운 AI입니다. 당신이 프롬프트를 주면, 라우터는 이미지의 지저하고 노이즈 섞인 시작 부분을 보고 빠르게 결정합니다. "헤이, 전문가 3번이 개를 가장 잘 다루니까 이 전문가를 쓰자!"라거나, "사실 이 장면은 전문가 3번과 전문가 5번의 조합이 필요해!"라고 판단하는 식입니다.

작동 원리: "대화 없음"의 마법

Paris의 천재성은 훈련 데이터를 처리하는 방식에 있습니다. 연구진은 1,100만 개의 이미지가 담긴 거대한 데이터셋을 가져와서, DINOv2라고 불리는 스마트한 도구를 사용하여 이미지들을 생김새에 따라 8개의 뚜렷한 더미로 분류했습니다. 그런 다음 각 더미를 서로 다른 전문가에게 보냈습니다.

  • 동기화 없음: 일반적인 AI 훈련에서는 컴퓨터들이 끊임없이 자신들의 '그레이디언트(gradient, 개선 방향을 알려주는 노트와 같은 것)'를 동기화하기 위해 멈춰야 합니다. 하지만 Paris의 전문가들은 그렇게 하지 않습니다. 그들은 그저 자신의 시간과 자신의 속도에 맞춰 훈련하고, 또 훈련할 뿐입니다. 한 명이 10만 단계를 마쳤을 때 다른 한 명은 겨우 9만 단계에 머물러 있어도 상관없습니다.
  • 라우터의 역할: 라우터는 별도로 훈련됩니다. 라우터는 노이즈가 섞인 흐릿한 이미지를 보고, 어떤 전문가가 해당 노이즈 패턴에 가장 적합한지 추측하는 법을 배웁니다. 이는 당신이 들고 있는 책의 희미한 냄새만으로도 정확히 어느 책꽂이에서 책을 꺼내야 할지 아는 사서와 같습니다.

발견한 사실: 적은 데이터, 적은 전력, 동일한 품질

연구팀은 Paris를 기존 방식 및 이전의 분산형 시도와 비교 테스트했습니다. 결과는 놀라울 정도로 효율적이었습니다:

  • 자원 절감: Paris는 이전의 최고 분산형 방식과 비교했을 때, 14배 적은 훈련 데이터(15400만 개 대신 1100만 개)와 16배 적은 GPU-일(GPU-days)(필요한 컴퓨터 시간)을 사용하여 고품질 모델을 훈련할 수 있었습니다.
  • "Top-2"의 놀라움: 전문가들을 결합하는 방법을 테스트했을 때, 흥 nghiệm스러운 점을 발견했습니다. 단 하나의 '최고' 전문가(Top-1)만 사용하는 것도 좋았지만, **상위 2명의 전문가(Top-2)**를 사용하여 그 결과를 섞는 것이 실제로 가장 좋은 그림을 만들어냈습니다.
  • "전체 팀"의 실수: 흥미롭게도, 8명의 전문가를 모두 동시에 사용하려고 시도하는 것(Full Ensemble)은 오히려 그림의 질을 떨어뜨렸습니다. 너무 많은 목소리가 한꺼번에 노래를 부르면 노이즈가 발생한다는 것이 밝혀졌습니다. 논문은 선택적인 것이 핵심이라고 제안합니다. 합창단 전체가 필요한 것이 아니라, 딱 맞는 솔로리스트들이 필요한 것입니다.

이것이 중요한 이유

이 논문은 세계적인 수준의 이미지 생성기를 만들기 위해 수십억 달러 규모의 데이터 센터가 필요하지 않다는 결론을 내립니다. 컴퓨터들이 독립적으로 작업하게 하고 마지막에만 서로 조율하게 함으로써, Paris는 고품질의 AI가 '이종 하드웨어(heterogeneous hardware)', 즉 서로 다르고 저렴하며 지리적으로 흩어져 있는 컴퓨터들을 통해서도 구축될 수 있음을 증명합니다. 이는 연구자들과 중소 규모의 기업들이 지금까지 이 분야의 문지기 역할을 해온 거대한 동기화 인프라 없이도 강력한 모델을 훈련할 수 있는 길을 열어줍니다.

요약하자면, Paris는 모든 사람이 발을 맞춰 행진하도록 강요하는 것이 아니라, 각자가 자신만의 리듬을 찾게 하고 똑똑한 지휘자가 마지막 커튼콜 직전에 그들을 하나로 모으게 함으로써도 걸작을 만들 수 있다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →