← 최신 논문
🤖 machine learning

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

이 논문은 여러 생성 후보를 탐색하고 최적의 것을 선택하기 위해 훈련 루프를 인수분해함으로써, 탐색을 효율성을 높이고 다양한 도메인 전반에서 성능을 개선하는 동시에 진정한 엔드 투 엔드 생성 모델링을 가능하게 하는 확장 가능한 세 번째 사전 학습 축으로 확립하는 새로운 패러다임인 "탐색적 모델링(Explorative Modeling)"을 소개한다.

원저자: Alexi Gladstone, Heng Ji, Yilun Du

게시일 2026-07-31
📖 5 분 읽기🧠 심층 분석

원저자: Alexi Gladstone, Heng Ji, Yilun Du

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 그림 그리는 법을 가르치려 한다고 상상해 보십시오. 머신러닝의 옛날 방식에서는 엔지니어들이 공장 라인을 구축했습니다. 한 기계는 윤곽선을 그리고, 다른 기계는 색을 채우고, 세 번째 기계는 눈을 그려 넣는 식이었죠. 이 방식도 작동은 했지만, 지저도하고 느렸습니다. 그러다 한 혁명이 일어났습니다(AlexNet이라는 유명한 모델에 의해 촉발된). 이 혁명은 우리에게 더 나은 방법을 가르쳐 주었습니다. 바로 로봇에게 전체 그림을 통째로 주고, 시작부터 끝까지 한 번에 모든 것을 배우게 하는 것이었습니다. 이 "엔드 투 엔드(end-to-end)" 방식은 얼굴 인식에서 언어 번역에 이르기까지 거의 모든 분야의 표준이 되었습니다.

하지만 이 새로운 규칙을 따르기를 거부하는 고집스러운 문제가 하나 있었습니다. 바로 이미지, 비디오, 혹은 이야기를 새롭게 만들어내는 생성형 AI였습니다. 이 모델들은 믿을 수 없을 정도로 재능이 뛰어나지만, 여전히 구식의 공장 라인 방식에 의존하고 있습니다. 그들은 창작 과정을 아주 작고 미세한 단계들로 나눕니다. 예를 들어, 개 한 마리를 그리려면 먼저 흐릿한 형태를 추측하고, 그다음에는 이를 다듬고, 그다음에는 털을 입히고, 그다음에는 눈을 그리는 식으로 수백 번의 단계를 거칩니다. 문제는 매 단계를 밟을 때마다 아주 작은 실수를 할 수 있다는 점입니다. 백 번째 단계에 도달했을 때, 그 작은 실수들이 쌓여서 결국 개가 이상하거나 흐릿하게 보일 수 있습니다. 과학자들은 수년 동안 이렇게 물으며 이 문제를 해결하려 노력해 왔습니다. "왜 로로봇에게 단계를 나누지 말고, 한 번에 개 전체를 그리도록 가르칠 수는 없는 걸까?"

이 질문에 대한 답은 Alexi Gladstone, Heng Ji, Yilun Du의 새로운 논문에 나와 있습니다. 그 답은 "무엇을 그릴 것인가"의 세계가 매우 복잡하다는 것입니다. "개 한 마리를 그려줘"라는 요청에는 단 하나의 정답만 있는 것이 아닙니다. 수십억 마리의 서로 다른 개가 존재할 수 있죠. 만약 전략 없이 로봇에게 이 모든 것을 한꺼번에 그리도록 가르치려 한다면, 로봇은 혼란에 빠져 실제 존재하는 무엇도 아닌, 그냥 흐릿하고 평균적인 모습의 개를 그리게 됩니다. 기존 모델들은 작업을 여러 단계로 나누어 이 문제를 해결하지만, 이는 "엔드 투 엔드" 원칙을 깨뜨립니다. 이 논문은 모델이 단계를 나누지 않고도 이 복잡함을 처리할 수 있게 해주는 **탐색적 모델링(Explorative Modeling)**이라는 영리한 기술을 소개합니다.

새로운 전략: "시도하고, 또 시도하고, 다시 시도하라"

저자들은 단순하지만 강력한 아이디어를 제안합니다. 모델에게 첫 번째 시도에 바로 정답을 맞히라고 강요하는 대신, 여러 번 시도하게 하고 그중 가장 좋은 것을 고르게 하는 것입니다. 그들은 이를 **탐색적 모델링(Explorative Modeling)**이라고 부릅니다.

당신이 1에서 100 사이의 비밀 숫자를 맞히는 게임을 하고 있다고 상상해 보십시오.

  • 옛날 방식 (표준 모델): 당신은 숫자 하나를 추측합니다. 틀리면 힌트를 받고 다시 시도합니다. 이 과정을 수백 번 반복하며 점점 정답에 가까워집니다. 하지만 매번 추측할 때마다 힌트를 해석하는 과정에서 작은 실수를 할 수 있고, 결국 마지막에는 정답에서 약간 벗어나게 될 수도 있습니다.
  • 새로운 방식 (탐색적 모델링): 당신은 한 번에 50개의 서로 다른 숫자를 외칠 수 있습니다. 그런 다음 실제 비밀 숫자와 비교하여 "좋아, 내 50개의 추측 중에서 42번이 가장 가까웠어!"라고 말합니다. 당신은 오직 이 승자로부터만 배웁니다. 나머지 49개의 틀린 추측은 무시합니다.

논문의 용어로, 이것은 **K개의 후보(K candidates)**를 탐색하는 것이라고 합니다. 모델은 K개의 서로 다른 가능성(예를 들어 50마리의 서로 다른 개)을 생성하고, 실제 데이터와 가장 유사한 것 하나만을 가지고 학습합니다. 이렇게 함으로써 모델은 모든 것을 뭉뚱그려 일반적이고 흐릿한 덩어리로 만드는 대신, 특정하고 선명한 디테일(특정 품종의 개)에 집중하여 학습할 수 있습니다.

이것이 왜 모든 것을 바꾸는가

이 논문은 이 "여러 번 시도하고, 최고를 고르는" 접근 방식이 세 가지 주요 측면에서 게임 체인저임을 밝혀냈습니다.

1. 스케일링을 위한 새로운 초능력
보통 AI를 더 좋게 만들기 위해서는 뇌(파라미터)를 더 크게 만들거나 더 많은 데이터를 입력합니다. 저자들은 제3의 길을 발견했습니다. 바로 모델이 학습 중에 더 많은 추측을 하게 함으로써 모델을 더 "열심히 노력하게" 만드는 것입니다. 그들은 이를 **탐색(exploration)**이라고 부릅니다.

  • 이미지, 비디오, 언어 모델에 대해 테스트했을 때, 단순히 추측의 횟수를 늘리는 것만으로도 모델의 성능이 눈에 띄게 향상되었습니다.
  • 데이터와 모델의 크기를 키울수록 이 기술의 효과는 더욱 커졌습니다. 예를 들어, 데이터를 추가함에 따라 탐색을 통한 성능 이득은 **7%**에서 무려 **36%**까지 증가했습니다. 모델이 커짐에 따라 이 이득은 **13%**에서 **23%**로 뛰어올랐습니다.
  • 또한 이 방식은 모델을 훨씬 효율적으로 만들었습니다. 탐색을 사용하는 것이 컴퓨터 연산량(FLOPs)을 4.1배, 데이터 사용 효율을 6.2배, 모델 크기 효율을 47% 개선한다는 것을 발견했습니다.

2. 모델을 다시 "엔드 투 엔드"로 만든다
모델이 자신의 추측 중 가장 잘 맞는 것을 골라 학습하기 때문에, 더 이상 작업을 아주 작은 단계로 나눌 필요가 없습니다. 모델은 전체 과정을 한 번에 배울 수 있습니다.

  • 논문은 충분한 탐색이 뒷받ende면, 모델이 훈련된 방식 그대로 단 한 번의 단계(single step)만으로 전체 이미지나 비디오를 생성할 수 있음을 보여줍니다.
  • 로봇 작업(로봇 팔을 움직이도록 가르치는 작업) 테스트에서, 이 새로운 방법은 기존의 가장 우수한 방법들과 대등한 성능을 보이면서도 컴퓨터 단계를 16배에서 256배 적게 사용했습니다. 로봇 팔을 움직이기 위해 100단계를 거치는 대신, 새 모델은 단 1단계만으로 수행했습니다.

3. 모델이 더 잘 학습하도록 돕는다
저자들은 이 방법이 모델의 일반화 능력을 높여준다고 설명합니다. 즉, 모델이 단순히 훈련 데이터를 암기하는 것이 아니라 실제로 규칙을 배우게 된다는 것입니다. 비디오 생성 테스트에서, 더 많은 탐색을 거친 모델은 과적합(데이터 암기)이 덜 발생했고, 본 적 없는 새로운 데이터에 대해서도 더 나은 성능을 보였습니다. 이는 "최선의 매치를 선택할 수 있는 옵션"을 갖는 것이 학습 과정을 더 매끄럽고 덜 혼란스럽게 만드는 것으로 보입니다.

결론

이 논문은 지난 10년 동안 우리가 AI를 더 똑똑하게 만들기 위해 뇌를 키우거나 더 많은 책을 읽히는 데 집중해 왔음을 시사합니다. 하지만 이 연구는 우리가 놓치고 있었던 세 번째 재료, 즉 **탐색(exploration)**이 있다는 것을 보여줍니다. AI가 여러 가능성을 생성하고 그중 승자를 선택하게 함으로써, 우리는 새로운 차원의 성능을 끌어낼 수 있습니다.

저자들은 이 방식이 여전히 탐구 중인 새로운 패러다임이라는 점을 주의 깊게 언급했습니다. 이 방법이 이미지, 비디오, 일부 언어 작업에는 매우 효과적이지만, 다른 유형의 모델에는 더 많은 조정이 필요할 수 있다는 점을 발견했습니다. 그러나 결과는 유망합니다. 그들은 별도의 "가이드(guidance)" 기술 없이도 이미지 생성기가 (ImageNet에서 1.43 FID라는) 완벽에 가까운 결과물을 만들어내도록 했으며, 이 모든 것을 훨씬 효율적인 훈련 과정 속에서 해냈습니다.

요약하자면, 이 논문은 AI의 미래가 단순히 더 큰 뇌를 갖는 것이 아니라, 더 똑똑한 방식으로 추측하는 법에 달려 있다고 주장합니다. AI에게 여러 경로를 시도하고 승자를 고를 기회를 줌으로써, 우리는 마침-내로 깊은 학습(deep learning)의 다른 분야들이 수년 동안 해왔던 것처럼, 전체 그림을 한 번에 그려내는 법을 가르칠 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →