On the Power of Foundation Models
본 논문은 범주론을 활용하여 프롬프트 기반 학습은 표현 가능한 작업에 엄격히 제한되는 반면, 사전 학습 작업이 정의한 범주 내에서 미세 조정이 적용된 충분히 강력한 기반 모델은 이론적으로 모든 하류 작업을 해결하고 구조적 매핑을 통해 보지 못한 객체에도 일반화할 수 있음을 보여준다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
"기반 모델의 힘에 관한" 논문에 대한 설명을 간단한 언어와 창의적인 비유를 사용하여 제시합니다.
핵심 질문: 초지능이 모든 것을 할 수 있을까?
우주에 있는 모든 책을 읽었고, 무한한 학습 시간을 가지며, 연습 시험에서 절대 실수하지 않는 학생이 있다고 상상해 보세요. 저자들은 다음과 같은 단순한 질문을 던집니다: 이 학생이 연습 시험에서 완벽하다면, 여러분이 던지는 새로운 어떤 문제도 자동으로 해결할 수 있을까요?
AI 세계에서는 이 "학생"이 기반 모델(ChatGPT 나 이미지 생성기 뒤에 있는 모델들) 입니다. "연습 시험"은 전치 작업(pretext tasks, 예: 문장에서 다음 단어 예측하거나 이미지가 어떻게 회전되었는지 추측하기) 이라고 불립니다.
이 논문은 기존 이론들(데이터 양이나 컴퓨터 규모에 관한 것들) 이 이 질문에 답할 수 없다고 주장합니다. 대신 저자들은 범주론(Category Theory, 구조의 "문법"으로 생각하세요) 이라는 수학 분야를 사용하여 이러한 모델이 무엇을 할 수 있고 무엇을 할 수 없는지 규명합니다.
그들은 이러한 모델이 새로운 것을 배우는 방식에 관한 두 가지 주요 규칙을 발견했습니다.
규칙 #1: "프롬프트"의 한계 (도서관 카드 비유)
상황: 모델을 재학습시키지 않고 새로운 작업 (예: 사진에서 고양이 식별) 을 수행하게 하고 싶지만, 구체적인 지시나 "프롬프트"(예: "고양이를 찾아라"라고 적힌 도서관 카드) 만 제공합니다.
발견: 모델은 원래 학습된 구조 안에 그 작업이 이미 "숨겨져" 있을 때만 새로운 작업을 해결할 수 있습니다.
비유: 모델을 도서관이라고 상상해 보세요.
- 전치 작업(학습) 은 도서관이 책을 어떻게 정리했는지를 의미합니다. 도서관이 "색상"으로만 책을 정리했다면, 책들은 빨강, 파랑, 초록으로 분류되어 있을 것입니다.
- 프롬프트 튜닝은 사서에게 "역사에 관한 책을 찾아줄 수 있나요?"라고 묻는 것과 같습니다.
- 결과: 도서관이 오직 "색상"으로만 정리되어 있다면, 사서는 세상에서 가장 좋은 기억력을 가지고 있더라도 역사에 관한 책을 찾을 수 없습니다. "역사"라는 범주는 도서관의 구조에 존재하지 않기 때문입니다.
- 논문의 증명: 저자들은 학습 작업 (예: 이미지 회전 추측) 이 모델에게 "회전"에 대해서만 가르쳤다면, 모델은 프롬프트를 통해 "객체 분할"(잘라내기) 과 같은 복잡한 작업을 수행할 수 없다고 증명합니다. 왜냐하면 "잘라내기"라는 개념이 도서관의 구조에 구축되지 않았기 때문입니다.
핵심: 여러분이 모델에게 체스만 가르쳤다면, 단순히 프롬프트로 축구하게 할 수는 없습니다. 새로운 작업은 이전 구조로 표현 가능해야 합니다.
규칙 #2: "파인튜닝"의 힘 (마스터 키 비유)
상황: 새로운 작업을 위해 소량의 데이터셋을 사용하여 모델에 약간의 새로운 학습 (파인튜닝) 을 제공하는 데 동의합니다.
발견: 이것은 훨씬 더 강력합니다. 모델이 초기 학습 동안 세계의 "구조"를 충분히 잘 학습했다면, 점들을 연결할 충분한 자원 (데이터와 연산 능력) 을 제공한다면 어떤 새로운 작업이라도 배울 수 있습니다.
비유: 모델을 특정 건물의 자물쇠 (전치 작업) 에 맞도록 깎인 마스터 키라고 상상해 보세요.
- 파인튜닝은 그 마스터 키를 가져와서 다른 건물의 새로운 문에 맞도록 약간 갈아내는 것과 같습니다.
- 결과: 마스터 키가 첫 번째 건물의 자물쇠 본질을 잘 포착했다면, 거의 모든 문을 열 수 있도록 재형성할 수 있습니다.
- 논문의 증명: 저자들은 모델이 "이상적"(학습 구조를 완벽하게 학습한) 이라면, 하류 작업을 해결하는 데 필요한 모든 정보를 포함하고 있음을 보여줍니다. 새로운 작업에 대한 학습 데이터는 모델에게 그 정보를 어떻게 재형성할지 보여주는 안내 역할만 합니다.
핵심: 파인튜닝은 프롬프트의 "표현 가능성"에 의해 제한되지 않습니다. 기반이 튼튼하다면 모델은 거의 모든 것에 적응할 수 있습니다.
규칙 #3: "마법의 다리" (번역가 비유)
상황: 텍스트를 이해하는 모델과 이미지를 이해하는 모델과 같은 서로 다른 유형의 모델을 결합할 때 (다중 모달 학습) 어떻게 될까요?
발견: 논문은 "일반화 정리"를 제시합니다. 두 가지 다른 세계 (예: 텍스트와 이미지) 사이에 완벽한 다리 (수학적 매핑) 를 구축하면, 한 세계의 구조가 다른 세계에 보존된다고 말합니다.
비유: "텍스트"를 "이미지"로 완벽하게 번역하는 사전이 있다고 상상해 보세요.
- 텍스트 세계에는 "아보카도 의자"(아보카도 모양의 의자) 라는 개념이 있습니다. 이 객체는 실제 세계에 존재하지 않을 수 있으며, 학습 데이터에 그 사진이 존재하지 않을 수도 있습니다.
- 그러나 텍스트 세계에는 "아보카도"와 "의자"를 결합할 수 있는 논리적 구조가 있고, 사전 (모델) 이 이미지 세계로 번역할 때 그 구조를 완벽하게 보존한다면...
- 결과: 모델은 아보카도 의자를 본 적이 없더라도 완벽한 아보카도 의자 이미지를 "환각"하거나 생성할 수 있습니다. 모델은 이미지를 암기한 것이 아니라 단어 간의 관계를 이해하고 그 구조를 이미지 세계에 적용한 것입니다.
논문의 증명: 이는 DALL-E 2 나 CLIP 과 같은 모델이 학습 세트에 존재하지 않는 것들의 이미지를 생성할 수 있는 이유를 설명합니다. 그들은 단순히 복사하는 것이 아니라, 언어의 구조적 논리를 사용하여 새로운 이미지를 구축하는 것입니다.
논문의 주장 요약
- 프롬프트는 제한적입니다: 모델에게 이미 학습된 방식에 "내장되어" 있는 것만 요청할 수 있습니다. 학습이 새로운 작업의 구조를 가르치지 않았다면 단순한 프롬프트는 작동하지 않습니다.
- 파인튜닝은 강력합니다: 약간의 추가 학습을 수행할 의사가 있다면, 좋은 구조를 학습한 모델은 거의 모든 작업을 해결하도록 적응시킬 수 있습니다.
- 구조는 새로운 것을 창조합니다: 한 영역 (예: 텍스트) 의 구조를 다른 영역 (예: 이미지) 으로 완벽하게 매핑함으로써, 모델은 아보카도 의자와 같이 이전에 존재하지 않았던 것들을 생성할 수 있습니다. 이는 단순히 이미지를 암기하는 것이 아니라 구조의 논리적 규칙을 따르기 때문입니다.
저자들은 특정 네트워크 크기나 데이터 양에 대해 말하는 것이 아니라, 작업 자체의 논리적 구조에 대해 말하고 있음을 강조합니다. 그들은 수학을 사용하여 학습 작업의 "형태"가 모델이 결국 할 수 있는 것의 "형태"를 결정한다고 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.