From Pixels to Prompts: Vision-Language Models
이 책은 독자들이 끊임없이 쏟아지는 새로운 유행어와 모델 변형들에 길을 잃지 않고 자신감을 가지고 빠르게 진화하는 분야를 탐색할 수 있도록, 시각-언어 모델(Vision-Language Models)에 대한 명확한 정신적 지도와 직관적인 이해를 제공하는 것을 목표로 합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
우리가 보는 것과 우리가 말하는 것 사이의 가교
당신이 본 적이 없는 혼란스러운 장면을 친구에게 설명하려고 노력하고 있다고 상상해 보세요. 당신의 머릿속에는 그 장면(시각적 부분)이 그림처럼 그려져 있지만, 그것을 설명하기 위해서는 단어(언어적 부분)를 사용해야 합니다. 오랫동안 컴퓨터는 이 작업에 매우 서툴렀습니다. 컴퓨터는 두 개의 별개 뇌를 가지고 있었습니다. 하나는 사진 속의 모양과 색상을 인식하는 데 뛰어난 뇌였고, 다른 하나는 문장을 쓰고 질문에 답하는 데 탁ла한 뇌였습니다. 하지만 이 두 뇌는 서로 대화하지 못했습니다. '시각' 뇌는 개가 있다는 것을 알려줄 수 있고, '언어' 뇌는 개에 대한 이야기를 쓸 수 있었지만, 이 둘은 함께 협력하여 "저기 빨간 모자를 쓴 특정 개를 봐!"라고 말할 수 없었습니다.
이 책, From Pixels to Prompts는 이 두 뇌 사이에 다리를 놓는 것에 관한 이야기입니다. 이 책은 이미지와 텍스트를 동시에 이해하도록 설계된 새로운 종류의 인공지능인 **시각-언어 모델(Vision-Language Models, VLMs)**을 탐구합니다. 이것을 컴퓨터에게 단순히 사진을 '보거나' 문장을 '읽는' 법을 가르치는 것이 아니라, 두 가지를 동시에 수행하게 하여 훨씬 더 인간적인 방식으로 세상에 대해 추론하도록 가르치는 과정이라고 생각하면 됩니다. 이 책은 이러한 기술들을 결합함으로써, 우리가 단순히 데이터를 처리하는 것을 넘어 맥락을 이해하고, 보이는 것에 대해 질문에 답하며, 유능한 비서처럼 지시를 따를 수 있는 기계를 만들 수 있다고 주장합니다.
이 책의 핵심 아이디어: AI의 멀티버스(Multiverse)를 위한 지도
이 책은 단 하나의 '아하!' 모먼트를 가진 단일 과학 실험이 아닙니다. 대신, 급변하는 멀티모달 지능의 세계를 항해할 수 있도록 설계된 종합적인 가이드이자 '정신적 지도'입니다. 저자인 Vo Hoang Nhat Khang은 매일 새로운 모델 이름이 등장하며 분야가 너무 빠르게 변하고 있어 용어 때문에 길을 잃기 쉽다고 제안합니다. 이 책의 주요 목표는 단순히 약어 목록을 암기하는 것이 아니라, 이러한 시스템이 어떻게 작동하는지에 대한 명확하고 지속적인 구조를 제공하는 것입니다.
이 책의 핵심 발견은 아무리 복잡한 시각-언어 모델이라 할지라도, 거의 모든 모델이 세 가지 단순한 과정을 반복하고 있다는 점입니다:
- 인코딩(Encoding): 가공되지 않은 픽셀(이미지)과 텍스트(단어)를 숫자의 공유 언어(벡터)로 변환합니다.
- 추론(Reasoning): '추론 엔진'(보통 거대 언어 모델)을 사용하여 그 숫자들을 생각하고 그것들이 함께 무엇을 의미하는지 파악합니다.
- 디코딩(Decoding): 그 생각들을 문장, 그림, 또는 구체적인 답변과 같은 유용한 출력값으로 다시 변환합니다.
이 책은 매번 새로운 작업을 위해 완전히 새로운 거대한 뇌를 처음부터 구축해야 한다는 생각에 명시적으로 반대합니다. 대신, 가장 효과적인 경로는 이미 강력하게 구축된 기존의 '동결된(frozen)' 뇌들(이미 말하는 법을 아는 언어 모델과 보는 법을 아는 시각 모델)을 가져와 그 사이에 작고 영리한 '다리'를 건설하는 것이라고 제로합니다. 흔히 어댑터(adapter)나 프로젝터(projector)라고 불리는 이 다리는, 두 전문가가 처음부터 모든 것을 다시 배울 필요 없이 서로 대화할 수 있게 해줍니다.
저자들은 BLIP-2나 Flamingo와 같은 모델에서 볼 수 있듯이, 큰 뇌를 동결된 상태로 유지하고 다리만을 훈련시키는 이 '모듈형(modular)' 접근 방식이 지배적이고 효과적인 추세라는 점을 확신합니다. 그러나 그들은 또한 이 접근 방식에 한계가 있다고 (최종적인 법칙으로서 증명하기보다는) 제안합니다. 그들은 이러한 모델들이 점점 좋아지고 있음에도 불구하고, '환각(hallucinations)'(존재하지 않는 것을 자신 있게 묘사하는 현상)이나 '조합적 일반화(compositional generalization)'(알고 있는 개념들을 완전히 새로운 방식으로 결합하는 데 어려움을 겪는 것, 예: 희귀한 물체의 특정 개수를 세는 것)와 같은 문제로 여전히 고군분투하고 있다고 지적합니다.
책이 이야기를 풀어가는 방식
이 책은 독자를 밑바닥에서부터 위로 향하는 여정으로 안내합니다. 먼저 시스템의 일부로서 그림을 토큰의 목록으로 바꾸는, 마치 그림을 재료 목록으로 바꾸는 것과 유사한 역할을 하는 '시각 인코더(Visual Encoders)'를 설명하며 시작합니다. 그다음에는 단어와 논리를 다루는 부분인 '언어 모델(Language Models)'로 넘어갑니다. 이 책의 가장 흥ей진 부분은 중간 섹션으로, 엔지니어들이 이 두 부분을 결합하기 위해 고안해낸 다양한 '융합 메커즘(Fusion Mechanisms)'을 상세히 다룹니다.
설명된 인기 있는 방법 중 하나는 **교차 주의(Cross-Attention)**로, 이는 언어 부분이 필요할 때마다 이미지 부분을 엿볼 수 있게 해주는 번역가와 같습니다. 또 다른 방법인 **프리픽스 컨디셔닝(Prefix Conditioning)**은 이미지를 문장의 맨 앞에 위치하는 특별한 '프롬프트'로 변환하여, 언어 모델에게 "여기 우리가 이야기하고 있는 내용이 있으니, 이제 나머지를 작성하라"고 지시하는 방식입니다. 책은 이를 수행하는 단 하나의 '정답'은 없다는 점을 강조합니다. 모델마다 빠르고 정확하거나, 혹은 복잡한 지시를 잘 따르는 데 특화되어 있는지에 따라 서로 다른 다리를 사용합니다.
또한 이 책은 모델을 움직이는 '연료'인 데이터에 대해서도 깊이 파고듭니다. 이 시스템들이 방대한 양의 인터넷 이미지와 텍스트로 훈련된다는 것을 설명합니다. 저자들은 이 데이터가 방대하지만 동시에 무질서하고 편향되어 있어, 모델이 실수를 하거나 고정관념을 학습하게 만든다고 언급합니다. 그들은 연구자들이 더 나은 데이터셋과 '지시어 튜닝(instruction tuning)'을 통해 어떻게 이를 해결하려 하는지 논의합니다. 지시어 튜닝은 모델에게 질문에 친절하고 정확하게 답하는 예시를 제공함으로써 모델이 유능한 비서처럼 행동하도록 가르치는 과정입니다.
마지막으로, 이 책은 이 기술이 어디로 향하고 있는지를 살펴봅니다. 미래는 단순히 상식 퀴즈를 맞히는 데 똑똑해지는 것이 아니라, 더 신뢰할 수 있고, 자신이 모르는 것에 대해 정직하며, 물리적 세계(예: 물체가 어떻게 움직이거나 상호작용하는지)를 이해할 수 있는 능력을 갖추는 데 있다고 제안합니다. 책은 결론적으로 이러한 모델들이 강력한 도구이지만 결국 인간에 의해 만들어진 도구이며, 그 강점과 약점을 이해하는 것은 우리 모두의 책임이라는 점을 상기시킵니다. 이것은 단순히 더 멋진 기술을 만드는 문제가 아닙니다. 우리가 세상을 조금 더 명확하게 볼 수 있도록 도와줄 수 있는, 신뢰할 수 있는 기술을 만드는 일입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.