← 최신 논문
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

본 논문은 멀티모달 거대 언어 모델(MLLM)에서의 통합된 시각-언어 인지에 대한 최초의 체계적인 조사로서, 인지를 내재적 능력으로 정식화하고, 그 패러다임 진화의 5단계 분류 체계를 제안하며, 인공 일반 지능을 향한 향후 연구 방향을 개괄한다.

원저자: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

게시일 2026-06-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 똑똑하지만 약간은 서투른 학생에게 세상을 이해하는 법을 가르치고 있다고 상상해 보세요. 이 학생은 **멀티모달 거대 언어 모델(MLLM)**입니다. 이 학생은 책(텍스트)을 읽고 사진(시각)을 보는 데는 뛰어나지만, 오랫동안 이 둘을 연결하는 데 어려움을 겪었습니다. 사진을 모호하게 설명할 수는 있었지만, 고양이가 정확히 어디에 앉아 있는지 지목하거나 왜 고양이가 겁에 질려 보이는지 이유를 설명하지는 못했습니다.

**"구조에서 시너지로(From Structure to Synergy)"**라는 제목의 이 논문은 우리가 이 학생에게 어떻게 진정으로 "보고" 동시에 "이해하는" 법을 가르쳤는지에 대한 역사서이자 로드맵입니다. 저자들은 우리가 시각과 언어를 별개의 과목으로 다루어서는 안 되며, 이를 **지각(Perception)**이라는 하나의 슈퍼 스킬로 융합해야 한다고 주장합니다.

이것은 이 모델들이 어떻게 진화해 왔는지를 보여주는 다섯 단계의 이야기이며, 쉬운 비유를 통해 설명합니다.

문제점: "눈이 먼" 학생

이 리뷰 이전에는 대부분의 검토가 "시각"과 "언어"를 따로 살펴보았습니다. 이는 마치 수학 선생님과 미술 선생님이 따로 있는데, 두 분에게 함께 협력하라고 요청하는 적이 한 번도 없는 것과 같았습니다. 저자들은 이것이 실수라고 말합니다. 이미지를 진정으로 이해하려면 이미지를 보면서 동시에 그것에 대해 말해야 합니다. 그들은 이 모델들이 정확히 그렇게 하도록 어떻게 진화했는지에 대한 단일한 지도를 만들고자 했습니다.

5단계의 진화 과정

저자들은 이 모델들의 역사를 "하드웨어를 고치는 것"에서 "생각하는 법을 뇌에 가르치는 것"으로 나뉩니다.

1단계: 눈을 고치기 (인코더 중심 - Encoder-Centric)

비유: 모델의 "눈"(이미지를 보는 부분)이 흐릿하다고 상상해 보세요.
무슨 일이 일어났나: 연구자들은 먼저 눈 자체를 업그레이드하기 시작했습니다. 모델이 이미지를 읽기도 전에 특정 부분을 확대해서 볼 수 있는 특수 렌즈(모듈)를 추가했습니다. 마치 돋보기처럼 말이죠. 또한 모델에게 여러 쌍의 눈(다양한 전문가)을 주어 다양한 각도에서 이미지를 보게 하려고 노력했습니다.
결과: 모델은 전체 이미지를 흐릿하게 보는 것을 넘어, "저기 있는 빨간 공"처럼 특정 영역을 알아채기 시작했습니다.

2단계: 손을 고치기 (디코더 중심 - Decoder-Centric)

비유: 이제 눈은 영역을 볼 수 있게 되었지만, 모델의 "손"(그리거나 가리키는 부분)은 서툴렀습니다. "공이 저기에 있다"라고 말할 수는 있지만, 완벽한 원을 그릴 수는 없었습니다.
무슨 일이 일어났나: 연구자들은 모델의 출력 측에 특수 도구를 추가했습니다. 모델이 물체의 정확한 윤곽, 마스크 또는 박스를 그릴 수 있도록 "픽셀 단위로 정교한" 손을 만들어 주었습니다.
결과: 모델은 "고양이가 있다"라고 말하는 수준을 넘어, 고양이의 털 하나하나를 픽셀 단위로 따라가며 완벽한 윤곽선을 그릴 수 있게 되었습니다.

3단계: 두 번 보기 학습하기 (동적 지각 - Dynamic Perception)

비유: 당신이 복잡한 그림을 보고 있다고 상상해 보세요. 당신은 그냥 한 번 쓱 훑어보는 것이 아니라, 확대하고, 뒤로 물러나고, 세부 사항을 보고, 어쩌면 돋보기를 요청하기도 합니다.
무슨 일이 일어났나: 기존 모델들은 이미지를 한 번 보고 답을 내놓았습니다. 새로운 모델들은 동적으로 생각하는 법을 배웠습니다. 그들은 다음과 같은 일을 할 수 있게 되었습니다:

  • 외부 도구 호출 (이미지 속 텍텍스트를 읽기 위한 OCR 스캐너 등).
  • 혼란스러울 때 특정 지점을 확대해서 보기.
  • 퍼즐을 풀기 위해 작은 컴퓨터 프로그램 작성하기.
    결과: 모델은 능동적인 조사관이 되었습니다. 정적인 스냅샷 대신, 단계별로 단서를 모으며 이미지를 "돌아다닐" 수 있게 되었습니다.

4A: 수술 없이 훈련하기 (구조 독립적 전략 - Architecture-Free Strategies)

비유: 학생에게 새 안경을 씌우거나 새로운 손을 달아주는 대신, 우리는 그들을 가르치는 방식을 바꿨습니다.
무슨 일이 일어났나: 연구자들은 모델의 물리적 구조를 바꾸는 것을 멈췄습니다. 대신, 지시어 튜닝(Instruction Tuning) (더 나은 연습 시험 제공)과 강화 학습(Reinforcement Learning) (모델이 정답을 맞히면 점수를 얻고 틀리면 점수를 잃는 비디오 게임 같은 방식)을 사용했습니다.
결과: 모델은 하드웨어 업그레이드 없이도, 더 열심히 연습하고 실수를 통해 배움으로써 물체를 찾고 퍼즐을 푸는 데 더 똑똑해졌습니다.

4B: 위대한 시너지 (통합된 지각을 향하여 - Towards Unified Perception)

비유: 이것은 "슈퍼히어로" 단계입니다. 학생은 이제 모든 것을 결합합니다: 훌륭한 눈, 훌륭한 손을 가졌고, 확대할 줄 알며, 도구를 사용할 줄 알고, 보상을 통해 배우는 법을 압니다.
무슨 일이 일어났나: 이 논문은 이 모든 기술을 혼합한 최신 모델들(OpenAI의 o3와 같은)을 살펴봅니다. 이들은 단순히 경직된 체크리스트를 따르는 것이 아니라, 계획을 세우고, 스스로 도구를 선택하며, 필요할 때 확대하고, 인간처럼 문제를 추론합니다.
결과: 우리는 단순히 이미지를 "처리"하는 모델을 넘어, 통합되고 유연한 방식으로 진정으로 지각하는 모델로 나아가고 있습니다.

앞길을 가로막는 장애물들

엄청난 진전을 이루었음에도 불구하고, 저자들은 세 가지 큰 난관을 지적합니다:

  1. 데이터 식단 (Data Diet): 이 모델들은 학습을 위해 방대하고 고품질이며 정교하게 라벨링된 데이터가 필요합니다. 이는 비용이 많이 들고 구하기 어렵습니다.
  2. 채점의 문제 (The Grading Problem): 수학 시험(맞음 또는 틀림)을 채점하는 것은 쉽지만, "지각"을 채점하는 것은 어렵습니다. 모델이 복잡한 장면을 얼마나 잘 "보았는지"에 대해 어떻게 정밀한 점수를 줄 수 있을까요? 모델에게 보상을 주는 더 나은 방법이 필요합니다.
  3. 생각하는 비용 (The Cost of Thinking): "확대하고" "두 번 생각하는" 가장 똑똑한 모델들은 많은 컴퓨터 자원을 필요로 합니다. 이는 사진 한 장을 보기 위해 슈퍼컴퓨터를 돌리는 것과 같아서, 현재로서는 일상적인 용도로 쓰기에 너무 비쌉니다.

핵심 요약

이 논문은 가이드북입니다. 진정으로 지능적인 기계를 만들기 위해서는 눈이나 손을 따로 보완하는 것만으로는 부족하다는 것을 알려줍니다. 우리는 전체 시스템이 시너지를 내도록, 즉 보고, 생각하고, 행동하는 하나의 통합되고 적응 가능한 뇌가 되도록 가르쳐야 합니다. 여정은 하드웨어를 고치는 것에서 뇌가 생각하는 법을 가르치는 것으로 진행되었으며, 다음 단계는 이 사고 과정을 효율적이고 진정으로 범용적이게 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →