← 최신 논문
🤖 machine learning

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

이 논문은 단일 프레임워크 내에서 이미지 이해와 생성을 동시에 지원하는 통합 멀티모달 LLM 의 성능을 향상시키기 위해, 정보 병목 원리를 기반으로 공유 비주얼 토크나이저의 정보 흐름을 제어하는 'InfoTok'이라는 새로운 정규화 기법을 제안하고 이를 통해 압축과 작업 관련성 간의 균형을 달성함을 보여줍니다.

원저자: Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

게시일 2026-04-07
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎒 1. 문제 상황: "무거운 배낭"과 "혼란스러운 짐"

상상해 보세요. 인공지능 모델이 여행객이라고 칩시다. 이 여행객은 두 가지 일을 해야 합니다.

  1. 이해하기: 사진 속의 사물을 보고 "이건 개야, 저건 나무야"라고 설명해야 합니다. (의미 파악)
  2. 그리기: "개와 나무가 있는 그림을 그려줘"라고 하면 그걸 그려야 합니다. (세부 묘사)

지금까지의 인공지능들은 이 두 가지 일을 하려고 할 때, **한 개의 배낭 (공유된 시각 토큰)**에 모든 것을 다 넣으려 했습니다.

  • 문제: 배낭의 크기는 정해져 있습니다 (제한된 용량). 그런데 사진 속의 모든 정보 (나무의 질감, 개털의 미세한 결, 배경의 잡음 등) 를 다 넣으려다 보니, 배낭이 너무 무거워졌습니다.
  • 결과: 중요한 '의미' (개와 나무가 있다는 사실) 를 전달하려다 보니, 그림을 그릴 때 필요한 '세부 묘사'가 빠지거나, 반대로 그림을 그리려다 보니 '이해'가 흐려지는 갈등이 생겼습니다. 기존 방법들은 이걸 해결하기 위해 배낭을 더 크게 만들거나, 이해용 배낭과 그리기용 배낭을 따로 쓰는 등 복잡한 방법을 썼습니다.

💡 2. 해결책: InfoTok (정보 정리 전문가)

이 논문이 제안한 InfoTok"배낭 정리 전문가" 같은 역할을 합니다. 단순히 배낭을 늘리는 게 아니라, **"무엇을 넣고 무엇을 버릴지"**를 정보 이론 (Information Theory) 을 바탕으로 똑똑하게 정해줍니다.

🧠 핵심 원리: "정보 병목 (Information Bottleneck)"

InfoTok 은 배낭에 넣을 때 이렇게 생각합니다:

"이 여행객에게 정말 필요한 건 '개와 나무가 있다'는 의미와 **'그림을 그릴 수 있는 핵심 구조'**야. 나머지 잡동사니 (너무 미세한 결, 불필요한 노이즈) 는 버려!"

이걸 세 가지 규칙으로 정리합니다:

  1. 압축 (Compactness): 불필요한 잡음을 버리고 핵심만 남기세요. (배낭을 가볍게)
  2. 충분성 (Sufficiency): 하지만 '개'가 '개'라는 의미와 그림을 그릴 수 있는 핵심은 꼭 남겨두세요. (중요한 건 빠뜨리지 않기)
  3. 일치 (Alignment): 설명할 때 쓰는 말 (텍스트) 과 그림을 그릴 때 쓰는 정보가 서로 잘 통하도록 맞춰주세요.

🛠️ 3. 어떻게 작동할까요? (실제 적용)

이 기술은 인공지능의 배낭 (시각 인코더) 을 직접 뜯어고치는 게 아니라, 여행을 시작하기 전에 배낭에 넣을 물건을 다시 정리하는 과정을 추가합니다.

  • 기존 방식: "사진을 다 넣어서 배낭을 채워라." (무작위 압축)
  • InfoTok 방식: "사진을 분석해서, 의미 있는 구조는 남기고 잡음은 걸러내서 배낭에 넣어라." (정보 기반 압축)

이때, 인공지능이 "어떤 게 잡음이고 어떤 게 의미인가?"를 스스로 배우도록 **수학적인 규칙 (상호 정보량 제약)**을 걸어줍니다. 마치 "너무 많은 정보를 넣으면 점수를 깎아줄게, 하지만 중요한 건 꼭 넣어야 해"라고 가르치는 것과 같습니다.

📈 4. 어떤 효과가 있나요? (결과)

저자들은 이 기술을 이미 유명한 인공지능 모델 3 개 (Harmon, OpenUni, Show-o2) 에 적용해 보았습니다. 새로운 데이터를 추가하지 않고, 기존 데이터만 가지고 훈련시켰습니다.

  • 이해 능력 향상: "이 사진에 개가 몇 마리 있나요?" 같은 질문에 더 정확하게 답했습니다.
  • 그림 능력 향상: "빨간 공과 파란 공을 그려줘"라고 했을 때, 색과 위치를 더 정확하게 그렸습니다.
  • 균형 잡힌 성능: 이해와 그림 두 가지 능력 모두에서 기존 모델보다 훨씬 좋아졌습니다.

🌟 5. 한 줄 요약

"InfoTok 은 인공지능에게 '모든 것을 다 기억하라'고 강요하는 대신, '중요한 것은 기억하고, 불필요한 것은 버려'라고 가르쳐서, 이해와 그림 두 가지 일을 모두 잘하게 만든 똑똑한 정리 기술입니다."

기존에는 모델의 크기 (배낭 크기) 를 키우는 데만 집중했다면, 이 논문은 어떻게 정보를 효율적으로 정리하느냐에 집중함으로써 더 똑똑하고 균형 잡힌 인공지능을 만들 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →