← 최신 논문
🤖 AI

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC는 모든 추론 단계에 걸쳐 연속적이고 컴팩트한 시각 경로를 유지함으로써 정확도를 저하시키지 않으면서 메모리와 지연 시간을 크게 줄여 비전 - 언어 모델에서 진정한 하드웨어 효율성을 달성하는 엔드 투 엔드 프레임워크입니다.

원저자: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

게시일 2026-05-28
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

영화의 복잡한 장면을 친구에게 설명하려고 상상해 보세요.

문제: "과도하게 설명하는" 친구
현재의 AI 모델 (비전 - 언어 모델이라고 함) 은 영화 프레임의 모든 픽셀을 하나하나 설명하는 친구와 같습니다. 영화가 4K 해상도라면, 영상 1 초당 1,000 개의 작은 세부 사항 (토큰) 을 설명하려 할지도 모릅니다. 이는 상세하지만, 매우 지칩니다. AI 는 이야기를 쓰려고 노력하는 동안 모든 1,000 개의 세부 사항을 단기 기억 (KV-cache) 에 기억해야 합니다. 이로 인해 AI 는 느려지고, 메모리를 많이 소모하며, 실행 비용이 비싸집니다. 특히 작은 장치에서는 더욱 그렇습니다.

구 해결책: "편집 버튼" 실수
이 문제를 해결하려는 이전 시도들은 먼저 1,000 단어 분량의 설명을 모두 작성한 뒤, 사후에 지루한 부분을 편집자가 지워버리는 것과 같았습니다.

  • 결함: 편집자가 단어를 지웠더라도, AI 는 여전히 먼저 그 단어들을 적어내고, 들고 다니다가, 그 다음에 삭제해야 했습니다. 마치 무거운 돌로 가득 찬 배낭을 들고 가다가 결승선에서 절반만 버리는 것과 같습니다. 여전히 무게를 지고 피로해졌으며, "편집" 과정 자체가 추가 시간을 소모했습니다.

새 해결책: CIVIC ("스마트 요약기")
이 논문은 AI 가 보고 말하는 방식을 생각하는 새로운 방법인 CIVIC를 소개합니다. 전체 설명을 작성한 뒤 편집하는 대신, CIVIC 는 AI 에게 처음부터 중요한 부분만 작성하도록 가르칩니다.

다음은 CIVIC 가 작동하는 방식을 간단한 비유로 설명한 것입니다:

  1. "앵커" 시스템 (스마트 그룹화):
    붐비는 방을 바라본다고 상상해 보세요. CIVIC 는 모든 사람의 얼굴을 나열하는 대신, 몇 개의 "앵커" (친구 그룹의 중심과 같은) 를 선택하여 "이 전체 그룹은 하나의 아이디어를 나타낸다"고 말합니다. AI 가 처리를 시작하기 전에 유사한 시각적 세부 사항들을 그룹화합니다. 이로 인해 1,000 개의 항목으로 이루어진 지저분한 군중이 400 개의 핵심 포인트로 구성된 깔끔한 목록으로 바뀝니다.

  2. "연속 경로" (우회 없음):
    대부분의 다른 방법들은 계주 경기처럼, 선수가 배턴을 넘겨주고, 재포장하기 위해 멈추었다가 다시 달리는 것과 같습니다. CIVIC 는 직선 트랙입니다. 카메라에서 프로젝터를 거쳐 AI 의 뇌로 들어가는 동안 정보의 "압축된" (짧아진) 목록을 끝까지 유지합니다. 결코 무거운 버전으로 다시 전환하지 않습니다. 이는 AI 가 모드 전환이나 데이터 재구성에 에너지를 낭비하지 않음을 의미합니다.

  3. "메모리 절약" (KV-cache):
    AI 가 1,000 개 대신 400 개의 핵심 포인트만 기억해야 하므로, 단기 기억 (KV-cache) 이 극적으로 축소됩니다. 논문은 CIVIC 가 표준 방법 대비 약 3 분의 1의 메모리 공간만 사용한다고 밝혔습니다. 무거운 여행 가방을 들고 다니는 것에서 작은 배낭을 들고 다니는 것과 같습니다.

  4. "선생님 - 학생" 수업 (학습):
    세부 사항이 줄어들어 AI 가 혼란을 겪지 않도록 하기 위해, 연구자들은 "텍스트 정렬" 학습 방법을 사용했습니다. 선생님 (크고 느린 AI) 이 학생 (새롭고 빠른 AI) 에게 그림을 설명하는 방법을 보여주는 상황을 상상해 보세요. 선생님은 단순히 "짧게 말해"라고 하지 않고, "그림의 의미를 더 적은 단어로 설명하되, 이야기를 올바르게 전달하도록 해라"라고 말합니다. 이는 AI 가 사물의 위치와 같은 정밀한 세부 사항을 이해하는 능력을 잃지 않도록 보장합니다.

결과
연구자들이 Qwen3-VL 이라는 모델에서 이를 테스트했을 때:

  • 속도: AI 가 작업을 훨씬 더 빠르게 완료했습니다 (~3.5 초에서 ~2.5 초로 감소).
  • 메모리: 메모리 사용량이 크게 줄었습니다 (~122MB 에서 ~44MB 로 감소).
  • 정확도: 더 빠르고 작아졌음에도 불구하고 "어리석어지지" 않았습니다. 여전히 느리고 무거운 버전과 마찬가지로 복잡한 질문에 답하고 이미지 내의 사물을 정확하게 위치시켰습니다.

요약
CIVIC 는 AI 가 불필요한 작업을 하지 않도록 막습니다. 방대한 양의 데이터를 생성한 뒤 줄이려고 시도하는 대신, 처음부터 압축되고 효율적인 요약을 생성하도록 학습합니다. 이는 AI 를 더 빠르게 만들고, 실행 비용을 절감하며, 지능을 잃지 않고 현실 세계에 적용할 수 있도록 준비시킵니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →