← 최신 논문
🤖 machine learning

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

이 논문은 시각 도구의 원시 픽셀 출력이 아닌 언어 친화적인 요약 형식으로 변환하는 '지각 프로그램 (P2^2)'을 제안하여, 학습 없이도 다중 모달 언어 모델의 시각 추론 능력을 획기적으로 향상시키고 새로운 최첨단 성능을 달성함을 보여줍니다.

원저자: Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

게시일 2026-04-15
📖 3 분 읽기☕ 가벼운 읽기

원저자: Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"멀티모달 언어 모델 (MLLM)"**이라는 똑똑한 AI 가 그림이나 영상을 볼 때, 왜 종종 실수를 하는지, 그리고 어떻게 하면 그 실수를 고칠 수 있는지에 대한 이야기를 담고 있습니다.

핵심 아이디어를 한 마디로 요약하면 다음과 같습니다:

"AI 에게는 '픽셀 (화소)'이라는 원시적인 데이터를 주지 말고, 사람이 이해할 수 있는 '단서 (Cue)'로 정리된 요약본을 주세요."

이제 이 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제 상황: "너무 많은 정보에 질려버린 AI"

상상해 보세요. 여러분이 **초등학교 1 학년 학생 (AI)**에게 복잡한 수학 문제를 풀게 하려고 합니다. 그런데 문제지 대신 **수천 장의 원시적인 계산 과정 (숫자 나열)**을 그대로 주었습니다.

  • 기존 방식 (Raw Tool Output): AI 는 카메라가 움직이는지, 물체가 얼마나 가까운지 등을 계산하는 전문 도구 (Depth, Flow 등) 를 사용했습니다. 하지만 이 도구들이 내놓은 결과는 수백만 개의 픽셀 데이터였습니다.
    • 마치 "빨간색 픽셀 100 개, 파란색 픽셀 200 개, 좌표 (x,y) 는 123..."이라고 나열하는 것과 같습니다.
    • 결과: AI 는 이 방대한 숫자 더미 속에서 의미를 찾으려다 지쳐버립니다. 결국 AI 는 언어 모델로서의 본능 (언어적 편견) 에 의존해서 "아마도 오른쪽일 거야"라고 임의의 추측을 하게 됩니다.

2. 해결책: "퍼셉션 프로그램 (P2)"이라는 요약본

이 논문은 "정보를 정리해 주는 비서" 역할을 하는 새로운 방법, **퍼셉션 프로그램 (Perception Program, P2)**을 제안합니다.

  • 비유: 전문 도구가 내놓은 복잡한 숫자 더미를, **AI 가 바로 이해할 수 있는 '간결한 메모'**로 바꿔주는 것입니다.
    • 기존: "픽셀 (10, 20) 의 깊이는 0.5, 픽셀 (11, 20) 의 깊이는 0.6..."
    • P2 방식: "왼쪽 상단 영역은 가깝고, 오른쪽 하단 영역은 멀다. 카메라는 오른쪽으로 움직였다."
  • 효과: AI 는 이제 복잡한 숫자 계산 대신, **사람이 쓰는 언어 (메모)**를 읽어서 논리적으로 추론할 수 있게 됩니다. 마치 복잡한 지도 대신 "목적지는 오른쪽으로 3km"라는 명확한 지시를 받은 것과 같습니다.

3. 실제 성과: "작은 AI 도 대박을 내다"

이 방법을 적용했을 때 놀라운 결과가 나왔습니다.

  • 기존의 고난이도 AI 들: 거대한 모델 (GPT-5 Mini 등) 이도 원시 데이터를 주면 40~50% 만 맞추는 실수를 했습니다.
  • P2 를 쓴 AI: 같은 모델이라도 **P2(요약본)**를 받으면 정답률이 80~90% 이상으로 치솟았습니다.
  • 작은 모델의 반전: 아주 작은 AI 모델 (InternVL3.5-4B 등) 도 P2 를 받으면, 거대 모델이 원시 데이터로 풀 때보다 훨씬 잘 풀었습니다. 마치 작은 학생에게도 명확한 해설지를 주면, 해설지 없이 어려운 문제를 푸는 천재보다 더 잘 풀게 되는 것과 같습니다.

4. 핵심 교훈: "더 많은 도구가 필요한 게 아니라, 올바른 설명이 필요하다"

이 논문의 가장 중요한 메시지는 다음과 같습니다.

"AI 가 시각 정보를 못 보는 게 아니라, 시각 정보를 언어로 번역하는 방식이 잘못되었을 뿐입니다."

기존에는 AI 에게 더 많은 도구를 연결하거나, 더 큰 모델을 만들려고 했습니다. 하지만 이 논문은 **"기존 도구가 주는 정보를 어떻게 '언어'라는 AI 가 가장 잘 이해하는 형태로 포장하느냐"**가 핵심이라고 말합니다.

요약

이 논문은 AI 에게 "그림을 직접 보여주고 계산하게 하는 것" 대신, **"그림의 핵심 단서를 언어로 요약해서 알려주는 것"**이 훨씬 더 똑똑하고 정확한 판단을 이끌어낸다는 것을 증명했습니다.

한 줄 결론:

"AI 에게는 원시 데이터 (픽셀) 가 아닌, 사람이 이해하는 언어 (단서) 로 정리된 요약본을 주면, 훨씬 더 똑똑해집니다!"

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →