← 최신 논문
🤖 AI

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

이 논문은 텍스트로 좌표를 생성하는 기존 방식 대신 시각 토큰을 직접 선택하는 '그라운딩 토큰' 메커니즘을 도입하여 이미지, GUI, 비디오 포인트링 및 추적 작업에서 새로운 최첨단 성능을 달성한 MolmoPoint 모델을 제안합니다.

원저자: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

게시일 2026-03-31
📖 3 분 읽기☕ 가벼운 읽기

원저자: Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

MolmoPoint: AI 가 손가락으로 가리키는 새로운 방식 (MolmoPoint: AI 가 손가락으로 가리키는 새로운 방식)

이 논문은 **"시각 언어 모델 (VLM)"**이라는 AI 가 이미지나 비디오 속의 특정 대상을 가리키는 (Pointing) 능력을 획기적으로 개선한 방법을 소개합니다.

기존의 AI 는 "좌표 (x, y)"라는 숫자를 말로 출력해서 대상을 가리켰다면, MolmoPoint 는 마치 사람이 손가락으로 직접 화면을 찌르는 것처럼, 이미지 속의 '특정 조각'을 직접 선택합니다.

이 복잡한 기술을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 기존 방식 vs. 새로운 방식: "주소 찾기" vs. "손가락 찌르기"

🚫 기존 방식 (숫자 좌표):
기존 AI 는 "그 물체는 화면의 (350, 420) 번 위치에 있어!"라고 숫자를 말합니다.

  • 비유: 친구에게 "내 집은 3 번 도로, 420 번 지번이야"라고 알려주는 것과 같습니다.
  • 문제점: AI 가 숫자 체계를 완벽하게 외워야 하고, 계산이 복잡하며, 실수하면 엉뚱한 곳에 가리킵니다. 또한, 숫자를 말하려면 많은 '단어 (토큰)'가 필요해서 속도가 느립니다.

✅ MolmoPoint 방식 (그라운딩 토큰):
이 새로운 AI 는 숫자를 말하지 않고, 이미지 속의 특정 '조각 (Patch)'을 직접 가리키는 특수한 신호를 보냅니다.

  • 비유: 친구에게 "저기 저 빨간 차의 왼쪽 브레이크 불을 봐!"라고 말하며 손가락으로 직접 그 부분을 찌르는 것과 같습니다.
  • 장점: 숫자 계산이 필요 없으니 훨씬 빠르고, 이미지가 크든 작든 상관없이 똑같이 정확하게 가리킬 수 있습니다.

2. 어떻게 정밀하게 가리킬까? (3 단계 확대기)

이 AI 는 한 번에 정확한 위치를 찾지 않고, 3 단계로 점점 확대하며 찾습니다. 마치 돋보기로 사물을 자세히 보는 과정과 같습니다.

  1. (큰 영역 선택): 먼저 "저기 차가 있는 큰 영역"을 가리킵니다. (예: 차가 있는 화면의 왼쪽 위)
  2. (작은 영역 선택): 그 영역 안에서 "브레이크 등 부분"을 더 자세히 가리킵니다.
  3. (정확한 점 선택): 마지막으로 그 작은 영역 안에서 "브레이크 등 중심의 정확한 점"을 찌릅니다.

이렇게 단계별로 좁혀나가기 때문에, 고해상도 사진에서도 아주 작은 물체 (예: 자동차 번호판의 작은 글자) 를 정확하게 찾을 수 있습니다.


3. 실수 방지 장치: "더 이상 가리킬 게 없어"

기존 AI 들은 때때로 "아직 가리킬 게 있나?"라고 생각하며 불필요하게 계속 가리키는 실수를 하기도 했습니다. (예: 차 한 대를 가리키는데 10 번이나 반복해서 가리킴)

MolmoPoint 는 **"더 이상 가리킬 게 없어 (No-More-Points)"**라는 특수 신호를 도입했습니다.

  • 비유: "이제 끝났어!"라고 말하며 손가락을 멈추는 것과 같습니다. 이 덕분에 AI 는 불필요한 작업을 멈추고 더 정확한 결과를 냅니다.

4. 어디에 쓰일까요? (실생활 예시)

이 기술은 다양한 분야에서 AI 의 능력을 높여줍니다.

  • 🖥️ 컴퓨터 사용 (GUI): "저기 '저장' 버튼을 눌러줘"라고 하면, AI 가 메뉴 속의 정확한 버튼을 찾아 가리킵니다. 기존 방식보다 훨씬 정교하게 컴퓨터를 조작할 수 있습니다.
  • 🎥 비디오 분석: "저기 빨간 옷 입은 사람이 넘어진 장면을 찾아줘"라고 하면, 긴 영상 속에서 그 순간을 정확히 찾아냅니다.
  • 🤖 로봇 제어: 로봇에게 "저기 사과를 잡아줘"라고 하면, AI 가 사과가 있는 정확한 위치를 손가락으로 가리켜 로봇이 잡을 수 있게 도와줍니다.

5. 요약: 왜 이것이 중요한가요?

  1. 더 빠르고 효율적: 숫자를 계산할 필요가 없어서 AI 가 더 빨리 생각하고, 더 적은 자원을 사용합니다.
  2. 더 정확함: 이미지 크기가 달라도 흔들리지 않고 정확한 위치를 가리킵니다.
  3. 더 똑똑한 학습: 적은 데이터로도 훨씬 빠르게 배우는 '학습 효율'이 좋아졌습니다.

결론적으로, MolmoPoint 는 AI 가 "숫자로 위치를 설명하는 것"에서 벗어나 **"눈과 손가락으로 직접 대상을 지시하는 것"**으로 진화하게 만든 획기적인 기술입니다. 이제 AI 는 우리가 원하는 것을 훨씬 더 직관적이고 정확하게 이해하고 실행할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →