← 최신 논문
🤖 machine learning

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

이 논문은 고품질 장거리 추론 데이터의 부족을 해결하기 위해 다중 에이전트 프레임워크와 자기 개선 학습 루프를 도입하여 이미지 및 비디오 도메인에서 고급 시각적 추론 능력을 획기적으로 향상시킨 'Insight-V++'를 제안합니다.

원저자: Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

게시일 2026-03-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎨 비유: "현명한 탐정 팀"과 "신중한 판사"

기존의 인공지능 (MLLM) 은 마치 혼자서 모든 일을 해결하려는 초보 탐정과 같았습니다. 그림을 보고 바로 결론을 내리려다 실수를 하거나, 복잡한 사건을 해결하는 과정에서 논리가 꼬여버리는 경우가 많았죠.

**Insight-V++**는 이 문제를 해결하기 위해 두 명의 전문가로 구성된 팀을 꾸렸습니다.

  1. 추리형 탐정 (Reasoning Agent):

    • 역할: 사건 현장 (이미지나 영상) 을 꼼꼼히 조사하고, 단계별로 단서를 모으는 사람입니다. "이 사람은 왜 거꾸로 매달려 있을까?", "공이 왜 위로 날아갔을까?" 같은 질문을 던지며 긴 추리 과정을 작성합니다.
    • 특징: 결론을 내리기 전에 가능한 모든 시나리오를 생각하고, 논리적 오류를 찾아냅니다.
  2. 신중한 판사 (Summary Agent):

    • 역할: 탐정이 작성한 긴 추리 보고서를 읽고, "이 논리가 맞나? 중요한 건 뭐지?"를 판단하여 최종 판결 (정답) 을 내리는 사람입니다.
    • 특징: 탐정이 실수한 부분이 있다면 지적하고, 올바른 부분만 골라내어 정확한 답을 도출합니다.

🚀 이 시스템이 기존과 다른 3 가지 핵심 비밀

1. "스스로 배우는 훈련소" (자가 진화 시스템)

기존에는 사람이 직접 정답과 오답을 가르쳐야 했지만, Insight-V++ 는 스스로 학습합니다.

  • 비유: 탐정이 추리 과정을 작성하면, 판사가 "여기서 논리가 틀렸어"라고 피드백을 줍니다. 탐정은 이 피드백을 받고 다시 추리를 수정합니다. 이 과정을 반복하면서 두 사람은 서로의 실수를 고쳐주며 점점 더 똑똑해집니다. 마치 스스로 연습하고 피드백을 주고받는 운동 선수처럼 말이죠.

2. "정교한 훈련 도구" (ST-GRPO & J-GRPO)

이 시스템은 두 전문가에게 각각 맞는 특별한 훈련 방법을 적용했습니다.

  • 추리형 탐정용 (ST-GRPO): 영상처럼 시간이 흐르며 변하는 상황 (공이 떨어지는 속도, 방향 등) 을 정확히 파악하도록 훈련합니다. 마치 시간이 흐르는 영화를 보고 사건의 흐름을 완벽하게 이해하는 훈련입니다.
  • 신중한 판사용 (J-GRPO): 탐정이 쓴 보고서가 얼마나 신뢰할 만한지, 그리고 최종 답이 맞는지 판단하는 능력을 키웁니다. 가짜 뉴스와 진짜 사실을 구별하는 안목을 기르는 훈련이라고 볼 수 있습니다.

3. "무한한 문제지 생성기" (데이터 자동 생성)

사람이 직접 그림과 영상을 분석해 데이터를 만드는 건 너무 느리고 비쌉니다. 그래서 이 시스템은 스스로 복잡한 문제를 만들어내고, 그 문제를 스스로 풀고 평가합니다.

  • 비유: 마치 스스로 문제를 내고, 스스로 풀고, 스스로 채점까지 하는 천재 학생처럼, 사람이 개입하지 않아도 수천, 수만 개의 복잡한 추리 문제를 만들어내며 실력을 늘립니다.

🌟 결론: 왜 이것이 중요한가요?

이 기술은 인공지능이 정말 '이해'하는 단계로 넘어가는 중요한 발걸음입니다.

  • 이미지: "저기 공이 떨어진다"는 것을 넘어, "중력 때문에 떨어졌다"는 물리 법칙까지 추론할 수 있습니다.
  • 영상: "사람이 걷는다"는 것을 넘어, "카메라가 뒤집혀 있어서 사람이 거꾸로 걷는 것처럼 보이지만 실제로는 정상이다"라는 복잡한 상황을 파악할 수 있습니다.

요약하자면, **Insight-V++**는 인공지능에게 "혼자서 막연히 추측하는 것"을 멈추게 하고, "논리적으로 단계를 밟아 생각한 뒤, 전문가가 검토하여 결론을 내리는" 인간과 같은 사고 방식을 가르친 획기적인 시스템입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →