GRIT: Teaching MLLMs to Think with Images
본 논문은 자연어와 명시적인 바운딩 박스 좌표를 교차시켜 멀티모달 대형 언어 모델이 시각적으로 근거된 추론 체인을 생성할 수 있도록 하는 강화 학습 기반 방법인 GRIT 를 제안하며, 이는 주석 달린 추론 또는 국소화 레이블 없이도 높은 데이터 효율성을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 똑똑한 로봇에게 퍼즐을 푸는 법을 가르친다고 상상해 보세요. 보통 이 로봇에게 그림에 관한 질문을 하면, 말로만 답하려고 합니다. "새가 보입니다"라고 말할 수는 있지만, 실제로 그 새를 가리키지는 않습니다. 이는 어두운 방에서 위치를 설명할 때 오직 말만 사용하여 상대방이 어디를 보고 있는지 추측하게 하려는 것과 같습니다.
"GRIT: MLLM 에게 이미지로 생각하게 하기"라는 논문은 이러한 로봇들 (멀티모달 대규모 언어 모델, 즉 MLLM) 을 가르치는 새로운 방식을 제시합니다. 여기 간단한 비유를 사용한 해설이 있습니다:
1. 문제: "장님" 같은 사고방식
현재의 AI 모델들은 말하기는 뛰어나지만, 그림을 볼 때 순수한 텍스트로 "생각"하는 경향이 있습니다. 정답을 맞출 수는 있지만, 그 답을 찾기 위해 어디를 보았는지는 보여줄 수 없습니다. 이는 지문이나 증거를 보여 주거나 가리키지 않고 범인의 이름만 추측하여 사건을 해결하는 형사와 같습니다. 이로 인해 그들의 추론은 신뢰하기 어렵고 때로는 부정확합니다.
2. 해결책: "가리키는" 습관 (GRIT)
저자들은 GRIT(이미지와 텍스트를 활용한 근거 기반 추론) 이라는 방법을 개발했습니다. 단순히 말하는 대신, AI 가 생각할 때 가리키도록 가르치는 것입니다.
- 비유: AI 가 학생에게 지도를 설명하는 선생님을 상상해 보세요. 단순히 "보물이 저기에 있습니다"라고 말하는 대신, 지도의 그 자리에 상자를 그리고 "나는 여기 [상자 그리기] 를 보고 있으며 바위가 보이므로 보물은 그 옆에 있을 것입니다"라고 말합니다.
- 작동 원리: AI 는 일반적인 문장과 바운딩 박스(이미지의 특정 부분을 둘러싼 직사각형을 그리는 좌표) 가 혼합된 사고의 연쇄를 생성합니다. 이는 문자 그대로 문제를 해결하는 데 사용하는 이미지 부분을 가리키는 것입니다.
3. 핵심 비법: 시행착오를 통한 학습 (GRPO-GR)
보통 AI 에게 이렇게 복잡한 일을 가르치려면, 인간이 모든 단계를 서술하고 모든 박스를 그린 수천 개의 예시가 필요합니다. 이는 로봇을 위한 교과서를 쓰기 위해 교사 팀을 고용하는 것과 같습니다.
이 논문은 획기적인 주장을 합니다: GRIT 는 거의 예시가 필요 없습니다.
- 비유: 교과서를 읽는 대신, AI 는 비디오 게임을 하는 아이처럼 학습합니다. 그림과 질문을 주면 답을 시도합니다. 최종 답이 맞고 규칙 (박스를 그리는 것 등) 을 따르면 "높은 점수"(보상) 를 받습니다. 실패하면 낮은 점수를 받습니다.
- 마법: 연구자들은 AI 를 훈련시키기 위해 20 개의 예시(20 개의 연습 문제와 같음) 만 사용했습니다. AI 는 "높은 점수를 받으려면 말하면서 이미지로 가리켜야 한다"는 패턴을 알아냈습니다. 이를 GRPO-GR이라고 부르는데, 정답을 맞춘 것뿐만 아니라 올바른 "가리키기" 형식을 사용한 것에 대해 AI 를 보상하는 특수한 훈련 방법입니다.
4. 결과: 더 똑똑하고 더 정직한 AI
훈련된 로봇들을 테스트했을 때:
- 수학과 세는 능력 향상: "새집에 알이 몇 개 있나요?"라고 물으면 로봇은 단순히 숫자를 추측하지 않았습니다. 대신 알을 가리키고, "생각" 속에서 하나씩 세어본 후 답을 제시했습니다.
- 두 가지 기술의 통합: 이전에는 AI 가 말하기 (추론) 는 잘하거나 가리키기 (근거 기반) 는 잘했지만, 둘을 동시에 하지는 못했습니다. GRIT 는 이를 동시에 수행하도록 가르쳤습니다.
- 더 높은 신뢰도: AI 는 증거를 가리켜야 하므로 거짓말을 하기 어렵습니다. 만약 특정 곳을 가리키며 "고양이가 보입니다"라고 말했는데 거기에 고양이가 없다면, 시스템은 무언가 잘못되었음을 알게 됩니다.
5. 발견한 점 (그리고 발견하지 못한 점)
- 데이터 효율성: 거대한 데이터 라이브러리가 필요하지 않음을 입증했습니다. 로봇에게 이 새로운 "가리키기" 습관을 가르치는 데는 단 20 개의 예시만으로도 충분했습니다.
- 주의 집중: AI 가 특정 곳을 가리킬 때 (박스를 그릴 때), 다음 생각에서 실제로 그 부분의 이미지에 더 많은 주의를 기울입니다. 이는 가리키는 행위가 로봇이 눈을 집중하는 데 도움을 주는 것과 같습니다.
- 한계: 논문은 더 많은 데이터를 추가하면 도움이 되지만, 한계점이 있음을 지적합니다. 로봇이 아직 보지 못한 것들을 더 잘 처리하려면, 단순히 같은 데이터가 더 많은 것이 아니라 데이터의 다양성이 더 필요합니다.
요약하자면:
GRIT 는 AI 로봇이 말하면서 이미지로 가리키도록 강요함으로써 "눈으로 생각하게" 만드는 새로운 훈련 방법입니다. 거의 데이터 없이 (단 20 개의 예시) 이 복잡한 기술을 가르치고 AI 의 추론을 투명하고 신뢰할 수 있게 만든다는 점에서 큰 도약입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.