AIR: Adaptive Interleaved Reasoning with Code in MLLMs
이 논문은 콜드 스타트 데이터 구축, 데이터셋 큐레이션, 그리고 그룹 제약 강화 학습에 의해 유도되는 적응형 도구 호출 전략을 포함하는 세 가지 구성 요소의 솔루션을 통해, 복잡한 수치 계산을 위한 코드 기반의 적응형 인터리브 추론 능력을 향로하는 프레임워크인 AIR를 소개하며, 이는 평가 벤치마크에서 상당한 성능 향상을 결과로 나타낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 아주 똑똑한 비서가 있다고 상상해 보세요. 이 비서는 사진을 보고 글을 읽는 데는 매우 뛰어나지만, 복잡한 계산이 필요한 수학 문제를 풀 때는 가끔 막히곤 합니다. 만약 당신이 이 비서에게 부피와 관련된 복잡한 기하학 문제를 풀라고 요청한다면, 비서는 자신의 "머릿속"(신경망)으로 계산을 하려다가 마치 사람이 계산기 없이 큰 숫자를 곱하려고 할 때처럼 실수를 저지를 수 있습니다.
이 논문은 이 비서에게 새로운 초능력을 가르쳐주는 AIR(Adaptive Interleaved Reasoning with Code)라는 새로운 시스템을 소개합니다. 이 초능력이란 바로 언제 생각을 멈추고 도구를 사용하기 시작해야 하는지 아는 능력입니다.
AIR의 작동 방식은 다음과 같이 간단한 개념들로 나누어 설명할 수 있습니다.
1. 핵심 아이디어: "인간 계산기" 비유
AI를 시험을 치르는 학생이라고 생각해 보세요.
- 기존 방식: 학생이 모든 문제를 오직 자신의 머리만 사용하여 풀려고 합니다. 수학이 너무 어려워지면, 학생은 추측하거나 틀린 답을 내놓습니다.
- AIR 방식: 학생은 문제가 너무 까다로워지면 손을 들어 계산기를 달라고 요청할 수 있다는 것을 배웁니다. 학생은 숫자를 적고, 버튼을 누르고, 그 결과를 얻은 다음, 최종 답안을 작성합니다.
- 반전: AI는 모든 질문에 대해 단순히 계산기를 사용하는 것이 아닙니다. AI는 **적응형(adaptive)**으로 행동하는 법을 배웁니다. AI는 "이 질문은 쉬우니까 머릿속으로 해결하자"라고 판단하거나, "이 질문은 어려우니 계산을 위해 코드를 작성해야겠다"라고 판단할 줄 압니다.
2. 훈련 과정: 2단계 여정
논문은 AI에게 단순히 "계산기를 사용하라"고 말한다고 해서 즉시 제대로 작동할 것이라고 기대할 수 없다고 설명합니다. AI에게는 특정한 훈련 계획이 필요합니다.
1단계: "콜드 스타트" (기초 학습)
AI가 스스로 도구를 사용하는 법을 배우기 전에, 어떻게 하는지에 대한 예시를 먼저 보아야 합니다. 연구진은 어려운 수학 문제들을 가져와서 AI에게 "생각하기"(텍스트)와 "계산하기"(파이썬 코드 작성) 사이를 어떻게 전환하는지 수동으로 보여주는 특별한 데이터셋을 구축했습니다.
- 비유: 마치 선생님이 학생에게 어려운 부분에서 계산기를 사용하는 몇 가지 풀이 과정을 보여주는 것과 같습니다. 이는 학생에게 따라 할 수 있는 기본적인 템플릿을 제공합니다.
2단계: 강화 학습 ("시행착오" 단계)
기초를 익힌 후, AI는 스스로 연습을 시작합니다. 여기서 마법 같은 일이 일어납니다. 연구진은 AI에게 도구를 언제 사용할지 가르치기 위해 특별한 점수 체계(보상 함수)를 사용했습니다.
- 문제점: 만약 AI가 도구를 너무 자주 사용하면 혼란에 빠져 훈련이 무너질 수 있습니다(마치 스스로 생각하기를 거부하는 학생처럼 말이죠). 반대로 도구를 전혀 사용하지 않는다면 계속해서 수학적 오류를 범하게 됩니다.
- 해결책: 연구진은 **"그룹 제약 보상(Group-Constrained Reward)"**을 만들었습니다. 이는 팀 전체를 지켜보는 코치를 상상해 보세요. 코치는 단순히 득점한 선수 한 명에게만 보상을 주는 것이 아니라, 팀 전체가 계산기를 사용하는 비율이 적절한지에 대해 보상을 줍니다.
- AI가 도구를 너무 자주 사용하면 낮은 점수를 받습니다.
- AI가 정답을 맞히기 위해 딱 적절한 만큼만 도구를 사용하면 높은 점수를 받습니다.
- 이를 통해 AI의 상태를 안정적으로 유지하고, 도구 사용량이 통제 불능이 되는 것을 방지합니다.
3. 결과: 더 똑똑하고 더 안정적임
논문에 따르면 이 훈련을 거친 후:
- 정확도: AI는 수학 문제, 특히 복잡한 계산이 필요한 문제에서 성능이 크게 향상되었습니다. 평균적으로 점수가 약 6점 상승했으며, 도구를 사용한 특정 문제들에 대해서는 거의 10점에 가까운 향상을 보였습니다.
- 신뢰성: AI는 도구를 사용하기로 결정했을 때 95% 이상의 높은 확률로 성공적으로 도구를 사용했습니다.
- 안정성: "그룹 제약" 방식은 AI가 도구를 사용하는 법을 배울 때 흔히 발생하는 문제인 훈련 중의 불안정성이나 붕괴 현상을 방지했습니다.
요약
요약하자면, AIR는 멀티모달 거대 언어 모델(보고 읽는 능력을 갖춘 AI)이 인간 문제 해결자처럼 행동하도록 가르치는 방법입니다. 즉, 문제를 생각하다가, 수학이 너무 어렵다는 것을 깨닫고, 계산을 해결하기 위해 빠르게 컴퓨터 스크립트를 작성한 뒤, 최종 답안을 완성하는 법을 가르칩니다. 핵심 혁신은 사람이 언제 계산기를 집어 들라고 지시하지 않아도, AI가 자동으로 그리고 적절한 시점에 이 과정을 수행하도록 가르치는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.