← 최신 논문
🤖 AI

Improving Generalization Robustness of Multimodal RLVR

본 논문은 멀티모달 모델에서 표준 RLVR의 취약성을 완화하기 위해 동적 삼진 보상(dynamic trinary reward)과 임베딩 공간 일관성 정규화 도구(embedding-space consistency regularizer)를 결합한 강건한 사후 학습 방법인 Prompt-Invariant RLVR(PIRL)을 제안하며, 이를 통해 의미론적으로는 동일하지만 섭동(perturbation)이 가해진 프롬프트에 대한 일반화 성능을 크게 향상시킨다.

원저자: Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

게시일 2026-08-11
📖 3 분 읽기☕ 가벼운 읽기

원저자: Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하지만 지나치게 문자 그대로만 이해하는 로봇에게 퍼즐을 푸는 법을 가르치고 있다고 상상해 보세요. 당신은 고양이 사진을 보여주며 "이것은 어떤 동물인가요?"라고 묻습니다. 로봇은 완벽하게 "고양이"라고 말하는 법을 배웁니다. 하지만 당신이 질문을 약간 바꾸어 "이미지 속의 고양잇과 동물을 식별하세요"라고 말하면, 갑자기 로봇은 얼어붙거나 틀린 답을 내놓습니다. 이것이 바로 멀티모달 거대 언어 모델(MLLM)의 세계입니다. MLLM은 사진을 볼 수 있는 동시에 텍스트를 읽을 수 있는 매우 똑똑한 AI 시스템입니다. 이 로봇들을 더욱 똑똑하게 만들기 위해, 과학자들은 '검증 가능한 보상을 통한 강화 학습(RLVR)'이라는 기술을 사용합니다. 이것은 로봇이 특정 체크리스트(예: 특정 형식이나 정확한 숫자)와 일치하는 답을 내놓았을 때만 "점수"를 받는 비디오 게임과 같습니다. 목표는 로봇이 더 잘 추론하여 더 많은 점수를 얻도록 훈련하는 것입니다. 하지만 여기에는 함정이 있습니다. 만약 로봇이 퍼즐을 진정으로 이해하는 대신 체크리스트를 속이는 법을 배우게 된다면, 그 모델은 취약해집니다. 질문이 연습 문제와 똑같이 생겼을 때는 시험을 잘 치를지 모르지만, 질문의 표현 방식만 살짝 바꿔도 처참하게 실패할 수 있습니다. 이는 의료 진단이나 법률 자문처럼 로봇이 문구 변경에 따라 무너질 수 있는 실제 세계의 용도에서 매우 위험한 문제입니다.

이 "취약성"을 해결하려는 새로운 연구가 등장했습니다. 펑페이 저우(Pengfei Zhou)와 동료들이 이끄는 연구진은 표준적인 훈련 방식이 AI를 "형식 결벽증 환자"로 만들고 있다는 사실을 발견했습니다. 그들은 AI가 정답을 맞혔을 때 보상을 받는 과정에서, 두 가지 요소가 종종 뒤섞인다는 것을 발견했습니다. 바로 '정답을 맞히는 것'과 '형식 규칙을 따르는 것'(예: 답을 특정 상자 안에 넣는 것)입니다. 만약 AI가 상자 안에 답을 넣는 것을 깜빡한다면, 설령 답이 완벽하더라도 0점을 받게 됩니다. 이는 AI를 혼란스럽게 만들어, 수학적 논리나 내용 대신 상자 모양에 집중하게 만듭니다. 게다가, AI는 매우 작고 특정한 유형의 질문 세트에서만 연습합니다. 그래서 실제 세상에서 질문 방식이 바뀌면 당황하게 됩니다.

이를 해결하기 위해 연구팀은 '프롬프트 불변 RLVR(PIRl)'이라는 새로운 훈련 방법을 제안했습니다. 그들은 두 가지 주요 기술을 도입했습니다. 첫째, AI에게 '동적 삼항 보상(Dynamic Trinary Reward)'을 부여했습니다. 단순히 "맞음/틀림"의 점수 대신, 이제 AI는 세 단계의 점수를 받습니다: 올바른 형식의 정답에는 +1점, 형식이 틀린 정답에는 0점, 형식 오류에는 -1점을 줍니다. 이는 형식이 엉망이더라도 답변의 '내용'이 중요하다는 것을 AI에게 가르칩니다. 둘째, 훈련 과정에 '스턴트 더블(대역)'을 추가했습니다. 그들은 의미는 유지하면서도 미묘하게 질문을 계속 다시 쓰는 '적대적 에이전트(adversarial agent)'를 만들었습니다. 질문의 표현 방식이나 지시 스타일을 바꾸는 식입니다. 그러면 AI는 질문이 어떤 모습으로 꾸며지든 상관없이 동일한 정답을 내놓아야만 합니다. 이는 학생에게 단순히 특정 학습지의 수학 문제를 푸는 법을 가르치는 것이 아니라, 필기체로 쓰였든, 인쇄되었든, 혹은 말로 전달되든 상관없이 문제를 풀 수 있도록 훈련하는 것과 같습니다.

결과는 유망합니다. 연구진이 이 새로운 방식을 기존의 표준 방식(GRPO)과 비교 테스트했을 때, 프롬프트가 재구성되었을 때(스트레스 테스트) 기존 방식의 성능이 크게 떨어지는 것을 발견했습니다. 예를 들어, 일부 수학 벤치마크에서 표준 방식의 정확도는 프롬프트가 변경될 때 약 3%에서 4% 정도 하락했습니다. 반면, 새로운 PIRL 방식은 놀라울 정도로 안정적이었으며, 정확도 하락 폭이 1% 미만이었습니다. 신뢰성이 핵심인 의료 및 법률 분야와 같은 고위험 영역에서도 PIRL은 경쟁 모델보다 훨씬 더 높은 정확도를 유지했습니다. 이 연구는 "정답을 맞히는 것"과 "정답처럼 보이는 것"에 대한 보상을 분리하고, 더 다양한 질문 스타일에 대해 연습함으로써, 우리가 단순히 똑똑할 뿐만 아니라 인간의 복잡하고 예측 불가능한 대화 방식을 다룰 수 있을 만큼 견고하고 신뢰할 수 있는 AI를 구축할 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →