← 최신 논문
💻 computer science

NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation

이 논문은 시각 입력에 가산된 노이즈를 통한 탐색 강화와 베이지안 추론을 기반으로 한 이점 추정 방식을 도입하여, 멀티모달 대형 언어 모델의 일반화 능력과 강건성을 향상시키는 새로운 강화학습 프레임워크인 NoisyGRPO 를 제안합니다.

원저자: Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He

게시일 2026-04-08
📖 3 분 읽기☕ 가벼운 읽기

원저자: Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎨 비유: "안개 낀 산에서 길을 찾는 등산가"

생각해 보세요. AI 는 그림을 보고 문제를 푸는 등산가입니다. 우리는 이 등산가에게 "정답이 있는 정상"으로 가는 길을 가르쳐야 합니다.

기존의 방법 (GRPO) 은 등산가에게 맑은 날에 정상으로 가는 길만 보여주고 훈련시켰습니다. 하지만 문제는, 실제 세상에는 안개가 끼거나 길이 험한 날도 많다는 것입니다. 맑은 날에만 훈련받은 등산가는 안개가 낀 날에는 길을 잃거나, 엉뚱한 곳으로 뛰어가는 실수를 자주 합니다.

NoisyGRPO는 이 문제를 해결하기 위해 두 가지 멋진 전략을 사용합니다.

1. 전략 1: "고의적인 안개 뿌리기" (Noise Injection)

훈련할 때, AI 등산가에게 **의도적으로 안개 (노이즈)**를 끼게 합니다.

  • 왜这么做? 맑은 날만 보면 AI 는 "아, 저게 정답이야!"라고 쉽게 외우지만, 안개가 끼면 "어? 저게 정답일까? 아니면 저쪽일까?"라고 고민하게 됩니다.
  • 효과: AI 는 다양한 상황 (안개 낀 날, 흐린 날) 에서도 길을 찾아내는 탐험 능력을 키우게 됩니다. 마치 등산가가 안개 속에서도 나침반을 믿고 길을 찾는 훈련을 하는 것과 같습니다.

2. 전략 2: "현명한 코치" (Bayesian Estimation)

안개가 끼면 AI 가 헛갈려서 엉뚱한 답을 낼 수도 있습니다. 이때 기존 방식은 "정답이 아니야!"라고만 매정하게 점수를 줍니다. 하지만 NoisyGRPO현명한 코치처럼 행동합니다.

  • 코치의 생각: "이 학생이 엉뚱한 답을 냈는데, 안개가 너무 짙어서 그랬을 수도 있잖아? 아니면 진짜로 길을 몰랐을 수도 있고."
  • 작동 원리:
    1. 안개 정도 (Prior): "오늘 안개가 얼마나 짙었지?" (노이즈 양)
    2. 실제 결과 (Likelihood): "학생이 낸 답이 맞았나?" (점수)
    3. 결론 (Posterior): 코치는 이 두 가지를 합쳐서 판단합니다. "안개가 짙었는데도 이 정도 답을 냈다면, 학생은 꽤 잘한 거야!" 혹은 "안개가 없는데도 틀렸다면, 학생은 진짜로 공부해야 해."

이렇게 안개 정도와 실제 결과를 함께 고려하면, AI 는 안개 때문에 실수한 건지, 진짜로 몰라서 실수한 건지 구분하게 되어 더 똑똑하게 학습합니다.


🚀 이 기술이 가져온 변화

이 논문의 실험 결과, NoisyGRPO 를 적용한 AI 는 다음과 같은 변화를 보였습니다.

  1. 더 넓은 세상 적응: 훈련할 때 안개 (노이즈) 를 경험했기 때문에, 실제 세상에서 예상치 못한 상황 (새로운 그림이나 문제) 이 나와도 당황하지 않고 잘 해결합니다.
  2. 할루시네이션 (환각) 감소: AI 가 없는 것을 있는 것처럼 꾸며내는 실수가 줄었습니다. 안개 속에서도 진짜 길을 찾으려 노력했기 때문입니다.
  3. 작은 AI 도 강해짐: 보통 큰 AI 만 잘하는 복잡한 추론을, **작은 AI(30 억 개 파라미터 수준)**도 이 방법을 쓰면 훨씬 잘하게 됩니다. 마치 작은 등산가에게 최고의 나침반과 코치를 붙여주어 거인처럼 만들었죠.

💡 한 줄 요약

"AI 에게 의도적으로 '안개'를 끼게 하여 다양한 상황을 경험하게 하고, 코치가 그 상황을 고려해 공평하게 가르쳐주니, AI 가 더 똑똑하고 튼튼하게 변했다!"

이 기술은 AI 가 단순히 정답만 외우는 것이 아니라, **어려운 상황에서도 논리적으로 생각하는 능력 (Chain-of-Thought)**을 기르는 데 큰 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →