Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models
이 논문은 픽셀이 아닌 잠재 공간(latent space)에 보정된 노이즈를 주입함으로써 시각-언어 모델의 강화 학습 롤아웃을 다양화하여, 최소한의 구현 흔적을 유지하면서도 도메인 외 추론 능력과 환각 강건성을 크게 향상시키는 방법론인 Noise-Contrastive GRPO(NC-GRPO)를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이미지를 보고 질문에 답하거나, 글로 된 수학 문제를 읽고 해결할 수 있는 컴퓨터를 상상해 보십시오. 시각-언어 모델(vision-language models)로 알려진 이러한 시스템들은 점점 더 유능해지고 있지만, 여전히 실수를 저지르곤 합니다. 때로는 충분히 신중하게 생각하지 못해서 틀린 답을 내놓기도 하고, 다른 때에는 단순히 사실이 아닌 것을 자신 있게 진술하는 문제, 즉 '환각(hallination)' 현상을 보이기도 합니다. 이러한 모델이 더 잘 생각하도록 가르치기 위해 연구자들은 강화 학습(reinforcement learning)이라는 방법을 사용합니다. 이 과정에서 모델은 단일 문제를 해결하기 위해 여러 가지 다른 시도를 생성하도록 요청받습니다. 만약 어떤 시도는 정답이고 다른 시도는 오답이라면, 모델은 성공적인 경로를 선호하는 법을 배웁니다. 그러나 이 학습이 효과를 거두려면, 서로 다른 시도들이 실제로 서로 달라야 합니다. 모델이 똑같은 사고 과정을 반복하기만 한다면, 새로운 것을 배울 수 없습니다.
문제는 어떻게 모델이 다양한 사고 방식을 탐구하도록 강제하느냐였습니다. 전통적으로 연구자들은 컴퓨터의 의사결정 과정의 온도를 조절하거나, 사진에 노이즈를 추가하는 것처럼 입력 이미지를 약간 왜곡함으로써 변화를 주려고 시도했습니다. 아마zon 웹 서비스(AWS)의 연구진에 의한 새로운 연구는 이러한 외부적인 변화가 모델의 사고를 다양화하는 데 가장 효과적인 방법이 아닐 수도 있다고 제안합니다. 대신, 그들은 변형이 모델이 문제를 처리하기 시작하는 바로 그 순간, 즉 모델 내부의 표현(internal representation) 단계에서 일어나야 한다고 제这款합니다. 모델이 답변을 생성하기 시작하기 전, 모델의 숨겨진 정신 상태(hidden mental state)에 아주 작고 통제된 양의 무작위 노이즈를 주입함으로써, 그들은 더 견고하고 정확한 사고자를 만들어낼 수 있다는 것을 발견했습니다.
연구진은 '노이즈-대조 그룹 상대 정책 최적화(Noise-Contrastive Group Relative Policy Optimization)'라고 부르는 기술을 개발했습니다. 이 기술이 어떻게 작동하는지 이해하기 위해, 한 그룹의 학생들이 동일한 기하학 문제를 풀고 있는 모습을 상상해 보십시오. 표준적인 훈련 세션에서는 각 학생이 우연히 조금씩 다르게 문제를 풀 수는 있겠지만, 그들은 모두 문제에 대한 완전히 동일한 이해를 바탕으로 시작합니다. 이 새로운 접근 방식에서는 학생 중 절반에게 약간 다른 출발점을 제공합니다. 연구진은 모델의 내부 상태, 즉 모델이 문제를 자신의 '마음' 속에 인코딩한 방식을 가져와서, 그룹의 절반에게 작은 무작위 충격을 가합니다. 이 충격은 이미지 자체를 바꾸는 것도 아니고, 페이지 위의 글자를 바꾸는 것도 아닙니다. 그것은 모델의 내부적인 관점을 미묘하게 변화시키는 것으로, 마치 학생에게 글을 쓰기 전에 문제를 약간 다른 각도에서 바라보라고 요청하는 것과 같습니다.
그 후 모델은 두 그룹으로부터 답변을 생성합니다. 하나는 정상적이고 깨끗한 이해로부터 시작하는 그룹이고, 다른 하나는 이 약간 치우친, 노이즈가 섞인 이해로부터 시작하는 그룹입니다. 핵심 통찰은 모델이 결과를 통해 배우는 방식에 있습니다. 만약 노이즈가 섞인 출발점에서 시작한 그룹이 처음에 도입된 혼란에도 불구하고 여전히 정답을 찾아낸다면, 모델은 보상을 받습니다. 만약 노이즈로 인해 모델이 경로를 벗어나 실패한다면, 그 경로는 벌점을 받습니다. 시간이 흐르면서 모델은 출발점이 약간 불안정하더라도 작동할 수 있을 만큼 견고한 해결책을 찾는 법을 배웁니다. 이는 단순히 정답을 배우는 것이 아니라, 자신의 사고 과정에서 발생하는 작은 교란에 대해서도 견딜 수 있는 강건함(robustness)을 배우는 것입니다.
이 실험의 결과는 놀라웠습니다. 연구진은 기하학 문제에 훈련된 대규모 시각-언어 모델을 대상으로 이 방법을 테스트했습니다. 이 새로운 방법을 표준적인 방식 및 입력 이미지를 왜곡하는 기존 방식과 비교했을을-때, 새로운 방법은 어렵고 본 적 없는 수학 문제에서 현저히 더 나은 결과를 나타냈습니다. 모델은 이전에 본 적 없는 문제를 해결하는 능력, 즉 '도메인 외 추론(out-of-domain reasoning)' 능력이 향상되었습니다. 더욱 놀라운 점은, 이 방법이 환각 현상을 피하는 데에도 더 효과적이었다는 것입니다. 이미지를 왜곡하는 기존 방식은 모델이 시각적 세부 사항을 더 명확하게 보도록 도왔지만, 때로는 모델이 사실에 충실하는 것을 방해하기도 했습니다. 반면, 이 새로운 방법은 모델의 추론 능력과 정직함을 동시에 개선했습니다.
연구진은 이 기술이 정확히 왜 작동하는지도 조사했습니다. 연구진은 이 이점이 노이즈의 특정 방향 때문인지, 아니면 단순히 노이즈가 무작위라는 사실 때문인지를 테스트했습니다. 그들은 방향은 중요하지 않다는 것을 발견했습니다. 노이즈가 모델의 사고를 한 방향으로 밀어내든 다른 방향으로 밀어내든, 결정적인 요인은 각 시도가 고유하고 독립적인 관점에서 시작된다는 사실 그 자체였습니다. 또한 그들은 노이즈의 크기가 마치 '다이얼'처럼 작동한다는 것을 발견했습니다. 적은 양의 노이즈는 일반적인 능력을 해치지 않으면서 추론 능력을 향상시켰지만, 너무 많은 노이즈는 전반적인 성능을 저하시키기 시작했습니다. 이는 모델이 일반적인 지식을 잃지 않으면서도 더 나은 전문가가 될 수 있는 '최적의 지점(sweet spot)'이 존재함을 시사합니다.
가장 중요한 발견 중 하나는 이 방법이 이미지나 텍스트를 바꾸는 것이 아니라 모델의 내부 상태를 변경함으로써 작동한다는 점입니다. 이는 이 기술이 이미지를 처리하는 모델뿐만 아니라 정보를 처리하는 모든 유형의 모델에 잠재적으로 적용될 수 있음을 의미합니다. 연구진은 이 방법이 효율적이며, 모델을 실행하는 소프트웨어에 아주 작은 변화만을 요구할 뿐, 답변을 생성하는 과정을 늦추지 않는다는 것을 보여주었습니다. 데이터를 받는 방식이 아니라 모델이 생각을 시작하는 순간에 집중함으로써, 그들은 모델의 추론을 더 신뢰할 수 있고 오류에 덜 취약하게 만드는 방법을 찾아냈습니다.
연구진은 또한 이 접근 방식이 서로 다른 크기의 모델에서도 작동하는지 살펴보았습니다. 동일한 기술을 더 작은 버전의 모델에 적용했을 때, 그 이점은 사라졌습니다. 작은 모델은 더 나아지지도 않았고 더 나빠지지도 않았으며, 단순히 변화가 없었습니다. 이는 이 기술이 효과를 발휘하기 위해서는 모델의 특정 수준의 복잡성이 필요함을 시사합니다. 이것은 모든 컴퓨터에 작동하는 마법의 주문이 아니라, 더 크고 유능한 시스템이 자신의 사고를 정교하게 다듬도록 돕는 특정한 도구입니다. 연구진은 이 결과가 유망하지만, 현재까지 단 하나의 모델 제품군에 대해서만 테스트했으므로 다른 모델에서도 작동하는지 확인하기 위해 더 많은 연구가 필요하다고 주의를 기울였습니다.
궁극적으로, 이 연구는 인공지능을 훈련하는 방식에 대한 새로운 시각을 제공합니다. 입력 데이터를 더 다양하게 만들거나 의사결정 과정을 더 혼란스럽게 만드는 대신, 연구진은 정밀한 내부적 섭동(perturbation)이 더 안정적이고 지적인 결과를 이끌어낼 수 있다는 것을 발견했습니다. 모델에게 출발점이 약간 어긋나더라도 성공하는 법을 가르침으로써, 그들은 모델이 자신의 불확실성에 속아 넘어갈 가능성이 낮은 시스템을 만들어냈습니다. 이 접근 방식은 단순히 모델을 수학에 더 똑똑하게 만드는 것이 아니라, 모델을 더 신뢰할 수 있게 만들며, 확고한 정답과 자신감 있는 추측을 구별할 수 있게 만듭니다. 이러한 시스템이 우리 일상생활에 점점 더 통합됨에 따라, 이를 더 견고하고 오류가 적게 만드는 방법을 찾는 것은 필수적이며, 이 연구는 그 목표를 달성하기 위한 명확한 길을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.