Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO
이 논문은 멀티모달 거대 언어 모델이 기존 대상에 대한 위치 추정 정확도를 저해하지 않으면서도 일반화된 지칭 표현 이해(Generalized Referring Expression Comprehension) 작업에서 존재하지 않는 객체를 효과적으로 거부할 수 있도록 하는 강화 학습 전략인 거부 보정 그룹 상대 정책 최적화(Refusal-Calibrated Group Relative Policy Optimization, RC-GRPO)를 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 사람과 함께 "아이 스파이(I Spy)" 게임을 하는 법을 가르치고 있다고 상상해 보세요. 사람이 그림을 가리키며 "빨간 공을 찾아봐"라고 말합니다. 만약 빨간 공이 거기 있다면, 로봇은 그것을 정확히 가리켜야 합니다. 하지만 만약 사람이 "빨간 공을 찾아봐"라고 말했는데, 실제 그림에는 파란 고양이가 있다면 어떻게 될까요? 똑똑한 로봇이라면 "여기에는 빨간 공이 없습니다. 존재하지 않아요"라고 말해야 합니다. 하지만 오늘날의 매우 똑똑한 컴퓨터 두뇌들(멀티모 modalities 대규모 언어 모델이라고 불리는 것들)은 마치 틀리는 것을 극도로 두려워하는 열성적인 학생와 같습니다. 그들은 답을 내놓고 싶어 너무나 간절한 나머지, 빨간 공이 보이지 않을 때도 그냥 추측해 버리고는 파란 고양이를 가리키며 "여기 있어요!"라고 주장합니다. 이것을 "환각(hallucination)"이라고 부릅니다—즉, 사실이 아닌 것을 지어내는 것입니다.
이 논문은 "일반화된 참조 표현 이해(Generalized Referring Expression Comprehension)"라고 불리는 특정한, 까다로운 버전의 이 문제를 다룹니다. 이것은 멋진 말로 표현하자면 "로봇이 물체가 있으면 찾을 수 있는지, 그리고 물체가 없다면 정직하게 '보이지 않는다'라고 말할 수 있는지"를 묻는 것입니다. 연구진은 이 로봇들이 무언가를 찾는 데는 뛰어나지만, 무언가가 없을 때 이를 인정하는 데는 형편없다는 것을 발견했습니다. 만약 당신이 로봇에게 더 자주 "아니오"라고 말하도록 훈련시킨다면, 로봇은 너무 겁을 먹어서 실제로 존재하는 것들조차 찾지 못하게 됩니다. 연구팀은 로봇이 정말로 필요할 때만 "아니오"라고 말할 수 있도록, 즉 제대로 있는 것을 보고도 못 본다고 하지 않도록 가르칠 방법이 필요했습니다.
이 논문의 저자들은 **RC-GRPO(Refusal-Calibrated Group Relative Policy Optimization)**라고 불리는 영리하고 새로운 훈련 방법을 제안합니다. 로봇의 학습 과정을 "뜨겁다 차갑다(Hot and Cold)" 게임처럼 생각해 보세요. 보통 로봇은 자신의 추측이 얼마나 근접했는지에 따라 점수를 받습니다. 하지만 물체가 없을 때, 로봇은 계속해서 추측을 하기 때문에 결코 정답을 배우지 못합니다. 연구진의 첫 번째 비결은 연습 과정 중에 로봇이 아무리 추측하고 싶더라도 "없음, 보이지 않음"이라고 말하도록 강제하는 것이었습니다. 이는 물체가 없을 때 올바른 말을 했을 때 로봇에게 명확한 "보상"을 주었습니다.
하지만 연구진은 단순히 로봇이 "없음"이라고 말하는 것에 대해 칭찬하기만 한다면, 로봇이 물체가 있을 때도 모든 것에 대해 "없음"이라고 말하기 시작할 것이라는 점을 깨달았습니다. 이를 해결하기 위해 그들은 특별한 규칙을 추가했습니다: 만약 로봇이 물체가 실제로 존재하는데도 "없음"이라고 말한다면, 큰 벌점을 받는 것입니다. 이것은 로봇에게 이렇게 말하는 것과 같습니다. "공이 없을 때 보이지 않는다고 말해도 괜찮지만, 공이 바로 눈앞에 있는데도 보이지 않는다고 말하면 점수를 잃게 될 거야." 그들은 또한 두 번째 단계로, 로봇이 왜 물체가 없다고 생각하는지 설명하게 만들었습니다 (예: "파란 고양이만 있기 때문에 빨간 공이 보이지 않습니다"). 이는 로봇이 단순히 패턴을 암기하는 것이 아니라, 실제로 그림을 이해하도록 강제합니다.
결과는 이 방법이 매우 효과적임을 보여줍니다. 새로운 방법을 세 가지 도전적인 테스트에서 테스트했을 때, 로봇들은 물체를 찾는 능력과 존재하지 않는 것을 추측하지 않고 거절하는 능력 모두에서 훨씬 더 나아졌습니다. 예를 들어, 한 테스트에서 그들의 방법은 로봇의 전체 정확도를 45%에서 62%로 향상시켰으며, 심지어 다른 고급 방법들을 상당한 차이로 앞질렀습니다. 이 논문은 이 접근 방식이 로봇이 완벽한 균형을 찾도록 도와준다고 제안합니다. 즉, 사라진 물체에 대해 가짜 위치를 만들어내는 것을 멈추면서도, 실제 있는 것을 찾는 능력을 잃지 않게 하는 것입니다. 이것은 AI가 단순히 똑똑한 것을 넘어, 자신이 보는 것과 보이지 않는 것에 대해 정직할 수 있게 만드는 길로 향하는 한 걸음입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.