← 최신 논문
💬 NLP

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

이 논문은 주석이 달린 시각적 증거를 사용하여 높은 보상을 받는 훈련 궤적 동안 공간적 주의(spatial attention)를 유도함으로써, 추론 시 추가적인 입력 없이도 지각, 추론 및 환각 벤치마크 성능을 향상시키는 방식으로 시각-언어 모델을 위한 검증 가능한 보상이 있는 강화 학습(RLVR)을 강화하는 방법인 EASE(Evidence-Anchored Spatial Attention)를 소개한다.

원저자: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

문제점: "운 좋게 맞춘" 학생

사진이 포함된 어려운 시험을 치르는 한 학생을 상상해 보세요. 선생님(컴퓨터)은 최종 정답만 확인합니다.

  • 질문: "이 사진에 기린이 몇 마리 있습니까?"
  • 학생의 답변: "세 마리입니다."
  • 선생님의 피드백: "정답! +1점."

문제는 선생님이 학생이 어떻게 그 답을 도출했는지 모른다는 점입니다. 학생이 실제로 사진 속의 기린들을 직접 센 것일까요? 아니면 이런 유형의 시험에서 기린이 자주 등장한다는 것을 알고 그냥 찍은 것일까요? 혹은 사진의 전혀 엉뚱한 부분을 보고 있었던 것은 아닐까요?

AI(특히 시각-언어 모델)의 세계에서는 이를 **결과 전용 보상(Outcome-Only Reward)**이라고 부릅니다. AI는 정답을 맞히면 점수를 얻지만, 정답을 맞히기 위해 이미지의 어디를 보아야 하는지는 배우지 못합니다. 이는 AI가 실제 이미지를 보는 대신 텍스트 패턴에 의존하게 만들어, 자신 있게 가짜 사실을 지어내는 "환각(Hallucination)" 현상으로 이어집니다.

해결책: EASE ("스포트라이트" 선생님)

저자들은 EASE(Evidence-Anchored Spatial Attention, 증거 기반 공간 주의 집중)라는 새로운 학습 방법을 개발했습니다.

EASE는 단순히 정답만 채점하는 것이 아니라, 학생이 문제를 풀 때 어디를 보고 있는지까지 지켜보는 선생님이라고 생각하면 됩니다.

  1. "컨닝 페이퍼" (학습 단계에서만 사용): 학습 중에 선생님은 사진의 어느 부분이 정답을 포함하고 있는지 정확히 표시된 특별한 "컨닝 페이퍼"(주석이 달린 박스)를 가지고 있습니다.
    • 예시: 정답이 "기린 세 마리"라면, 컨닝 페이퍼는 각 기린을 둘러싸는 박스를 그립니다.
  2. 스포트라이트: AI는 이미지를 스캔할 때 사용하는 정신적인 "스포트라이트"(주의 집중/Attention)를 가지고 있습니다. EASE는 AI가 이 스포트라이트를 컨닝 페이퍼의 박스 위로 직접 비추도록 가르칩니다.
  3. 황금률: 선생님은 학생이 정답을 맞혔을 때만 이 "여기 봐"라는 조언을 제공합니다.
    • 만약 학생이 틀렸다면, 선생님은 "네가 어디를 보고 있었는지 모르니, 추측하지 말자"라고 말합니다.
    • 만약 학생이 정답을 맞혔고, 동시에 정답이 있는 곳을 제대로 보았다면, 선생님은 "잘했어! 증거를 잘 찾아냈구나. 다음에도 꼭 그곳을 보도록 해"라고 말합니다.

작동 방식 (비유)

들판에서 공을 찾는 강아지를 가르치는 상황을 상상해 보세요.

  • 기존 방식 (표준 강화 학습): 공을 던져줍니다. 강아지는 들판을 뛰어다니고 냄새를 맡다가 결국 공을 찾아냅니다. 그러면 당신은 간식을 줍니다. 강아지는 "이리저리 뛰어다니며 냄새를 맡으면 간식을 얻는다"라고 배웁니다. 강아지는 실제로 공을 찾기 위해 노력한 것이 아니라 운 좋게 찾았을 수도 있습니다.
  • EASE 방식: 당신은 공이 숨겨진 위치를 보여주는 비밀 지도를 가지고 있습니다. 강아지가 공을 찾으면, 당신은 지도를 확인합니다.
    • 만약 강아지가 공이 숨겨진 정확한 지점에서 냄새를 맡고 있었다면, 당신은 특급 간식을 주며 "착하다, 제대로 된 곳을 봤구나!"라고 말합니다.
    • 만약 강아지가 공은 찾았지만 들판의 완전히 다른 곳에서 냄새를 맡고 있었다면, 특급 간식을 주지 않습니다. 당신은 공을 찾는 것만으로는 부족하며, 반드시 제대로 된 곳을 봐야 한다는 것을 가르칩니다.

실험 결과는 어떠했나요?

연구진은 이 방법을 여러 스마트 AI 모델(Qwen2.5 및 Qwen3)에 테스트했습니다. 그들은 이 새로운 방법과 기존의 "운 좋은 추측" 방식을 비교했습니다.

  • 수학 및 논리 능력 향상: AI는 사진이 포함된 수학 문제와 논리 퍼즐에서 성능이 크게 향상되었습니다. AI는 더 이상 찍지 않고 실제로 시각적 단서를 분석하기 시작했습니다.
  • 환각 현상 감소: AI는 가짜 사실을 덜 만들어내게 되었습니다. 자신이 무엇을 볼 수 있고 무엇을 볼 수 없는지에 대해 더 정직해졌습니다.
  • 사용자에게 추가 작업 불필요: 이것은 매우 중요한 포인트입니다. "컨닝 페이퍼"(박스)는 AI가 학습할 때만 사용됩니다. 나중에 여러분이 실제로 AI를 사용할 때는 그냥 사진과 질문만 주면 됩니다. 박스가 없어도 AI는 이미 주의 깊게 보는 법을 배웠기 때문에 훨씬 더 잘 작동합니다.

핵심 요약

EASE는 AI 모델이 정직한 관찰자가 되도록 가르칩니다. 단순히 정답을 암기하는 대신, AI는 정답과 그 정답을 뒷받침하는 구체적인 시각적 증거를 연결하는 법을 배웁니다. 이는 마치 탐정에게 범인을 직감으로 추측하라고 가르치는 것이 아니라, 보고서를 쓰기 전에 반드시 범죄 현장의 단서들을 먼저 살피도록 가르치는 것과 같습니다.

핵심 요점: 학습 과정에서 AI에게 "풀이 과정을 보여줄 것"(즉, 올바른 지점을 볼 것)을 강제함으로써, AI는 나중에 질문에 답할 때 훨씬 더 신뢰할 수 있고 정확해집니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →