← 최신 논문
💻 computer science

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

본 논문은 시각-언어 모델이 지각보다 추론을 더 크게 향상시키는 사후 훈련 병목 현상을 식별하고 해결하기 위해, 지도 미세 조정과 강화 학습에서 이러한 비대칭성의 뚜렷한 원인을 드러내는 진단 프레임워크를 도입하고, 동적 손실 재가중치 및 지각 인식 보상과 같은 표적 개입을 제안하여 엔드투엔드 성능을 크게 향상시킵니다.

원저자: Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

게시일 2026-05-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.

큰 그림: "똑똑하지만 눈이 먼" 학생

어떤 매우 어려운 시험을 치르는 천재 학생을 상상해 보세요. 이 시험은 그림을 보고 그 그림에 기반한 논리 퍼즐을 푸는 것을 포함합니다.

최근 교사들 (연구자들) 은 이러한 학생들이 추론 (논리 퍼즐 풀기) 에 더 능숙해지도록 특별한 훈련 방법을 사용해 왔습니다. 그 결과 학생들은 수학 및 논리 부분에서 놀라울 정도로 똑똑해졌습니다.

그러나 이 논문은 기이한 문제를 발견했습니다. 학생들은 생각하는 능력은 향상되고 있지만, 보는 능력은 전혀 나아지지 않았다는 것입니다. 오히려 그들은 그림을 착각하거나 오해하기 시작했습니다. 마치 범죄 해결에 천재적인 형사가 사진 속 용의자를 계속 잘못 지목하는 것과 같습니다.

저자들은 이를 "비대칭 최적화 (Asymmetric Optimization)" 라고 부릅니다. 훈련이 뇌의 "생각" 부분을 지나치게 강조하는 반면, "보기" 부분은 소홀히 하고 있기 때문입니다.


실험: 통제된 교실

이 현상이 왜 발생하는지 파악하기 위해 연구자들은 실제 세계의 사진 (잡음이 많고 완벽하게 채점하기 어려운) 을 사용할 수 없었습니다. 대신 두 가지 특정 게임이 포함된 디지털 샌드박스를 구축했습니다:

  1. 그래프 색칠하기: 점과 선으로 연결된 웹 형태의 그림입니다. 연결된 두 점이 같은 색을 갖지 않도록 점들을 색칠하는 것이 과제입니다.
  2. 스도쿠: 올바르게 채워야 하는 숫자 격자 그림입니다.

이것들은 컴퓨터로 생성되었기 때문에 연구자들은 그림이 어떻게 보여야 하는지 (지각) 와 이를 해결하는 정확한 논리 (추론) 에 대한 정확한 정답을 알고 있었습니다. 이를 통해 두 가지 기술을 분리하고 학생이 정확히 어디서 실패하는지 확인할 수 있었습니다.

연구자들은 두 가지 유형의 훈련을 테스트했습니다:

  • SFT (지도 미세 조정): 교사가 학생에게 정답 키를 보여주고 "이를 암기하라"고 말하는 것과 같습니다.
  • RL (강화 학습): 학생이 최종 점수를 맞출 때만 점수를 얻는 비디오 게임과 같습니다. 교사는 그들이 어떻게 틀렸는지 알려주지 않습니다.

발견: 두 가지 다른 범인

연구자들은 두 훈련 방법 모두 "보기" 문제를 유발했지만, 그 이유는 서로 달랐습니다.

1. SFT 문제: "양"의 문제

비유: 학생이 긴 에세이를 쓴다고 상상해 보세요. 교사는 단어의 총 수를 기준으로 에세이를 채점합니다.

  • 학생은 에세이의 95% 를 논리 설명 (추론) 에 할애합니다.
  • 학생은 에세이의 5% 만 그림 설명 (지각) 에 할애합니다.

발생한 일: "지각" 부분이 너무 짧기 때문에 교사의 피드백 (훈련 신호) 이 그 부분에 대해 매우 약했습니다. 학생은 95% 의 관심을 받은 논리는 완벽하게 배웠지만, 5% 의 관심만 받은 그림 설명은 거의 배우지 못했습니다.

해결책: 연구자들은 손실 재가중 (Loss Reweighting) 을 시도했습니다. 이는 교사에게 "설명 부분이 짧더라도 에세이의 50% 로 채점하라"고 말하는 것과 같습니다.

  • 결과: 모델이 "보기" 부분에 더 많은 주의를 기울이도록 강요했을 때, 학생은 보기와 퍼즐 해결 모두에서 훨씬 더 나아졌습니다. 전체 점수가 최대 18.2 점까지 상승했습니다.

2. RL 문제: "노이즈가 많은 보상" 문제

비유: 학생이 비디오 게임을 한다고 상상해 보세요. 그들은 매우 마지막에야 "게임 오버" 또는 "승리" 화면을 받습니다. 특정 행동에 대한 점수는 받지 못합니다.

  • 학생이 그림을 잘못 추측했더라도 운 좋게 퍼즐을 해결하면 여전히 "승리" 화면을 받습니다.
  • 학생이 그림을 완벽하게 보더라도 사소한 논리 실수를 하면 "게임 오버"를 맞습니다.

발생한 일: "승리" 신호 (보상) 는 논리 (추론) 와는 강하게 연결되었지만 그림 설명 (지각) 과는 매우 약하게 연결되었습니다. 모델은 다음과 같이 학습했습니다: "그림을 완벽하게 보는 것은 필요하지 않다. 논리를 잘 추측하기만 하면 된다." "보기"에 대한 신호는 학습하기에는 너무 노이즈가 많았습니다.

해결책: 연구자들은 보상 증강 (Reward Augmentation) 을 시도했습니다. 최종 논리가 틀리더라도 그림을 올바르게 설명한 경우에만 특정 "보너스 점수"를 추가했습니다.

  • 결과: 이는 모델이 시력을 향상시키기 위한 명확한 신호를 제공했습니다. 전체 점수가 최대 6.0 점 향상되었습니다.
  • 추가 발견: 완벽한 "보너스 점수 (정답)"가 없다면, 더 똑똑한 AI 에게 그림 설명을 채점하도록 요청하는 것과 같은 "대리" 보상을 사용할 수도 있다는 것을 발견했습니다. 보상 추정이 비록 거칠더라도 점수를 3.2 점 향상시키는 데 도움이 되었습니다.

트레이드오프: 저울의 균형

이 논문은 미묘한 균형도 발견했습니다.

  • 모델이 너무 많이 보기에 집중하게 하면, 생각하는 능력이 떨어집니다.
  • 모델이 너무 많이 생각하는 것에 집중하게 하면, 보는 능력이 떨어집니다.

적절한 균형점은 "보기" 부분을 적당히 상향 조정함으로써 발견되었습니다. 논리를 무시해서는 안 되지만, 시각 부분을 사후 고려로 남겨둘 수도 없습니다.

핵심 요약

  1. 문제: 현재의 AI 훈련은 모델이 추론에는 뛰어나지만 지각에는 약하게 만들어, 모델이 입력을 올바르게 "볼" 수 없어 문제를 해결하지 못하는 병목 현상을 만듭니다.
  2. 원인 (SFT): 답변의 "보기" 부분이 너무 짧아 표준 훈련 중 무시됩니다. 해결책: 채점 시 더 많은 가중치를 부여합니다.
  3. 원인 (RL): 최종 점수는 모델이 그림을 올바르게 보았는지 여부가 아니라 최종 답변이 맞았는지만 알려줍니다. 해결책: 그림을 올바르게 보는 것에 대한 구체적인 보상을 추가합니다.
  4. 결과: 이러한 특정 불균형을 수정함으로써 모델은 전체 작업 (엔드 투 엔드 성능) 에서 훨씬 더 나아졌으며, 단순히 "생각"을 위해 훈련한다고 해서 "보기"가 자동으로 향상되지 않는다는 것이 입증되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →