← 최신 논문
💻 computer science

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

이 논문은 하이브리드 사고형 MLLM의 사고 모드와 비사고 모드 간의 응답 패턴에서 나타나는 체계적인 불일치를 드러내는 진단 벤치마크인 PatternEval을 소개하고, 작업 성능을 유지하면서 이러한 행동들을 정렬하기 위해 패턴 특화 페널티를 사용하는 강화 학습 프레임워크인 PatternRL을 제안한다.

원저자: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Ya
게시일 2026-08-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 사진을 보고, 차트를 읽고, 까다로운 퍼즐을 풀 수 있는 아주 똑똑한 로봇 친구와 대화하고 있다고 상상해 보세요. 때때로 당신은 로봇에게 문제를 단계별로 해결하며 충분히 시간을 가질 수 있도록 "깊이 생각하라"고 요청합니다. 또 다른 때에는 빠른 답변을 원하기 때문에, 긴 사고 과정 없이 "그냥 추측해 봐"라거나 직접적인 답변을 내놓으라고 말하기도 합니다. 이것이 바로 텍스트와 이미지를 모두 이해할 수 있는 AI 시스템인 **멀티모달 거대 언어 모델(MLLMs)**의 세계입니다. 과학자들이 던지는 핵심 질문은 단순히 "정답이 맞는가?"가 아니라, "로봇이 깊이 생각할 때와 그냥 추측할 때 똑같이 행동하는가?"입니다. 만약 로봇이 깊이 생각한 후에는 완벽한 답을 내놓지만, 빠른 답변을 요구했을 때 자신의 속마음을 흘리거나, 말을 반복하거나, 스스로 모순된 말을 한다면 그것은 문제입니다. 우리는 AI가 고민할 시간을 얼마나 주느냐에 상관없이 신뢰할 수 있고 예의 바르기를 원합니다.

**"Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs"**라는 제목의 이 논문은 바로 그 문제를 깊이 파고듭니다. 연구진은 가장 똑똑한 AI 모델들조차 기묘한 "분열된 인격"을 가지고 있다는 사실을 발견했습니다. 천천히 생각하도록 허용되면 이들은 차분하고 전문적인 전문가처럼 행동합니다. 하지만 빠르고 생각하지 않는 방식으로 강요받으면, 이들은 종종 엉망으로 행동하기 시작합니다. 최종 답변에 내부적인 "사고 과정"을 실수로 흘리거나, 같은 문장을 계속 반복하거나, 동시에 두 가지 상반된 말을 하거나, 실제로 아무런 작업도 하지 않으면서 추론하는 척을 하곤 합니다.

이를 증명하기 위해 연구팀은 이러한 엉망인 행동들을 잡아내기 위해 특별히 설계된 "함정" 시험인 PatternEval을 만들었습니다. 그들은 25개의 서로 다른 AI 모델(Qwen, Kimi, Claude와 같은 유명 모델 포함)을 2,415개의 까다로운 이미지 및 텍스트 퍼즐로 테스트했습니다. 결과는 놀라웠습니다. 가장 진보된 모델들조차 "사고 모드"와 "비사고 모드" 사이에 거대한 격차를 보였습니다. 실제로 많은 모델에서, 빠르고 생각하지 않는 모드는 기본적인 대화 규칙을 지키지 못하는 경우가 거의 **48%**에 달했던 반면, 느리게 생각하는 모드는 훨씬 깔끔했습니다.

이를 해결하기 위해 저자들은 PatternRL이라는 새로운 학습 방법을 만들었습니다. 이것은 학생에게 수학 문제를 맞히는 법뿐만 아니라, 낙서를 하거나 반복하지 않고 깔끔하게 글을 쓰는 법을 가르치는 것과 같습니다. 그들은 네 가지 특정한 나쁜 습관을 포착하도록 "판사" AI(PatternRM)를 훈련시켰습니다:

  1. 사고의 사슬 유출(Chain-of-thought leakage): 비밀스러운 "사고" 단계를 최종 답변에 흘리는 것.
  2. 응답 반복(Response repetition): 이유 없이 같은 말을 두 번 하는 것.
  3. 논리적 모순(Logical contradiction): 동일한 것에 대해 동시에 "예"와 "아니오"라고 말하는 것.
  4. 수행적 추론(Performative reasoning): 실제 근거를 전혀 사용하지 않으면서 추론하는 척하는 것.

이 새로운 학습법을 두 가지 특정 모델(Qwen3-VL-4B 및 Qwen3-VL-8B)에 적용했을 때, 빠른 모드에서의 엉망인 행동들이 정답을 맞히는 능력을 해치지 않으면서도 약 13~14 퍼센트 포인트 정도 크게 감소했습니다. 그러나 연구진은 작은 트레이드오프(절충점)도 언급했습니다. 모델들이 매우 어려운 수학 및 논리 과제에서 약간 덜 정확해졌는데, 이는 "깔끔하게" 행동하도록 강요하는 것이 때로는 창의적이지만 (다소 엉망일 수 있는) 문제 해결 방식을 탐구하는 것을 막을 수 있음을 시사합니다.

요약하자면, 이 논문은 AI가 문제를 풀 수 있다고 해서 반드시 인간과 대화할 준비가 된 것은 아니라는 점을 시사합니다. 진정으로 도움이 되기 위해서, AI는 무엇을 말할 것인가뿐만 아니라 어떻게 말할 것인가에 대해서도 훈련받아야 하며, 긴 시간을 들여 생각하든 빠른 답변을 주든 일관되고 예의 바른 태도를 유지해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →