← 최신 논문
💬 NLP

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

이 논문은 소규모 다국어 시각-언어 모델의 경우, 테스트 시점의 스케일링 이득이 복잡한 탐색이나 검증 메커니즘보다는 프롬프트 파싱 가능성(parseability)을 보장하고 충분한 디코딩 예산을 확보하는 데 의해 주로 주도되며, 시각적 다지선다 벤치마크에서 최첨단 성능을 달 달성하는 데 있어 근본적인 정책 모델(policy model)이 가장 중요한 요소임을 입증한다.

원저자: Spiros Baxevanakis, Peng-Jian Yang

게시일 2026-07-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Spiros Baxevanakis, Peng-Jian Yang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 그림 속에 숨겨진 단서들을 이용해 복잡한 다국어 퍼즐을 풀어야 한다고 상상해 보세요. 당신에게는 이 퍼즐을 도와줄 작고 똑똑한 로봇 팀(비전-언어 모델, Vision-Language Models)이 있습니다. 오랫동안 사람들은 이 퍼즐을 푸는 비결이 로봇의 사고 과정을 하나하나 확인할 수 있는 초복잡한 기계를 만들거나, 로봇이 완벽해질 때까지 자신의 답변을 계속 다시 쓰게 만드는 것이라고 생각했습니다.

하지만 ImageCLEF 2026 대회를 위해 암스테르담 대학교 연구진이 작성한 이 논문은 이렇게 말합니다: "잠시 진정하세요! 비결은 화려한 기계가 아니라, 그저 로봇이 문장을 끝마칠 수 있도록 더 많은 시간을 주는 것입니다."

핵심 발견: 더 많은 단어, 더 적은 생각

연구진은 이 작은 로봇들이 추론 능력을 실제로 향상시키는 데 무엇이 도움이 되는지 알아보기 위해, 방대한 양의 시험 문제 세트(11개 언어, 20개 과목)를 대상으로 다양한 전략들을 테스트했습니다. 그들은 가장 중요한 것이 탐색 방법이 얼마나 '영리한가'가 아니라, 로봇이 말을 멈추기 전까지 얼마나 '오래' 말할 수 있게 허용하느냐라는 것을 발견했습니다.

학생이 시험을 치는 상황을 생각해 보세요.

  • 기존 방식: 당신은 학생에게 "정말 열심히 생각하고, 검토도 하고, 완벽한 에세이를 써라"라고 말하지만, 정작 글을 쓸 공간은 1,000단어로 제한합니다. 학생은 머릿속으로는 정답을 찾아냈을지 모르지만, 마지막 글자(A, B, C, D 또는 E)를 적기도 전에 공간이 부족해집니다. 추론은 제대로 했지만, 결론을 내지 못해 시험에는 실패하는 것입니다.
  • 새로운 방식: 당신은 학생에게 "네 생각을 쭉 적어 내려가되, 최대 2,048단어까지 사용할 수 있다"라고 말합니다. 갑자기 학생은 이야기를 끝마치고 정답 알파벳을 적을 수 있는 충분한 여유를 갖게 됩니다.

연구진은 이를 정밀하게 측정했습니다. 단어 제한(토큰)을 1,000개에서 2,048개로 두 배 늘렸을 때, 정확도는 3.7 퍼센트 포인트 상승했습니다. 이는 엄청난 승리입니다! 하지만 로봇에게 8개의 사고 사슬(chain of thought) 대신 16개의 서로 다른 사고 사슬을 생성하도록 요청하여 답변 수를 늘렸을 때는, 점수가 고작 0.15 퍼센트 포인트밖에 오르지 않았습니다. 이는 학생에게 이미 단어 수가 부족한 상황에서 똑같은 에세이를 1번 대신 16번 쓰라고 요구하는 것과 같습니다. 단어 제한에 걸려 있다면 큰 도움이 되지 않는 것입니다.

효과가 없었던 것들 ("멋져 보였던" 아이디어들의 실패)

연구진은 이론적으로는 효과가 있을 것 같지만, 데이터상으로는 그렇지 않았던 매우 정교한 기술들을 시도했습니다.

  1. "단계별" 코치: 그들은 특수한 "프로세스 보상 모델(Process Reward Model, PRM)"을 사용하여 코치 역할을 맡기고, 로봇의 추론 매 단계를 체크하며 빔 서치(beam search)처럼 유도하려고 했습니다. 로봇이 자유롭게 추측하게 두는 것보다 이것이 더 나을 것이라 생각했습니다. 결과: 이 방식은 오히려 단순한 방법보다 성능이 0.39 퍼센트 포인트 떨어졌으며, 계산 비용은 8.7배나 더 들었습니다. 코치가 그림을 보고 혼란을 느껴 로봇을 올바른 길로 인도하지 못한 것입니다.
  2. "심판" 로봇: 답변들을 읽고 가장 좋은 것을 골라내는 두 번째 로봇(심판)을 추가하는 실험을 했습니다. 비평가로 훈련된 모델과 똑똑한 생성 모델 두 가지 유형을 시도했습니다. 결과: 둘 다 단순히 "다수결(가장 많이 나온 답을 선택)"을 따르는 단순한 방법을 이기지 못했습니다. 사실, 더 똑똑한 로봇을 사용했을 때 심판들은 상황을 오히려 약간 악화시켰습니다. 논문은 답변들이 서로 비슷할 때 심판들이 정답과 오답을 구별하지 못했기 때문이라고 설명합니다.
  3. 자기 수정(Self-Correction): 로봇이 자신의 실수를 스스로 고치게 하는 것이 도움이 되는지 살펴보았습니다. 결과: 아니었습니다. 이 규모에서는 로봇이 자신의 답변을 다시 쓰는 것이 오히려 성능을 떨어뜨리는 경우가 많았습니다.

진짜 주인공: 로봇 그 자체

가장 큰 도약은 새로운 전략에서 온 것이 아니라, 로봇을 교체하는 것에서 왔습니다. 이전 모델(Qwen2.5-VL-7B)에서 더 새롭고 작은 모델(Qwen3.5-4B)로 바꿨을 때, 점수는 11.4 퍼센트 포인트나 뛰었습니다. 이는 더 똑똑한 "두뇌"(정책 모델)를 갖는 것이 화려한 "사고 과정"(탐색 방법)을 갖는 것보다 훨씬 더 중요하다는 것을 시사합니다.

"수정하기" 기술

한 가지 작은 결함이 있었습니다. 때때로 충분한 단어 수가 주어졌음에도 불구하고, 로봇이 훌륭한 설명을 써놓고 정작 마지막 알파벳(A, B, C 등)을 쓰는 것을 잊어버리는 일이 발생했습니다. 연구진은 간단한 "가이드 수정(guided repair)" 기술을 찾아냈습니다. 만약 로봇이 알파벳을 쓰지 않았다면, 단 한 개의 토큰만으로 "Answer: [A/B/C/D/E]"라고 말하도록 강제하는 것입니다. 이 방법은 실패했던 나머지 **2.67%**의 질문들을 해결하여 격차를 메워주었습니다.

최종 점수

새로운 로봇(Qwen3.5-4B)을 사용하고, 넉넉한 단어 제한(2,048 토큰)을 부여하며, 16번의 시도를 요청하고, 간단한 "수정하기" 기술을 결합함으로써, 팀은 최종 테스트에서 **84.1%**의 정확도에 도달했습니다. 이로써 그들은 리더보드에서 1위를 차지했습니다.

요점

여기서 얻을 수 있는 주요 교훈은, 작은 비전-언어 모델의 경우 복잡한 알고리즘보다 엔지니어링의 세부 사항이 더 중요하다는 것입니다. 모델에게 생각을 마칠 수 있는 충분한 공간(토큰 예산)을 주고, 답변을 확정하도록 강제하는 프롬프트를 제공하는 것이, 복잡한 탐색 트리나 심판을 동원해 모델을 이기려고 애쓰는 것보다 더 나은 결과를 가져옵니다. 이 논문은 우리가 더 나은 모델을 갖게 되기 전까지는, 복잡한 탐색 구조로 모델을 통제하려 하기보다 단순히 모델이 더 오래 말하게 하고 형식을 바로잡아 주는 것이 최선의 전략이라고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →