← 최신 논문
💬 NLP

Models Know Models Best: Evaluation via Model-Preferred Formats

본 논문은 모델 선호 신호에 대해 학습된 경량 분류기를 활용하여 기호 기반 형식과 클로즈 스타일(cloze-style) 평가 형식 사이를 자동으로 선택함으로써, 성능 불일치를 해결하고 다양한 LLM 벤치마크 전반에서 제로샷 정확도를 크게 향상시키는 동적 포맷 정렬 전략을 제안한다.

원저자: Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

게시일 2026-02-02
📖 3 분 읽기☕ 가벼운 읽기

원저자: Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 얼마나 똑똑한지 증명하기 위해 시험을 치르고 있다고 상상해 보세요. 이제, 이 시험이 두 가지 서로 다른 스타일로 제공된다고 상상해 봅시다:

  1. "객관식(Multiple Choice)" 스타일: 질문을 읽은 다음, 정답과 일치하는 알파벳(A, B, C 또는 D)을 고르면 됩니다.
  2. "빈칸 채우기(Fill-in-the-Blank)" 스타일: 문장이 갑자기 끊기면, 적절한 단어를 사용하여 문장을 완성해야 합니다.

오랫동안 연구자들은 이 두 가지 스타일이 단순히 같은 질문을 던지는 서로 다른 방식일 뿐이라고 생각했습니다. 하지만 **"Models Know Models Best(모델은 모델을 가장 잘 안다)"**라는 제목의 이 논문은 놀라운 사실을 발견했습니다: 거대 언어 모델(LLM)은 두 스타일을 똑같이 좋아하지 않는다는 것입니다. 실제로 당신이 선택한 스타일은 모델을 천재로 만들 수도 있고, 완전히 실패한 것처럼 보이게 할 수도 있으며, 심지어 질문이 완전히 동일하더라도 말입니다.

다음은 저자들이 발견한 내용을 쉬운 비유를 들어 정리한 내용입니다.

1. "적재적소에 맞지 않는 도구" 문제

연구진은 22개의 서로 다른 AI 모델을 8가지 유형의 질문으로 테스트했습니다. 그들은 명확한 패턴을 발견했습니다:

  • "기호(Symbol)" 스타일 (A, B, C, D 고르기): 이 방식은 옵션을 비교해야 하는 질문에 가장 적합합니다. 이것은 마치 식단에 맞는 음식을 리스트에서 골라야 하는 메뉴판과 같습니다. 모델은 선택을 하기 위해 모든 옵션을 나란히 놓고 살펴봐야 합니다.
  • "클로즈(Cloze)" 스타일 (빈칸 채우기): 이 방식은 이야기를 이어가는 것이 필요한 질문에 가장 적합합니다. 이것은 소설 속의 문장을 완성하는 것과 같습니다. 모델은 자연스러운 흐름 속에서 다음에 올 단어를 예측하도록 훈련되어 있습니다.

문제점: 연구진이 "이야기 만들기" 모델에게 문장을 완성하는 문제가 아니라 리스트에서 알파벳을 고르는 "기호" 스타일의 방식을 강요했을 때, 모델의 점수는 폭락했습니다. 그것은 마치 마라톤 선수에게 수학 방정식을 풀라고 요구하는 것과 같았습니다. 그들은 달리기에는 능숙하지만, 테스트 형식이 그들의 강점과 맞지 않았던 것입니다.

2. 인간은 최적의 형식을 추측할 수 없다

저자들은 먼저 인간에게 질문을 보여주고 "이건 이야기 형식이니까 빈칸 채우기 스타일을 쓰자"라고 결정하도록 요청하여 이 문제를 해결하려 했습니다.

결과: 효과가 없었습니다. 인간은 AI가 어떤 형식을 선호할지 추측하는 데 서툴렀습니다. 때때로 인간에게는 이야기처럼 보이는 질문도, AI는 실제로는 객관식 리스트 형식을 더 선호하기도 합니다. 인간의 직관에 의존하는 것은 종종 AI의 성능을 오히려 떨어뜨리는 결과를 초ました.

3. 해결책: "모델에게 무엇을 원하는지 물어보기"

인간이 형식을 제대로 추측할 수 없었기에, 저자들은 모델에게 직접 물어보기로 했습니다.

그들은 작고 가벼운 "교통 경찰(classifier)"을 만들었습니다. 이 교통 경찰는 특정 질문을 보고 AI에게 묻습니다: "내가 이 질문을 객관식 리스트로 주면 너의 확신도는 어느 정도니? 만약 빈칸 채우기 형식으로 준다면 네 확신도는 어떠니?"

AI 자체의 내부 확신 신호를 바탕으로, 교통 경찰는 해당 질문에 어떤 형식을 사용할지 결정합니다.

  • 질문이 옵션 비교에 관한 것이라면: 교통 경찰는 "객관식(Symbol) 형식을 사용하라"고 말합니다.
  • 질문이 문장 완성을 위한 것이라면: 교통 경찰는 "빈칸 채우기(Cloze) 형식을 사용하라"고 말합니다.

4. 결과: 숨겨진 잠재력의 해방

이 "모델 선호(Model-Preferred)" 전략을 사용했을 때, 결과는 극적이었습니다.

  • "이야기" 관련 질문의 경우: AI의 성능이 크게 뛰어올랐습니다. 마치 드디어 러너에게 알맞은 신발을 신겨준 것과 같았습니다.
  • "비교" 관련 질문의 경우: 성능이 높게 유지되거나 약간 향상되었습니다.
  • 핵심 요점: 이 논문은 많은 AI 모델이 우리가 생각했던 것보다 훨씬 더 똑똑하지만, 우리가 종종 잘못된 "자(ruler)"로 그들을 테스트하고 있었다는 것을 보여줍니다. 과제에 맞춰 자를 바꿈으로써, 우리는 그들의 진정한 능력을 볼 수 있습니다.

요약

이 논문은 우리가 단 하나의 테스트 형식을 선택해 모든 것에 적용해서는 안 된다고 주장합니다. 대신, 각 특정 문제에 대해 AI가 어떤 형식을 선호하는지 스스로 말하게 해야 합니다. 이렇게 함으로써 우리는 모델을 방해하는 것이 아니라, 그들이 실제로 얼마나 똑똑한지를 보기 시작합니다.

요약하자면: 이 논문은 질문을 어떻게 던지느냐가 질문 자체만큼이나 중요하다는 것을 증명하며, 올바른 질문 방식을 알아내는 가장 좋은 방법은 모델 자신의 선호도를 경청하는 것이라는 점을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →