← 최신 논문
💬 NLP

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

이 논문은 AI 안전 분야에서 영감을 얻은 '출력 프리필링 (Output Prefilling)' 기법을 도입하여, 다중 선택형 질문 답변 (MCQA) 평가에서 기존 첫 토큰 확률 방식의 신뢰성 문제를 해결하고 정확도와 일관성을 크게 향상시키는 효율적인 방법을 제안합니다.

원저자: Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

게시일 2026-04-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎯 핵심 주제: "정답을 말하기 전에, 왜 헛소리를 할까?"

우리가 시험지를 풀 때, 문제를 보고 바로 A, B, C, D 중 하나를 찍는다고 상상해 보세요.
하지만 AI(대형 언어 모델) 는 사람과 조금 다릅니다. AI 는 보통 **"생각하는 과정"**을 먼저 말하고 싶어 합니다.

예를 들어, "프랑스의 수도는 어디인가요?"라고 물으면, AI 는 바로 "C"라고 답하기보다, **"제 생각에는 C 가 맞는 것 같습니다"**라고 긴 문장을 시작합니다.

이때 우리가 AI 의 능력을 평가하는 방식인 **'첫 번째 토큰 확률 (FTP)'**은 AI 가 가장 먼저 내뱉은 단어만 보고 정답을 판단합니다.

  • AI 가 "제 생각에는..."이라고 시작하면, 첫 단어는 '제'가 됩니다.
  • 하지만 정답은 'C'여야 하죠.
  • 결과적으로 AI 가 정답을 알고 있어도, 첫 단어가 틀려서 '오답'으로 처리되는 안타까운 상황이 발생합니다.

이를 논문에서는 **"미스얼라인먼트 (Misalignment, 정렬 불일치)"**와 **"미스인터프리테이션 (Misinterpretation, 오해)"**이라고 부릅니다.


💡 해결책: "출발선에서부터 정답을 말하게 하기 (Output Prefilling)"

연구팀이 제안한 해결책은 매우 간단하지만 효과적입니다. 바로 **"출발선에서부터 정답을 말하게 유도하는 것"**입니다.

비유: "선생님의 지시"

  • 기존 방식: 학생 (AI) 에게 "문제 풀어서 답해줘"라고만 말합니다. 학생은 "네, 알겠습니다. 생각해보면..."이라고 말하며 시작하다가 정답을 잊어버리거나 헷갈릴 수 있습니다.
  • 새로운 방식 (Output Prefilling): 학생에게 **"정답은 다음과 같습니다:"**라고 미리 말해주고 시작하게 합니다.
    • AI 는 이미 "정답은 다음과 같습니다:"라는 문장이 입력된 채로 시작합니다.
    • AI 는 자연스럽게 그 다음에 **정답 (A, B, C, D)**을 말해야만 문장이 완성됩니다.

이 방법은 AI 의 두뇌 (모델 파라미터) 를 수정하거나 재학습시킬 필요 없이, 단순히 말투를 바꿔주는 것만으로 효과를 봅니다. 마치 AI 가 "아, 내가 지금부터 정답만 말해야 하는구나!"라고 깨닫게 만드는 거죠.


🚀 이 방법의 놀라운 효과

논문의 실험 결과를 요약하면 다음과 같습니다.

  1. 정답률 대폭 상승:

    • 여러 AI 모델 (Llama, Gemma, Mistral 등) 에서 이 방법을 쓰니 정답률이 크게 올랐습니다.
    • 특히 Gemma-2-9B라는 모델은 정답률이 무려 25.9% 포인트나 올랐습니다! (예: 50 점대에서 76 점대로 급상승)
    • 마치 시험을 볼 때 "정답만 써라"라고 지시한 덕분에, 학생들이 헷갈려서 실수하던 부분을 줄인 것과 같습니다.
  2. 비용은 0 원, 효율은 최고:

    • 보통 AI 가 긴 글을 써서 정답을 찾게 하려면, 그 글을 다시 분석하는 별도의 AI 가 필요합니다. (시간과 돈이 많이 듦)
    • 하지만 이 방법은 단순히 문장 앞부분을 바꿔주는 것뿐이라, 계산 비용이 거의 들지 않습니다.
  3. 신뢰도 향상:

    • AI 가 "정답은 C 입니다"라고 확신 있게 말할 때, 그 확신 (확률) 이 실제 정답과 더 잘 맞았습니다. 즉, AI 가 "내가 80% 확신해"라고 할 때, 실제로 80% 정도 맞을 가능성이 높아진 것입니다.

📝 한 줄 요약

"AI 가 객관식 문제를 풀 때, '생각하는 척'하는 긴 말투를 버리고, '정답은:'이라고 미리 말하게 유도하면, 훨씬 더 정확하고 빠르게 정답을 맞힐 수 있다."

이 연구는 AI 를 평가할 때, 단순히 "첫 단어가 정답인가?"만 보는 것이 아니라, AI 가 정답을 말하기 직전의 문맥을 조금만 바꿔주면 (Output Prefilling), 훨씬 더 신뢰할 수 있는 결과를 얻을 수 있다는 것을 증명했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →