← 최신 논문
💻 computer science

Are You Sure You're Sure? On the Impact of Instruction Tuning on Confidence and Lexical Diversity

이 논문은 지시어 튜닝(instruction tuning)이 언어 모델에 미치는 영향을 조사하며, 지시어 튜닝이 언어화된 확신도를 일관되게 높이고 근거 다양성(cross-rationale diversity)을 감소시키는 반면, 표면적 어휘 다양성에는 가변적인 효과를 미치고 예측 정확도를 크게 변화시키지 않으면서도 가능도 기반 보정(likelihood-based calibration)을 저하시킨다는 점을 밝혀냈다.

원저자: Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

게시일 2026-08-14
📖 5 분 읽기🧠 심층 분석

원저자: Irina Proskurina, Mayank Kumar, Oyindolapo O. Komolafe

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 똑똑하고 박학다식한 로봇과 대화하고 있다고 상상해 보세요. 당신이 질문을 던지면, 로봇은 자신감 넘치는 목소리로 자신이 왜 옳다고 생각하는지 정확하게 설명합니다. 하지만 여기에는 함정이 있습니다. 때때로 그 로봇은 그저 확신하는 척을 하고 있을 뿐입니다. 교수님처럼 들릴지 모르지만, 실제로는 엉뚱한 추측을 하고 있는 것이죠. 이것은 인공지능(AI), 구체적으로는 이야기를 쓰고, 수학 문제를 풀고, 상식을 답하는 초지능형 컴퓨터인 '대규모 언어 모델(LLM)'의 세계에서 매우 중요한 문제입니다.

이 논문을 이해하려면 두 가지를 알아야 합니다. 첫째, **인스트럭션 튜닝(Instruction Tuning)**입니다. 가공되지 않은 AI 모델을 수만 가지 사실은 알고 있지만 선생님의 규칙을 따르는 법은 모르는, 천재적이지만 무질서한 학생이라고 생각해 보세요. "인스트럭션 튜닝"은 그 학생을 특수 훈련 캠프에 보내 프롬프트(지시어)를 듣고, 지시를 따르며, 특정 형식에 맞춰 질문에 답하는 법을 배우게 하는 것과 같습니다. 이는 보통 우리가 원하는 대로 모델이 작동하도록 훨씬 더 잘 만들어줍니다. 둘째, **신뢰도와 다양성(Confidence and Diversity)**입니다. AI가 답변할 때, 모델은 자신이 얼마나 확신하는지(신뢰도)를 말할 수 있습니다. 또한 모델은 자신의 사고 과정을 설명하는 '근거(rationales)'를 생성합니다. "어휘적 다양성(Lexical diversity)"은 단순히 모델이 얼마나 다양한 단어와 문장 구조를 사용하는지를 뜻하는 세련된 표현입니다. 만약 AI가 정말로 깊이 고민하고 있다면, 답변을 설명하기 위해 다양한 방식을 시도할 것입니다. 반대로 그저 정해진 대본을 읊고 있는 것이라면, 매번 똑같은 소리를 할 것입니다.

왜 이것이 중요할까요? 현실 세계에서—예를 들어 로봇 의사가 환자를 진단하거나 로봇 변호사가 계약서를 검토할 때—우리는 로봇이 실제로 옳은 것인지, 아니면 그저 자신감 있게 들리는 것뿐인지 알아야 하기 때문입니다. 만약 로봇이 실제로 더 똑똑해지지 않으면서 목소리만 커지고 반복적이라면, 그것은 위험한 함정이 될 수 있습니다.


"과잉 확신을 가진 학생" 실험

이 연구에서 연구자들은 탐정 놀이를 하기로 했습니다. 그들은 AI 학생들이 "인스트럭션 튜닝" 훈련 캠프를 마친 후 어떤 변화가 일어나는지 보고 싶었습니다. 구체적으로 다음과 같은 질문을 던졌습니다. 로봇이 실제로 더 많이 배웠기 때문에 더 자신감이 생긴 것인가, 아니면 그저 설명 방식이 지루하고 반복적으로 변하면서 더 자신감 있게 행동하는 척하는 것인가?

연구진은 세 가지 서로 다른 AI 모델 제품군(Qwen, Mistral, Llama라는 서로 다른 학교라고 생각하세요)을 가져와 "전"과 "후"의 버전을 비교했습니다. 그리고 과학 시험, 일반 상식 퀴즈, 논리 퍼즐 등 수천 개의 질문을 던졌습니다.

그 결과는 다음과 같았으며, 약간의 반전이 있었습니다.

1. 로봇은 똑똑해지는 대신 목소리만 커졌다
인스트럭션 튜닝 후에 로봇들은 눈에 띄게 더 자신감이 생겼습니다. 그들은 더 이상 확답을 피하지 않았습니다. 만약 당신이 "얼마나 확신하나요?"라고 물으면, 그들은 "글쎄요, 50% 정도요"라고 하는 대신 "90% 확신합니다!"라고 답했습니다.

  • 함정: 이 자신감은 항상 실제 정확도와 일치하지는 않았습니다. 예를 들어, 한 테스트(ARC-Easy)에서 Llama 모델의 자신감은 약 49%에서 90%로 급증했지만, 실제 테스트 점수는 82.2%로 정확히 그대로였습니다. 이는 마치 학생이 실제 시험 점수는 오르지 않았음에도 불구하고, 손을 번쩍 들며 "저 이거 알아요!"라고 100% 확신하며 외치는 것과 같았습니다. 연구진은 이러한 "언어적 과잉 확신(verbalized overconfidence)"이 테스트한 모든 모델에서 일관되게 나타난다는 것을 발견했습니다.

2. "대본화된" 설명
연구진은 그다음 로봇이 작성한 설명(근거)을 살펴보았습니다. 그들은 두 가지를 측정했습니다.

  • 교차 근거 다양성(Cross-rationale diversity): 똑같은 질문을 다섯 번 했을 때, 로봇이 다섯 가지 서로 다른 설명을 내놓는가, 아니면 똑같은 것을 복사해서 붙여넣는가?
  • 표면적 다양성(Surface-level diversity): 단일 설명 내에서 얼마나 많은 고유한 단어와 단어 쌍을 사용하는가?

결과는 엇갈렸지만 시사하는 바가 컸습니다. 로봇들은 답변을 설명할 때 훨uh 더 반복적이 되었습니다. 똑같은 질문을 다섯 번 던졌을 때, 인스트럭션 튜닝된 모델들은 매우 유사한 설명을 내놓은 반면, "가공되지 않은(raw)" 모델들은 더 다양했습니다. 마치 훈련 캠프가 그들에게 하나의 안전한 대본을 고수하도록 가르친 것과 같습니다.

  • 그러나 "표면적" 다양성(사용된 고유 단어 수)은 다소 혼란스러웠습니다. 때로는 로봇이 더 많은 고로 된 단어를 사용하기도 하고, 때로는 더 적게 사용하기도 했습니다. 이는 어떤 로봇을 쓰는지, 어떤 테스트를 하는지에 따라 달랐습니다. 단 하나의 규칙은 없었습니다.

3. 불일치
가장 중요한 발견은 이 두 가지 변화—더 자신감 있어지는 것과 더 반복적이 되는 것—가 깔끔하게 한 묶음으로 일어나지 않는다는 점입니다.

  • 어떤 경우에는 로봇이 불확실성을 줄였지만(더 자신감 있어졌지만), 동시에 설명의 다양성도 줄어들었습니다.
  • 또 어떤 경우에는 불확실성을 줄였지만, 단어 선택의 다양성은 늘어났습니다.
  • 연구진은 로봇이 사용하는 단어의 다양성만 보고 그 자신감을 예측할 수 없다는 것을 발견했습니다. 두 요소는 서로 다른 리듬에 맞춰 춤을 추고 있었습니다.

4. 길이에 관한 문제가 아니다
당신은 "혹-시 로봇이 더 긴 설명을 쓰기 시작해서 더 자신감이 생긴 것 아닐까?"라고 생각할 수도 있습니다. 연구진은 이를 확인했습니다. 그들은 로봇에게 정확히 같은 길이의 설명을 쓰도록 강제했고, 동일한 답을 선택한 경우만 관찰했습니다. 그럼에도 불구하고 패턴은 유지되었습니다. 인스트럭션 튜닝된 모델들은 여전히 더 자신감이 넘쳤고, 설명 방식은 여전히 더 반복적이었습니다. 이 변화는 단순히 글을 더 길거나 짧게 쓰는 것에 따른 부작용이 아니라, 모델의 행동 방식 자체가 근본적으로 변한 것이었습니다.

결론

이 논문은 인스트럭션 튜닝이 AI 모델을 하나의 안전한 설명 방식을 암기한 채 과잉 확신에 빠진 학생처럼 만든다고 결론짓습니다. 그들은 더 확신에 차 보이지만, 반드시 더 많이 아는 것은 아니며, 사물을 다양한 방식으로 설명하려는 노력을 멈춥니다.

연구진은 이것이 경고 신호라고 제안합니다. 만약 우리가 AI의 자신감을 보고 그것이 맞는지 판단하려 한다면, 속아 넘어갈 수 있습니다. 로봇은 실제로는 똑같은 옛날 대본을 반복하고 있으면서도 "확신합니다!"라고 외치고 있을지도 모릅니다. 또한 로봇의 자신감이 실제 정확도와 항상 일치하는 것은 아니며, 설명의 다양성이 줄어드는 현상은 로봇이 실수를 저지를 때 이를 알아차리기 더 어렵게 만들 수 있습니다.

요약하자면: 훈련 후에 로봇이 더 확신에 찬 목소리를 낸다고 해서 반드시 더 똑똑해졌다는 뜻은 아닙니다. 그저 자신이 무엇을 하고 있는지 잘 아는 것처럼 보이도록 연기하는 법을 더 잘 익혔을 뿐, 여전히 똑같은 대사를 반복하고 있을 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →