← 최신 논문
💬 NLP

Rewarding Intellectual Humility Learning When Not To Answer In Large Language Models

이 논문은 모델이 불확실한 질문에 대해 답변을 자제하도록 명시적으로 유도하는 검증 가능한 보상을 통한 강화 학습(RLVR)이, 사실적 벤치마크에서의 정확도를 크게 저하시키지 않으면서도 대규모 언어 모델의 환각 현상을 효과적으로 줄이고 지적 겸손을 향상시킨다는 것을 입증한다.

원저자: Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj Gehlot

게시일 2026-01-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Abha Jha, Akanksha Mahajan, Ashwath Vaithinathan Aravindan, Praveen Saravanan, Sai Sailaja Policharla, Sonal Chaturbhuj Gehlot

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신은 질문에 답하기 위해 매우 똑똑하고 박학다식한 비서를 고용한다고 상상해 보세요. 문제는 이 비서가 약간 '잘난 척하는' 성격이라는 점입니다. 심지어 실제로 답을 모를 때조차도, 그들은 어떻게든 추측해서라도 답을 내놓아야 한다는 강박을 느낍니다. 종종 그럴싸하게 들리지만 완전히 틀린 사실들을 지어내곤 하죠. AI의 세계에서는 이를 '환각(hallucination)'이라고 부릅니다.

이 논문은 이러한 AI 비서들에게 매우 중요한 기술, 즉 "모른다"라고 말할 줄 아는 법을 가르치는 방법에 관한 것입니다.

다음은 이들의 접근 방식을 쉬운 비유를 사용하여 정리한 내용입니다.

문제점: 과도하게 자신만만한 추측 기계

현재의 대규모 언어 모델(LLM)은 항상 답을 내놓도록 훈련되어 있습니다. 질문을 던지면, 설령 추측일 뿐이라도 어떻게든 무언가를 생성하려고 시도합니다. 이는 마치 점수를 얻기 위해 빈칸으로 남겨두는 것을 두려워하여 아무 답이나 적어 넣는 학생과 같습니다. 이는 자신감 넘치지만 틀린 정보를 제공하는 결과로 이어집니다.

해결책: "정직 보상" 시스템

연구진은 **검증 가능한 보상을 통한 강화 학습(RLVR)**이라는 새로운 훈련 방법을 시도했습니다. 이것을 AI를 위한 새로운 채점 방식이라고 생각하면 됩니다.

단순히 정답에만 점수를 주는 대신, 그들은 세 가지 방식의 채점 시스템을 도입했습니다:

  1. 정답: +1점 (잘했어요!)
  2. 오답: -1점 (잘못된 추측입니다, 점수가 깎입니다.)
  3. "모릅니다": 특별 보상 (예를 들어 +0.3점)

목표는 AI에게 틀린 답을 자신 있게 내놓는 것보다, 정직하게 "모른다"라고 말하는 것이 더 낫다는 것을 가르치는 것이었습니다. 연구진은 '골디락스(Goldilocks)' 보상, 즉 너무 높지도 않고(너무 높으면 AI가 모든 것에 "모른다"라고만 답하며 노력을 멈출 것입니다) 너무 낮지도 않은(너무 낮으면 계속해서 추측을 할 것입니다) 적절한 지점을 찾고자 했습니다.

실험: 새로운 규칙 테스트하기

그들은 두 가지 유형의 "학생"(AI 모델)을 대상으로 테스트를 진행했습니다:

  • Granite-3.3-2B: 더 작고 압축된 형태의 모델.
  • Qwen-3-4B: 더 크고 강력한 모델.

또한 두 가지 유형의 "시험"을 치르게 했습니다:

  1. MedMCQA: 객관식 의학 질문 (정해진 선택지가 있는 상식 퀴즈와 같은 형태).
  2. Hendrycks Math: 긴 풀이 과정을 써 내려가야 하는 어려운 수학 문제 (에세이나 증명과 같은 형태).

연구 결과

1. 객관식 문제에서는 "적정 지점"이 효과가 있었다
객관식 의학 질문에서, 연구진은 "모른다"라는 답변에 대한 보상의 '적정 지점'을 찾아냈습니다.

  • "모른다"라고 말했을 때 아주 작은 보상을 주자, AI는 불확실성을 인정하기 시작했습니다.
  • 결과: 가짜로 지어낸 답변의 수가 크게 줄어들었습니다. AI는 더 겸손해졌습니다.
  • 트레이드오프(Trade-off): AI가 추측을 멈추면서 전체적인 '정답률'은 약간 낮아졌습니다. 하지만 연구진은 적절한 보상(약 0.3점)을 주면, 좋은 답을 놓치지 않으면서도 나쁜 추측을 줄일 수 있다는 것을 발견했습니다.
  • 대형 모델의 이점: 더 큰 모델(Qwen)이 작은 모델보다 이 "정직함 훈련"을 더 잘 수행했습니다. Qwen은 전체적인 지적 능력을 크게 잃지 않으면서도 필요할 때 "모른다"라고 말할 수 있었습니다.

2. 주관식 질문에서의 어려움
AI가 긴 답안을 작성해야 하는 어려운 수학 문제를 테스트했을 때는, 이 방법이 단독으로는 잘 작동하지 않았습니다.

  • 문제점: AI는 추측하는 데 너무 익end되어 있어서, "모른다"라는 옵션을 선택하는 것을 두려워했습니다. 이는 마치 틀리는 것이 너무 두려운 나머지 빈칸으로 남겨두는 것조차 고려하지 않는 학생과 같았습니다. AI는 훈련 과정에서 "모른다"라고 말하는 옵션을 충분히 '탐색'하지 못했습니다.
  • 해결책: 연구진은 2단계 과정을 시도했습니다. 먼저, 특정 질문 세트에 대해 AI가 "모른다"라고 말하는 연습을 강제로 시켰습니다(지도 미세 조정, Supervised Fine-Tuning). 그 다음, 보상 시스템을 적용했습니다. 이 방법은 AI가 답변을 유보하는 개념에 익숙해지도록 도왔지만, 여전히 균형을 잡는 것은 까다로운 일이었습니다.

시사점

이 논문은 AI에게 단순히 정직하라고 말하는 것만으로는 부족하며, 정직함에 대해 보상을 주어야 한다고 결론짓습니다.

개발자들은 "모른다"라고 말했을 때 주는 "점수"를 조절함으로써 AI의 성격을 튜닝할 수 있습니다. 그들은 필요에 따라 AI를 더 신중하게(거짓말을 덜 하게) 만들거나, 더 자신감 있게(더 많이 시도하게) 만들 수 있습니다.

  • 신중한 접근법을 원한다면: "모른다"라고 말했을 때 작은 보상을 줍니다. 이렇게 하면 AI는 사실을 지어내는 일을 멈출 것이며, 이는 의료나 법률 자문처럼 틀렸을 때 위험이 따르는 분야에서 AI를 훨씬 더 신뢰할 수 있게 만듭니다.
  • 한계점: AI가 "모른다"라고 말하는 법을 배우는 데에는 처음에 약간의 도움이 필요합니다. 특히 복잡하고 개방적인 과제를 수행할 때 더욱 그렇습니다.

요약하자면, 연구진은 침묵이 때로는 거짓말보다 낫다는 것을 AI 모델에게 가르치는 훈련 매뉴얼을 만들었으며, 적절한 보상이 있다면 AI가 지적 겸손함을 배울 수 있다는 것을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →