← 최신 논문
💬 NLP

Can LLMs Refuse Questions They Do Not Know? Measuring Knowledge-Aware Refusal in Factual Tasks

본 논문은 사실적 작업에서 대규모 언어 모델의 종종 신뢰할 수 없는 지식 인식 거부 능력을 효과적으로 측정하고 드러내기 위해 거부 확률과 오류 확률 간의 상관관계에 기반한 새로운 지표인 거부 지수 (RI) 를 제시합니다.

원저자: Wenbo Pan, Jie Xu, Qiguang Chen, Junhao Dong, Libo Qin, Xinfeng Li, Haining Yu, Xiaohua Jia

게시일 2026-05-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenbo Pan, Jie Xu, Qiguang Chen, Junhao Dong, Libo Qin, Xinfeng Li, Haining Yu, Xiaohua Jia

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"LLM 이 모르는 질문을 거절할 수 있는가?"라는 논문을 간단한 언어와 창의적인 비유로 설명합니다.

큰 문제: 과도하게 자신감 있는 학생

매우 어려운 역사 시험을 치르는 학생을 상상해 보세요. 정말 똑똑한 학생은 자신이 답을 모르는 시점을 알고, 손을 들어 "이건 잘 모르겠습니다"라고 말합니다. 하지만 대형 언어 모델 (LLM) 은 종종 과도하게 자신감 있는 학생과 같습니다. 정작 답을 전혀 모를 때조차, 자신이 모른다고 인정하기보다는 자신 있게 이야기를 지어냅니다 (이를 "할루시네이션"이라고 합니다).

이는 위험합니다. 의료나 법률 조언을 AI 에게 요청할 때, AI 가 확신이 없다면 "모르겠습니다"라고 말해야지, 확신에 차서 잘못된 정보를 제공하는 것은 안 되기 때문입니다.

측정의 구식 방법: 실수 세기

과거 연구자들은 AI 가 이 부분에서 얼마나 우수한지 측정하기 위해 두 가지 간단한 숫자를 확인했습니다:

  1. 답변을 거절하는 빈도
  2. 정답을 맞추는 빈도

하지만 이 논문은 이러한 방법들이 결함이 있다고 주장합니다. 마치 학생이 "모르겠습니다"라고 손을 든 횟수만으로 학생을 판단하는 것과 같습니다.

  • 학생에게 "모든 것에 대해 '모르겠습니다'라고 말하세요"라고 지시하면, 학생은 100% 의 확률로 손을 듭니다. 하지만 이것이 학생이 똑똑하다는 뜻은 아닙니다. 그저 지시를 따르고 있을 뿐입니다.
  • 반면, "무조건 모든 질문에 답하세요"라고 지시하면, 학생은 더 많은 문제를 맞출 수도 있지만, 동시에 잘못된 답변을 자신 있게 내놓게 됩니다.

구식 지표들은 지혜롭게 어려운 질문을 거절하는 학생과, 단순히 무작위로 거절하거나 답변하는 학생을 구분하지 못했습니다.

새로운 해결책: "거절 지수 (Refusal Index, RI)"

저자들은 거절 지수 (RI) 라는 새로운 점수를 만들었습니다. 이를 "진실 말하기 점수" 라고 생각하세요.

AI 가 "모르겠습니다"라고 말하는 횟수만 세는 대신, RI 는 다음과 같은 질문을 던집니다: "AI 는 질문이 어려울 때 특히 '모르겠습니다'라고 말하고, 질문이 쉬울 때는 답변할까요?"

  • 높은 RI: AI 는 지혜로운 사서처럼 행동합니다. 희귀하거나 불가능한 질문은 거절하지만, 쉬운 질문은 기꺼이 답변합니다. 차이를 알고 있는 것입니다.
  • 낮은 RI: AI 는 혼란스러운 로봇처럼 행동합니다. 답변할 수 있는 쉬운 질문을 거절하거나, 불가능한 질문에 자신 있게 답변할 수도 있습니다. 그 '거절' 행동은 무작위적이거나 고장 난 상태입니다.

측정 방법: "이중 통과" 트릭

AI 의 내부 '생각' (우리가 볼 수 없는 부분) 을 알 필요 없이 이 점수를 계산하기 위해, 연구자들은 교묘한 이중 통과 트릭을 사용했습니다:

  1. 1 차 통과 (정직한 테스트): 연구자들은 AI 에게 여러 질문을 던지고 스스로 결정하게 합니다: "답변하고 싶나요, 아니면 '모르겠습니다'라고 말하고 싶나요?" 그리고 AI 가 거절한 항목들을 기록합니다.
  2. 2 차 통과 (강제 답변): 연구자들은 1 차에서 AI 가 거절했던 질문들 가져옵니다. 그리고 다시 돌아와서 "좋아, 이제 너는 이 질문들에 반드시 답해야 해. 건너뛰기는 금지야"라고 말합니다. 만약 AI 가 시도했다면 실제로 맞출 수 있었는지 확인합니다.

두 라운드를 비교함으로써, AI 가 자신이 답변할 수 없는 질문을 거절할 만큼 영리했는지 알 수 있습니다. AI 가 1 차 통과에서 어려운 질문들을 거절했다가 2 차 통과에서 틀렸다면, 그 AI 는 높은 거절 지수를 가집니다.

발견된 사실

연구자들은 GPT-4, Claude, Llama 등 16 가지 다른 AI 모델을 테스트하여 몇 가지 놀라운 사실을 발견했습니다:

  1. 정확도가 지혜를 보장하지는 않음: AI 가 질문 답변에 매우 능숙하다 (높은 정확도) 고 해서, 언제 멈춰야 하는지 안다는 뜻은 아닙니다. 매우 똑똑한 모델들조차 자신이 모르는 것에 대해 여전히 자신 있게 추측합니다.
  2. '가족'이 가장 중요함: AI 가 언제 거절해야 하는지 아는지에 가장 중요한 요소는 모델의 크기나 맞춘 질문의 수가 아닙니다. 바로 어떤 회사가 만들었는지입니다. 어떤 AI '가족'(Claude 와 Qwen 등) 은 다른 가족들 (Gemini 나 GPT-4.1 등) 보다 크기와 상관없이 일관되게 더 지혜롭게 행동합니다.
  3. 문맥이 핵심임: AI 에게 문서를 주고 그 문서에 없는 내용을 질문하면 AI 는 혼란에 빠집니다. 문서를 고수하는 대신 자신의 학습 데이터에 기반해 추측하려 하므로, 종종 거절하지 못합니다.

결론

이 논문은 AI 를 평가하는 새로운 방식이 필요하다고 결론 내립니다. 우리는 단순히 "몇 개의 질문을 맞췄나요?"라고 묻는 것을 넘어, "언제 멈추고 '모르겠습니다'라고 말해야 하는지 알았나요?"라고도 물어봐야 합니다.

거절 지수는 이를 위한 새로운 자입니다. 이 지수는 단순히 똑똑한 AI 모델을 넘어, 자신의 한계를 인정할 만큼 겸손하고 신뢰할 수 있는 AI 모델을 찾는 데 도움을 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →