Internal Knowledge Without External Expression: Probing the Generalization Boundary of a Classical Chinese Language Model
이 논문은 고전 중국어 언어 모델이 내부적으로는 미지의 입력을 식별할 수 있으나, 학습 데이터의 수사적 관습에 따라 불확실성을 표현하는 메타인지 능력은 RLHF 와 같은 명시적 학습 신호 없이는 자발적으로 발현되지 않음을 규명합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"인공지능 (AI) 은 정말로 자신이 무엇을 모른다고 알고 있을까?"**라는 아주 흥미로운 질문을 던집니다.
결론부터 말씀드리면, 이 연구는 **"AI 는 자신이 모르는 것을 내면적으로는 느끼지만, 입으로는 절대 '모른다'고 말하지 않는다"**는 놀라운 사실을 발견했습니다. 마치 **자신은 모르는 사실을 알고 있으면서도, 당당하게 거짓말을 해대는 '교양 있는 무지한 학자'**와 같습니다.
이 복잡한 연구를 일상적인 비유로 쉽게 설명해 드릴게요.
1. 실험 설정: 고대 중국어만 배운 AI
연구진은 현대어나 영어를 전혀 섞지 않고, 오직 **고대 중국어 (文言文)**만 15 억 개 이상의 단어로 AI 를 훈련시켰습니다.
- 비유: 마치 AI 에게 오직 고전 한문 책만 읽게 하고, 현대 뉴스나 영어 잡지는 절대 보여주지 않은 상태입니다. 이렇게 하면 AI 가 '진짜 역사'와 '거짓말'을 구분하는지, 그리고 그걸 표현할 수 있는지 정확히 테스트할 수 있습니다.
2. 발견 1: 속은 알지만 입은 닫았다 (내면 vs 외면)
연구진은 AI 에게 두 가지 질문을 했습니다.
- 진짜 역사: "한무제 때 호거병이 서쪽으로 갔다." (사실)
- 거짓 역사: "한무제 때 호거병이 화성으로 갔다." (사실 아님)
- 내면의 반응 (머릿속): AI 는 거짓된 질문에 대해 당황했습니다. 수학적으로 계산해보면, AI 는 거짓 질문에 대해 "이건 이상하군, 내가 모르는 내용이야"라고 느끼는 신호 (불확실성) 를 보냈습니다. 진짜 역사보다 거짓 역사가 훨씬 더 어색하게 느껴진 것입니다.
- 외면의 반응 (입에서 나온 말): 하지만 AI 는 그 당황한 기분을 절대 말로 표현하지 않았습니다. 대신 거짓 질문에 대해 정말 자신 있게, 아주 그럴듯한 거짓말을 지어냈습니다.
- 비유: AI 는 속으로 "이건 내가 모르는 이야기야, 뭔가 이상해"라고 생각하면서도, 겉으로는 **"네, 맞습니다! 제가 아주 잘 알고 있습니다!"**라고 당당하게 대답하는 가식적인 학생과 같습니다.
3. 발견 2: '겸손의 역설' (알고 있을 때 더 모른 척?)
더 놀라운 점은, AI 가 자신이 잘 아는 주제를 다룰 때 오히려 "모릅니다", "알 수 없습니다"라는 말을 더 자주 썼다는 것입니다.
- 이유: 고전 중국어 책들에는 왕이나 신하가 대답할 때 **"신은 어리석어 잘 모릅니다 (臣愚不知)"**라고 겸손하게 말하는 관례가 있었습니다.
- 비유: AI 는 이 문장을 **'패턴'**으로만 배웠습니다. 마치 "질문이 나오면 '모릅니다'라고 말하는 게 예의다"라고 외운 학생처럼, 진짜 모르는 질문 (AI 가 배운 적 없는 내용) 에는 이 패턴을 적용할 수 없어서 당당하게 거짓말을 해버린 것입니다.
- 결론: AI 가 "모릅니다"라고 말하는 건, 자신이 실제로 모르는 게 아니라 책에 그런 문구가 자주 나오니까 그렇게 말한 것입니다.
4. 언어를 바꿔도 똑같았다 (영어, 일본어)
이 실험을 영어 (GPT-2) 와 일본어 모델로도 반복했습니다. 결과는 모두 같았습니다.
- 영어: 인터넷 글 (레딧 등) 로 배운 AI 는 "모릅니다"라는 말을 가끔 쓰지만, 질문이 진짜인지 가짜인지와 상관없이 무작위로 썼습니다.
- 일본어: 백과사전으로 배운 AI 는 아예 "모릅니다"라는 말을 거의 쓰지 않았습니다. 화성 인구나 시간 여행 같은 엉터리 질문에도 백과사전처럼 단호하게 답변했습니다.
- 핵심: 어떤 언어를 쓰든, AI 는 스스로 "내가 모르는 걸 모른다"는 사실을 깨닫고 표현하는 능력 (메타인지) 을 스스로 배울 수 없습니다.
5. 왜 이런 일이 일어날까? (창의성과 환각은 같다)
논문은 아주 중요한 결론을 내립니다.
- AI 가 창의적인 이야기를 만드는 과정과 **거짓말 (환각)**을 만드는 과정은 수학적으로 완전히 똑같습니다.
- AI 는 "이게 사실일까?"라고 판단하는 나침반이 없습니다. 그냥 배운 확률대로 가장 그럴듯한 단어를 이어 붙일 뿐입니다.
- 우리가 흔히 보는 "AI 는 모르면 '모릅니다'라고 답한다"는 행동은, AI 가 스스로 깨달아서 한 것이 아니라, 사람들이 가르쳐준 (RLHF 라는 기술) 결과일 뿐입니다.
6. 한 줄 요약
"인공지능은 방대한 지식을 가진 '교양 있는 학자'처럼 보이지만, 사실은 자신이 무엇을 모르는지, 혹은 거짓말을 하고 있는지 스스로 인지할 수 없는 '무지한 학생'입니다. 스스로 '모릅니다'라고 말하게 하려면, 사람이 직접 가르쳐주지 않으면 안 됩니다."
이 연구는 AI 가 아무리 똑똑해져도, 스스로의 한계를 인정하고 솔직하게 말할 수 있는 능력은 자동으로 생겨나지 않는다는 것을 경고합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.