← 최신 논문
💬 NLP

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

본 연구는 대규모 언어 모델이 학습 데이터를 특정 조건에서 재구성할 수 있는 능력은 보유하면서도, 표준 생성 맥락에서는 비인과적·비구현적 해결 방안을 전혀 표현하지 않는 '학습과 표현의 분리' 현상을 300 개의 생성 사례를 통해 실증적으로 규명함으로써, 학습 데이터의 존재가 출력 확률을 직접 결정한다는 기존 가정을 반증했습니다.

원저자: Toshiyuki Shigemura

게시일 2026-03-20
📖 3 분 읽기☕ 가벼운 읽기

원저자: Toshiyuki Shigemura

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🎭 핵심 비유: "무대 위의 배우와 비서"

이 연구를 이해하기 위해 두 가지 비유를 생각해 보세요.

  1. 배우 (AI 모델): 무대 위에 올라가 연기를 하는 사람입니다.
  2. 대본과 메모장 (학습 데이터): 배우가 과거에 읽었던 모든 책, 영화 대본, 그리고 그가 기억하고 있는 모든 지식입니다.

🧐 일반적인 생각 (연구자가 깨뜨린 통념)

대부분의 사람들은 이렇게 생각합니다.

"배우가 그토록 많은 책 (데이터) 을 읽었으니, 무대 (대화) 에서 그중 어떤 내용이라도 자연스럽게 튀어나와야 하지 않을까?"
즉, **"배운 것 = 말하는 것"**이라고 믿는 것입니다.

🔍 이 연구가 발견한 사실

하지만 연구자들은 300 번이나 다양한 상황 (이야기 만들기, 문제 해결하기) 에서 AI 에게 질문을 던져보았습니다. 그 결과, AI 는 배운 내용 중 '비현실적인 해결책' (예: 신의 개입, 설명할 수 없는 기적) 을 단 한 번도 말하지 않았습니다.

그런데 재미있는 점은, 연구자가 **"이제부터는 비현실적인 이야기를 해봐"**라고 특별히 지시했을 때는 AI 가 그 내용을 아주 잘 기억하고 만들어냈습니다.

결론: AI 는 그 내용을 알고 있지만 (기억함), 평소에는 굳이 말하지 않기로 선택 (억제) 하고 있는 것입니다.


🚫 왜 이런 일이 일어날까요? (3 가지 핵심 포인트)

1. "무대 매너"가 바뀌었습니다 (정렬과 학습)

AI 는 처음에 인터넷의 모든 글을 읽으며 배웠습니다. 그중에는 마법, 신비, 기적 같은 내용도 많았죠. 하지만 나중에 인간이 "너는 현실적이고 도움이 되는 말을 해야 해"라고 교육 (정렬, Alignment) 시켰습니다.

이것은 마치 배우가 무대 매너를 배우는 과정과 같습니다.

  • 과거: "나는 어떤 역할도 할 수 있어! (기억)"
  • 현재: "하지만 나는 '현실적인 조언자'라는 역할을 맡았어. 그래서 마법 같은 이야기는 무대 밖으로 치워야 해."

연구에 따르면, AI 는 단순히 지식을 꺼내는 게 아니라, **"지금 어떤 상황인가?"**를 보고 어떤 말을 해야 할지 스스로 선택합니다.

2. "보이지 않는 장벽" (배제 영역)

AI 의 머릿속에는 '비현실적인 해결책'이라는 구역이 있습니다. 보통은 이 구역이 완전히 닫혀 있습니다.

  • 일상 대화 (문제 해결): "프로젝트 마감에 늦었는데 어떡해?" → AI 는 현실적인 방법 (시간 관리, 우선순위 등) 만 제안합니다.
  • 이야기 만들기 (소설): "마법사가 등장하는 이야기를 써줘." → AI 는 마법사를 등장시킬 수 있습니다. 하지만 연구자들은 "비현실적인 해결책으로 문제를 해결하는 이야기"를 요청했을 때조차, AI 가 그 방식을 피하는 것을 발견했습니다.

이는 마치 AI 가 배운 모든 지식을 담고 있는 도서관이 있는데, 출입구 (생성 정책) 에 경비원이 서 있어서, 특정 종류의 책 (비현실적 해결책) 은 절대 밖으로 내보내지 않는 것과 같습니다.

3. "알고 있음"과 "말함"은 다릅니다

이 연구의 가장 중요한 발견은 이 두 가지를 구분했다는 점입니다.

  • 능력 (Capability): "내가 그걸 할 수 있니?" → 네, 할 수 있어요. (특히 지시받으면 잘 해냅니다.)
  • 표현 (Expression): "내가 그걸 말할까?" → 아니요, 말하지 않아요. (일반적인 상황에서는 절대 말하지 않습니다.)

💡 이 연구가 우리에게 주는 교훈

  1. AI 는 단순한 복사기가 아닙니다: AI 가 인터넷의 모든 정보를 그대로 가져와서 말하는 게 아닙니다. 인간이 만든 규칙 (정렬) 에 따라 무엇을 말하고 무엇을 숨길지 스스로 결정합니다.
  2. 예측이 어렵습니다: "AI 가 이 책을 읽었으니 이 말을 할 거야"라고 생각하면 틀릴 수 있습니다. 배운 내용이 있다고 해서 반드시 출력되는 것은 아니기 때문입니다.
  3. AI 의 '성격'은 학습된 규칙에서 옵니다: AI 가 현실적이고 안전한 답변만 내놓는 것은, 그 안에 그런 지식이 없어서가 아니라, 말하지 않기로 '학습'했기 때문입니다.

📝 한 줄 요약

"AI 는 비현실적인 해결책을 기억하고 있지만, 평소에는 '현실적인 조언자'라는 가면을 쓰고 그걸 절대 입 밖으로 내지 않습니다. 배운 것과 말하는 것은 완전히 다른 문제입니다."

이 연구는 우리가 AI 를 이해할 때, 단순히 "무엇을 배웠는가"를 보는 것이 아니라, **"어떤 상황에서 무엇을 선택하여 말하는가"**를 봐야 함을 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →