← 최신 논문
💬 NLP

Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

본 논문은 대규모 언어 모델에서 숨겨진 상태가 모델의 구두 Yes/No 응답이 이 지식을 표현하지 못함에도 불구하고 인과적 증거를 정확하게 인코딩하는 (약 97% 정확도) "인과성 설결음" 현상을 드러내며, 이는 최종 답변만을 기반으로 한 표준 벤치마크가 모델의 진정한 인과 추론 능력을 오인할 수 있음을 시사한다.

원저자: Ziyi Ding, Xiao-Ping Zhang

게시일 2026-05-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ziyi Ding, Xiao-Ping Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 언어 모델 (LLM) 을 교실에 앉아 있는 천재적이지만 수줍은 학생으로 상상해 보세요. 이 학생은 인과 관계에 관한 시험 (예: "흡연이 폐암을 유발하는가?") 을 치렀습니다.

이 논문은 저자들이"인과성 혀꼬임 (Causal Tongue-Tie)"이라고 부르는 기이한 현상을 발견했습니다. 이것이 어떻게 일어나는지 간단한 부분으로 나누어 설명해 보겠습니다:

1. 두 가지 목소리: "뇌" 대 "입"

보통 우리는 컴퓨터의 "뇌"(내부 수학 및 숨겨진 계산) 가 답을 안다면, 그 "입"(타자하는 텍스트) 도 같은 말을 할 것이라고 가정합니다.

하지만 이 논문은 이러한 모델들의 경우 뇌와 입이 서로 다른 이야기를 하고 있다는 사실을 발견했습니다.

  • 뇌 (숨겨진 상태): 모델이 생각할 때 그 내부 수학을 들여다보면, 질문에서 제공된 증거를 바탕으로 명확하게 정답을 파악하고 있습니다. 마치 학생이 손을 들고 선생님에게 정답을 속삭이는 것과 같습니다.
  • 입 (출력): 모델이 실제로 말 (예: "예" 또는 "아니오"를 작성) 할 때, 자신의 뇌를 무시하고 증거가 반대라고 하더라도 자신이 "상식"이라고 생각하는 대로 돌아가버립니다. 마치 학생이 정답을 속삭였지만 실수할까 봐 두려워 큰 소리로 틀린 답을 외치는 것과 같습니다.

2. "반상식" 테스트

이를 증명하기 위해 연구자들은 기법을 사용했습니다. 그들은 모델에게 증거가 거꾸로 된 질문을 주었습니다.

  • 상황: 그들은 모델에게 "이 이야기에서는 흡연이 폐암을 예방한다"고 말했습니다. (실제 세계에서는 흡연이 폐암을 유발합니다.)
  • 결과:
    • 모델의 입: "아니오, 흡연은 폐암을 예방하지 않습니다"라고 답했습니다. 새로운 규칙을 받아들이기를 거부하고 실제 세계의 습관에 매달렸습니다.
    • 모델의 뇌: 특수 도구 ("프로브") 가 모델의 수학을 들여다본 결과, 모델이 새로운 규칙을 완벽하게 이해하고 있음을 발견했습니다. 제공된 이야기 기반으로는 답이 "예"라는 것을 알고 있었습니다.

뇌가 진실을 알고 있음 (97% 정확도) 과 입이 잘못된 것을 말함 (50% 정확도) 사이의 간극이 바로 "인과성 혀꼬임"입니다.

3. "혀꼬임" 비유

이것을 혀꼬임에 걸린 사람으로 생각해보세요.

  • 그들은 정확히 무엇을 말하고 싶은지 압니다.
  • 머리 속에는 올바른 단어가 있습니다.
  • 하지만 말하려고 하면 혀가 걸려서 실수로 반대말이나 일반적인 말을 하게 됩니다.

이 논문은 모델이 인과 관계 질문을 "틀리게" 답할 때, 항상 모델이 멍청하거나 이해하지 못한다는 뜻은 아니라고 주장합니다. 때로는 모델이 완벽하게 이해하고 있지만 표준적인 "예/아니오" 형식을 통해 그것을 표현하지 못한다는 뜻일 수 있습니다.

4. 왜 "예/아니오"가 문제인가

연구자들은 혀를 "풀기" 위해 질문하는 다양한 방법을 시도했습니다.

  • "예/아니오"로 질문할 때: 모델은 실패합니다. 오래된 습관에 걸려버립니다.
  • "A 또는 B"로 질문할 때: 모델에게 두 가지 구체적인 옵션 중 하나를 선택하도록 강요했을 때 (예: "A 가 B 를 유발하는가, 아니면 B 가 A 를 유발하는가?"), 모델은 거의 100% 의 확률로 갑자기 정답을 맞췄습니다.

이는 모델이 지식이 부족해서가 아니라 인터페이스에 문제가 있음을 시사합니다. 간단한 "예/아니오" 버튼은 모델이 프롬프트의 특정 증거보다는 학습 데이터 (상식) 로 돌아가게 만드는 함정처럼 작용합니다.

5. "추론"에 대한 의미

이 논문은 AI 를 평가하는 방식에 대해 중요한 점을 제기합니다.

  • 모델이 정답을 맞출 때: 그것은 단순히 추측하거나 패턴을 따르는 것일 뿐, 반드시 "추론"을 하고 있는 것은 아닐 수 있습니다.
  • 모델이 오답을 낼 때: 그것이 추론을 한다는 뜻은 아닙니다. "뇌" 내부에서는 올바르게 추론하고 있지만, 입 밖으로 말하지 못해 실패한 것일 수 있습니다.

핵심 요약:
우리는 AI 가 인과 관계를 이해하는지 판단하기 위해 단순히 최종적인 "예" 또는 "아니오"만 볼 수는 없습니다. 때로는 AI 가 진실을 알고 있지만 우리가 기대하는 방식으로 말하기엔 "혀꼬임"이 너무 심한 것입니다. 이 논문은 모델이 무엇을 말하고 있는지뿐만 아니라 실제로 무엇을 생각하고 있는지 더 잘 들을 수 있는 더 나은 방법들이 필요하다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →