← 최신 논문
💬 NLP

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

이 논문은 관찰적 증거와 개입적 증거가 충돌하는 합성 환경에서, 언어 모델의 인과 방향 추론 능력은 훈련 데이터의 혼합에 의해 결정되는 것이 아니라 추론 문맥에 존재하는 증거의 유형에 의해 동적으로 켜지거나 꺼지며, 관찰적 단서가 모델의 잠재적 인과 추론 능력을 능동적으로 억제한다는 것을 입증한다.

원저자: Xining Xun

게시일 2026-08-03
📖 5 분 읽기🧠 심층 분석

원저자: Xining Xun

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정, 단서, 그리고 큰 목소리

당신이 아주 똑똑한 로봇에게 인과관계를 이해하는 법을 가르치려 한다고 상상해 보세요. 당신은 버튼을 누르면 불이 켜진다는 사실을 단순히 버튼과 불이 보통 함께 나타난다는 것을 넘어, 실제로 이해하기를 원합니다. 인공지능의 세계에는 '인과관계의 사다리(Ladder of Causation)'라는 유명한 개념이 있습니다. 이는 사물이 일어나는지를 진정으로 이해하려면, 단순히 세상을 지켜보는 것(관찰)을 넘어, 실제로 개입하여 변화를 일으키는 것(개입)이 필요하다는 것을 시사합니다. 오랫동안 연구자들은 AI에게 이 기술을 가르치는 가장 좋은 방법은 AI가 버튼을 누르고 불이 켜지는 것을 직접 보는 '개입 데이터(interventional data)'가 풍부한 이야기를 먹이는 것이라고 생각했습니다.

핵심 질문은 간단했습니다. 만약 우리가 로봇의 훈련 과정에 이러한 '행동' 이야기를 더 많이 섞는다면, 로봇은 인과관계를 파악하는 능력이 더 좋아질까요? 이 논문은 수학적으로 답이 알려진 매우 통제된 가상의 세계를 사용하여 이 질문을 파고듭니다. 연구자는 '심슨의 역설(Simpson's Paradox)'이라 불리는 까다로운 시나리오를 설정했습니다. 이는 단순히 관찰할 때는 두 가지가 서로 반대 방향으로 움직이는 것처럼 보이지만, 실제 원인을 살펴보면 함께 움직이는 통계적 퍼즐입니다. 마치 우산을 든 사람들이 그렇지 않은 사람들보다 더 많이 젖는 것을 보고, 우산이 비를 유발한다고 결론 내리는 것과 같습니다. 실제로는 비가 우산과 젖음 모두를 유발하는 것인데 말이죠. 이 논문은 '개입' 훈련을 더 많이 제공하는 것이 로봇이 오해를 불러일으키는 '관찰' 단서들을 무시하고 진정한 원인을 찾아내는 데 도움이 되는지 테스트합니다.

실험: 로봇에게 섞인 식단 제공하기

저자는 50개의 서로 다른 '세계'로 구성된 디지털 놀이터를 만들었습니다. 각 세계에서 연구자는 숨겨진 트릭을 심어 놓았습니다. 자연적인 관찰 결과는 부정적인 관계(우산 예시처럼)를 보여주었지만, 진정한 인과적 효과는 양(+)의 관계였습니다. 그런 다음 연구자는 모델에게 '개입' 데이터(누군가 강제로 변화를 일으키는 것을 본 데이터)와 '관찰' 데이터(그저 지켜본 데이터)를 다양한 비율로 섞어서 학습시켰습니다.

연구자는 처음에 '가설 1'이라고 부르는 일반적인 믿음에서 시작했습니다. "훈련 혼합물에서 개입 데이터의 양을 늘리면, 모델은 진정한 원인을 찾는 데 더 능숙해질 것이다." 연구자는 개입 데이터의 비율을 0%에서 100%까지 서서히 높이며 이를 테스트했습니다.

여기서 놀라운 반전이 일어났습니다. 그 가설은 틀렸습니다.

모델에게 훈련 중에 100%의 개입 데이터를 제공했음에도 불구하고, 모델이 질문에 답해야 하는 순간에 관찰 단서가 주어지면 여전히 인과관계의 방향을 틀리게 판단했습니다. 모델은 개입 데이터를 통해 효과의 '크기'(불이 더 밝아질 것이라는 점)는 배웠지만, 문맥(context)에서 보이는 관찰 단서로부터 '방향'(양 또는 음)을 복사해 왔습니다. 이는 마치 수학 공식은 완벽하게 암기했지만, 시험을 볼 때는 공식을 무시하고 이전 문제들의 패턴에 따라 짐작해서 답하는 학생과 같았습니다.

진짜 범인: 컨텍스트 스위치(Context Switch)

그렇다면 훈련 혼합물이 중요하지 않았다면, 무엇이 결정적이었을까요? 논문은 모델이 질문에 답하는 순간 존재하는 증거의 유형이 결정적이었다는 사실을 발견했습니다.

연구자는 서로 다른 유형의 단서가 모델에 어떤 영향을 미치는지 확인하기 위해 '4방향 비교'를 수행했습니다.

  1. 순수 관찰 (Pure Observation): 문맥에 관찰 기록만 있을 때, 모델은 50번 중 29번 방향을 틀렸습니다.
  2. 혼합 증거 (Mixed Evidence): 문맥에 관찰과 개입이 섞여 있을 때, 모델은 50번 중 19번 틀렸습니다.
  3. 순수 개입 (Pure Intervention/Probes): 문맥에 개입 기록(프로브)만 있을 때, 모델은 50번 중 41번을 맞혔습니다.

가장 흥aki한 발견은 테스트 도중 수행된 '마술'에서 나왔습니다. 연구자는 혼합된 데이터를 학습했고 문맥 속의 관찰 단서 때문에 실패하고 있던 모델을 가져왔습니다. 그러고 나서 모델이 답하기 직전에 문맥에서 관찰 단서를 지워버렸습니다. 그 즉시, 진정한 원인을 찾는 모델의 능력이 "켜졌습니다." 모델의 정확도는 음(-)의 점수에서 양(+)의 점수로 급상승하며, 오직 개입 데이터만 보았던 모델의 성능과 일치하게 되었습니다.

이는 모델이 이미 인과적 추론을 학습했음을 증명했습니다. 다만 문맥이 그 능력을 '음소거'하고 있었던 것입니다. 능력은 모델의 뇌(가중치) 속에 있었지만, 문맥이 올바른 답을 차단하는 리모컨 역할을 하고 있었습니다.

스위치가 작동하는 방식: 단계적 조절 다이얼

논문은 또한 이 스위치가 어떻게 작동하는지도 탐구했습니다. 이것은 단순한 온/오프 버튼이 아니라, 마치 볼륨 다이얼과 같습니다.

  • 관찰 기록 1개: 모델을 거의 억제하지 못했습니다.
  • 관찰 기록 2개: 신호를 희석시켜 모델을 혼란스럽게 만들었습니다.
  • 관찰 기록 4개: 모델의 주의력을 완전히 사로잡아, 잘못된 관찰 방향을 따르도록 강제했습니다.

더 흥미롭게도, 관찰의 내용이 중요했습니다. 만약 관찰 기록이 현재의 세계와 일치하지 않는 무작위 숫자라면 억제 효과가 약했습니다. 하지만 관찰 기록이 일관적이고 현재 세계의 특정 상관관계와 일치한다면 억제 효과가 가장 강력했습니다. 이는 모델이 문맥 속의 '이야기'에 귀를 기울이고, 가장 일관된 서사가 학습된 규칙을 압도하도록 내버려 두고 있음을 시사합니다.

규모 확장과 "양의 편향(Positive Bias)"

연구자는 모델이 커짐에 따라 이 문제가 개선되는지 아니면 악화되는지도 확인했습니다. 초기 2,500만 개의 파라미터보다 훨씬 큰 약 10억 개의 파라미터를 가진 모델을 테스트했습니다. 문제는 지속되었습니다: 혼합 문맥 모델은 여전히 약 32%의 확률로 인과 방향을 반대로 판단한 반면, 순수 개입 모델은 단 6%만이 반대로 판단했습니다.

마지막으로, 모델이 "원인은 항상 양(+)이다"라는 일반적인 규칙을 학습했는지 확인하기 위해 다른 데이터셋(CLadder)을 조사했습니다. 연구자들은 모델이 '양의 편향'을 학습했다는 것을 발견했습니다. 이는 사용된 모든 훈련 예시가 양의 효과를 가지고 있었기 때문입니다. 이를 해결하기 위해 양과 음의 예시를 모두 넣어 재학습시켰을 때, 모델은 훈련 세계 내부의 부호를 읽는 능력은 좋아졌지만, 혼란스러운 외부 데이터에 직면했을 때는 여전히 양(+)의 답을 내놓는 경เรียน을 보였습니다. 이는 모델이 확신이 없을 때 작동하는 '안전망'을 가지고 있으며, 그 안전망을 제거하기가 매우 어렵다는 것을 시사합니다.

결론

이 논문은 AI를 가르치는 것에 대해 중요한 교훈을 줍니다. 단순히 올바른 데이터를 먹이는 것만으로는 충분하지 않습니다. 모델은 기술을 배울 수 있지만, 모델이 작동하는 환경(문맥)이 오해를 불러일으키는 단서들로 가득 차 있다면, 모델은 배운 것을 무시하고 단서를 따라가 버립니다. 모델의 진정한 추론 능력을 켜는 스위치는 훈련 데이터에 있는 것이 아니라, 테스트하는 순간 우리가 제공하는 '문맥'에 있습니다. 최선의 결과를 얻으려면, 단순히 훈련 데이터가 알아서 해주기를 바랄 것이 아니라, 올-바른 종류의 증거를 강조할 수 있도록 문맥을 설계해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →