← 최신 논문
💬 NLP

Can Large Language Models Infer Causal Relationships from Real-World Text?

이 논문은 기존 연구가 단순화된 텍스트에 의존했던 한계를 넘어, 실제 학술 문헌을 기반으로 한 최초의 벤치마크를 구축하여 대규모 언어 모델이 복잡한 현실 세계 텍스트에서 인과 관계를 추론하는 데 심각한 어려움을 겪고 있음을 규명했습니다.

원저자: Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

게시일 2026-04-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"최첨단 인공지능 (LLM) 이 복잡한 현실 세계의 글을 읽고, 숨겨진 '인과관계 (A 가 B 를 일으킨다)'를 찾아낼 수 있을까?"**라는 질문을 던지며 시작합니다.

결론부터 말씀드리면, 아직은 많이 부족합니다. 마치 "유리창을 뚫고 지나가는 새"처럼, AI 는 글자 자체는 잘 읽지만, 그 글자들이 만들어내는 복잡한 인과 관계의 지도를 그리는 데는 여전히 고전하고 있습니다.

이 논문의 핵심 내용을 일상적인 비유와 함께 쉽게 설명해 드릴게요.


1. 기존 연구의 문제점: "가짜 뉴스" 같은 연습 문제

지금까지 AI 의 인과 추론 능력을 테스트할 때, 연구자들은 주로 인위적으로 만든 짧은 글을 사용했습니다.

  • 비유: 마치 "비 (A) 가 내리면 땅이 젖는다 (B)"라고 직접적으로 써진 짧은 문장만 주고, "A 가 B 를 만들었니?"라고 물어보는 것과 같습니다.
  • 문제: 현실 세계는 그렇지 않습니다. 신문 기사나 학술 논문을 보면, "비가 와서 땅이 젖었다"라고 직접 쓰지 않고, "하늘이 흐려졌고, 사람들이 우산을 폈으며, 길에 물웅덩이가 생겼다"라고 숨겨진 단서로 표현합니다. AI 는 이런 숨은 단서를 연결하는 능력을 테스트받지 못했습니다.

2. 새로운 시험지 'ReCITE'의 등장

저자들은 AI 의 실력을 진짜로 확인하기 위해 실제 학술 논문 292 편으로 구성된 새로운 시험지, **'ReCITE'**를 만들었습니다.

  • 특징: 이 논문들은 길고, 복잡하며, 인과 관계가 직접적으로 쓰이지 않은 경우가 많습니다.
  • 과제: AI 에게 긴 논문을 주고, "이 글에서 A 가 B 를 어떻게 일으켰는지 **인과 관계 지도 (그래프)**를 그려봐"라고 시켰습니다.

3. 실험 결과: AI 는 여전히 '초보' 수준

최고급 AI 모델 10 개를 시험에 붙였는데, 결과는 충격적이었습니다.

  • 성적표: 최고 점수를 받은 모델도 **53.5 점 (F1 점수 0.535)**에 그쳤습니다. (100 점 만점 기준)
  • 해석: AI 는 글자 자체는 잘 읽지만, "왜 그런 일이 일어났는지"를 추론하는 능력은 여전히 인간에 비해 훨씬 떨어집니다.
  • 비유: AI 는 사전을 외운 학생처럼 단어는 다 알지만, 수학 문제를 풀 때 논리적으로 단계를 밟아 나가는 능력이 부족하다는 뜻입니다.

4. 왜 실패했을까? (세 가지 주요 원인)

① '직접적'이지 않은 말투에 약함

  • 상황: 글에 "A 가 B 를 일으켰다"라고 직접 (Explicit) 쓰여 있으면 AI 가 잘 찾습니다. 하지만 "A 가 일어났고, 그 후 B 가 나타났다"라고 **간접 (Implicit)**적으로 쓰여 있으면 AI 는 연결 고리를 놓칩니다.
  • 비유: AI 는 "비밀번호를 알려줘야만 문을 열 수 있는" 기계 같습니다. "문은 열려 있다"라고 직접 말해주면 열지만, "열쇠가 문 옆에 있다"라고 힌트만 주면 문을 못 찾습니다.

② '개념'은 찾는데 '관계'는 못 찾음

  • 상황: AI 는 글에서 중요한 단어 (노드) 를 잘 찾아냅니다. 하지만 "이 단어가 저 단계를 어떻게 영향을 미치는지"라는 **화살표 (관계)**를 그리는 데 실패합니다.
  • 비유: AI 는 레고 블록은 잘 찾아내지만, "이 블록을 저 블록 위에 올려야 탑이 세워진다"는 조립 방법을 잘 모릅니다.

③ 글이 길어질수록 더 어려워짐

  • 상황: 글이 길고 정보가 산재해 있을수록 AI 는 혼란에 빠집니다.
  • 비유: 짧은 지시문은 잘 따르지만, 수백 페이지에 달하는 요리책을 보고 "어떤 재료가 어떤 과정을 거쳐 최종 요리를 만드는지" 전체 흐름을 그리는 것은 아직 버겁습니다.

5. 흥미로운 발견: "정답을 알려주면?"

연구자들은 "AI 가 단어 (노드) 를 찾는 게 문제인가, 아니면 관계를 찾는 게 문제인가?"를 확인하기 위해 정답 단어 목록을 미리 알려주는 실험을 했습니다.

  • 결과: 단어는 다 맞췄는데, 관계 (화살표) 를 그리는 능력은 여전히 나빴습니다.
  • 의미: AI 의 문제는 '단어를 못 찾는 것'이 아니라, 진짜 '인과 추론 (논리적 연결)'을 못 하는 것입니다.

6. 결론 및 시사점

이 논문은 AI 가 **진짜 지능 (인공지능 일반, AGI)**에 도달하기 위해서는 단순한 텍스트 읽기를 넘어, 복잡한 현실 세계의 숨은 인과 관계를 추론하는 능력을 키워야 한다고 경고합니다.

  • 핵심 메시지: 현재 AI 는 기억력은 좋지만, 이해력과 추론력은 아직 초보 단계입니다. 우리는 AI 가 더 똑똑해지도록, 숨은 단서를 연결하는 훈련을 더 시켜야 합니다.

한 줄 요약:

"지금의 AI 는 긴 글을 읽을 때는 '단어'는 잘 찾지만, 그 글 속에 숨겨진 '왜 (Why)'와 '어떻게 (How)'의 연결고리를 찾아내는 데는 여전히 서툴러서, 복잡한 현실 문제를 해결하기엔 아직 멀었습니다."

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →