← 최신 논문
🤖 AI

Evaluating Bivariate Causal Statements Based on Mutual Compatibility

이 논문은 전통적인 검증이 불가능한 시나리오에서 전문가나 AI의 인과적 주장을 검증하기 위해 호환성 및 불호환성 점수를 활용하여, 정답(ground truth)에 의존하지 않고 이변량 인과 관계 진술의 개연성과 일관성을 평가하기 위한 프레임워크를 소개한다.

원저자: Erik Jahn, Dominik Janzing

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Erik Jahn, Dominik Janzing

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 풀고 있다고 상상해 보십시오. 하지만 당신에게는 범죄 현장 사진이나 실제 증거가 없습니다. 대신, 당신에게는 목격자 진술 뭉치가 주어져 있습니다. 각 목격자는 "A가 B를 일으켰다" 또는 "C가 D를 일으켰다"와 같은 단순한 두 사람 사이의 이야기를 들려줍니다.

문제는 무엇일까요? 이 수백 개의 두 사람 사이의 이야기가 모두 하나의 거대하고 진실된 이야기를 구성하는 데 적합한지 알 수 없다는 점입니다. 어떤 목격자는 거짓말을 하고 있을 수도 있고, 어떤 이는 혼란스러워할 수도 있으며, 어떤 이는 단순히 존재하지 않는 현실을 묘사하고 있을 수도 있습니다.

이 논문은 이러한 "두 사람 사이의 이야기"들을 하나로 결합하여 하나의 커다란 그림을 만들 때, 이들이 과연 말이 되는지를 확인하는 새로운 도구에 관한 것입니다. 저자인 에릭 얀(Erik Jahn)과 도미닉 얀징(Dominik Janzing)은 목격자들이 얼마나 상세하게 설명하느냐에 따라 이 이야기들을 테스트하는 두 가지 서로 다른 방법을 개발했습니다.

두 가지 유형의 목격자

1. "수학적" 목격자 (선형 진술)
어떤 목격자들은 숫자를 제시합니다. 그들은 "A가 1단위 증가하면, B는 0.5단위 증가한다"라고 말합니다. 이들은 정밀합니다.

  • 기술: 만약 당신이 이러한 정밀한 두 사람 사이의 이야기 목록을 가진다면, 당신은 수학적으로 이들을 하나의 거대하고 복잡한 전체 변수에 대한 이야기로 강제로 끼워 맞출 수 있습니다. 이는 마치 퍼즐 조각들이 완벽히 맞지 않더라도 억지로 끼워 맞추는 것과 같습니다.
  • 문제점: 이들을 맞추기 위해, 수학은 때때로 "유령"을 만들어내야 합니다. 통계학에서 이 유령은 **교란(confounding)**이라고 불립니다. 이는 두 대상이 실제로 서로를 유발하지 않음에도 불구하고 서로 연관되어 있는 것처럼 보이게 만드는 보이지 않는 힘입니다.
  • 해결책 (호환성 점수): 저자들은 다음과 같은 규칙을 제안합니다. 믿을 만한 큰 이야기는 작은 두 사람 사이의 이야기들보다 더 많은 '보이지 않는 유령'을 필요로 해서는 안 됩니다.
    • 이렇게 생각해 보십시오. 만약 당신이 작은 친구 그룹을 본다면, 당신은 그들이 모두 서로 친구라고 생각할 수도 있습니다. 하지만 도시 전체를 조망해 보면, 그들은 사실 중앙에 있는 한 명의 인기 있는 사람과 친구일 뿐이며, 그렇기에 서로 연결된 것처럼 보인다는 것을 깨닫게 됩니다.
    • 만약 큰 이야기가 소규모의 이야기들이 보이는 모습을 설명하기 위해 아주 많은 '보이지 않는 유령'을 필요로 한다면, 그 큰 이야기는 의심스럽습니다. 저자들은 이 점수를 측정하기 위한 "점수"를 만들었습니다. 만약 점수가 음수라면, 그것은 경고 신호입니다: "이 이야기 모음은 아마도 가짜일 것입니다. 왜냐하면 이 수학적 모델이 작동하기 위해서는 너무 많은 숨겨진 속임수가 필요하기 때문입니다."

2. "스케치 아티스트" 목격자 (그래프 진술)
다른 목격자들은 숫자를 제시할 수 없습니다. 그들은 대신 그림을 그립니다. 그들은 "A가 B를 가리킨다"(A가 B를 유발함)라고 하거나, "A와 B가 다른 무언가에 의해 엉킨 선으로 연결되어 있다"(그들은 다른 것에 의해 혼동됨)라고 말합니다.

  • 기술: 이러한 스케치에는 엄격한 규칙이 있습니다. 만약 A가 B를 유발하고 B가 C를 유발한다면, A는 반드시 C를 유발해야 합니다. 또한, A가 B를 유발하고, B가 C를 유발하며, 다시 C가 A를 유발하는 순환 구조(이는 시간 여행의 역설이 될 수 있음)를 가질 수 없습니다.
  • 해결책 (불호환성 점수): 저자들은 이 스케치들이 얼마나 많은 규칙을 어기는지를 계산하는 도구를 구축했습니다.
    • 레고 조립 설명서가 있다고 상상해 보십시오. 만약 설명서에는 "부품 A를 B에 연결하라"고 되어 있는데, 그림에는 A가 C에 연결된 것으로 나와 있다면 그것은 실수입니다.
    • 이 도구는 스케치들을 일관되고 루프(loop)가 없는 다이어그램으로 만들기 위해 해결해야 하는 "실수"(루프나 누락된 연결 등)의 개수를 계산합니다. 수정해야 할 실수가 많을수록 목격자 진술의 품질은 낮아집니다.

AI를 통한 도구 테스트

저자들은 단순히 도구를 만든 것에 그치지 않고, 이를 테스트했습니다. 그들은 대규모 언어 모델(LLM)—챗봇을 구동하는 것과 같은 종류의 AI—에게 이 목격자 역할을 수행하도록 요청했습니다. 그들은 AI에게 "문해율", "일일 소득", "기대 수명"과 같은 실제 세계의 개념들 사이의 관계를 설명하도록 했습니다.

  • 결과: 도구는 AI가 환각(hallucination, 사실이 아닌 것을 지어내는 현상)을 일으킬 때 이를 성공적으로 포착해 냈습니다.
    • AI가 논리적으로 일관된 진술 목록을 제공했을 때, "호환성 점수"는 양수(+)였습니다.
    • AI가 모순으로 가득 차 있거나 이해시키기 위해 너무 많은 "유령"을 필요로 하는 목록을 제공했을 때, 점수는 음수(-)가 되었습니다.
    • 흥미롭게도, 더 똑똑한 AI 모델(더 높은 "뇌력"을 가진 모델)일수록 더 높은 점수를 받는 경향이 있었는데, 이는 그들의 이야기가 더 일관적임을 의미합니다.

핵심 요약

이 논문은 우리에게 "무엇이 진실인가"를 알려주는 것이 아닙니다. "문해율이 반드시 높은 소득을 유발한다"라고 단정 짓는 것도 아닙니다. 대신, 이 논문은 우리에게 **"정신적 건전성 검사(sanity check)"**를 제공합니다.

만약 당신에게 인과 관계 주장 목록이 있다면(인간 전문가로부터 왔든 AI로부터 왔든), 이 방법은 다음과 같이 묻습니다: "이 주장들이 서로 잘 어우러지는가, 아니면 한 방에 모아놓았을 때 무너져 내리는가?"

  • 나쁜 점수는 다음을 의미합니다: "멈추세요! 이 이야기들은 서로 모순되거나, 이해시키기 위해 불가능한 마법이 필요합니다. 믿지 마십시오."
  • 좋은 점수는 다음을 의미합니다: "좋습니다. 이 이야기들은 서로 모순되지 않습니다. 그것들이 진실일 수도 있지만, 여전히 더 많은 증거가 필요합니다."

이것은 실제 실험을 통해 '지면의 진실(ground truth)'을 찾을 수 없을 때, 엉터리 정보를 걸러내기 위한 방법입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →