From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
이 논문은 12개의 대규모 언어 모델을 직접적인 인과적 에지 분류기로 체계적으로 평가하였으며, 이들이 높은 재현율을 보임에도 불구하고 상당한 과잉 예측, 직접적 관계와 간접적 관계 사이의 구분 능력 부족, 그리고 잘못된 판단에 대한 심각한 과잉 확신을 겪는다는 점을 발견하였고, 이는 이들이 인과 구조의 신뢰할 수 있는 직접적 증거보다는 소프트 인과 사전 확률(soft causal priors)의 원천으로서 더 적합함을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
과학은 종종 단순히 어떤 일이 일어나는가가 아니라, 왜 일어나는가를 이해하고자 노력한다. 연구자들이 하나의 현상 뒤에 숨겨진 원인을 파악하려고 할 때—그것이 인구 집단 내에서 퍼지는 바이러스이든, 공장에서 발생하는 기계 고장이든—그들은 연결의 도표를 구축한다. 이 도표에서 한 사물에서 다른 사물로 이어지는 직접적인 선은 첫 번째 사물이 두 번째 사물을 즉각적으로 유발함을 의미한다. 만약 바이러스가 감염을 일으키고, 그 감염이 양성 검사 결과로 이어진다면, 바이러스는 감염을 거쳐서 간접적으로 검사 결과를 일으키는 것이다. 어떤 선이 직접적이고 어떤 선이 간접적인지를 파고드는 것은 '인과 발견(causal discovery)'이라 불리는 어려운 퍼즐이다. 수십 년 동안 과학자들은 이 퍼즐을 풀기 위해 복잡한 수학적 도구와 방대한 관측 데이터에 의존해 왔지만, 이러한 도구들은 데이터가 부족하거나 서로 다른 패턴이 동일해 보일 때 때때로 어려움을 겪는다.
최근 몇 년 사이, 새로운 종류의 도구가 등장했다: 바로 대규모 언어 모델(LLM)이다. 이들은 방대한 양의 텍스트를 학습하여 질문에 답하고, 이야기를 쓰고, 문제를 추론할 수 있는 컴퓨터 시스템이다. 이들은 매우 많은 양의 글을 읽었기 때문에, 세상이 어떻게 돌아가는지에 대한 깊은 지식의 샘, 즉 사물들이 어떻게 서로를 유발하는지에 대한 지식을 보유하고 있는 것처럼 보인다. 연구자들은 이 시스템들이 전문가 가이드 역할을 하여, 도표 속의 어떤 연결이 실제이며 직접적인지를 우리에게 알려줄 수 있는지 묻기 시작했다. 희망은 이 모델들이 값비싼 실험을 수행하지 않고도 인과관계에 대한 신뢰할 수 있는 판단을 제공함으로써 하나의 지름길이 되어줄 수 있다는 것이었다. 그러나 새로운 연구는 이 모델들이 두 사물이 연관되어 있다는 점은 잘 감지할지 몰라도, 정확히 어떻게 연결되어 있는지는 알지 못하는 경우가 많으며, 틀렸을 때 지나치게 확신에 차 있다는 점을 시사한다.
연구팀은 대규모 언어 모델을 직접적인 인과관계를 판단하는 심판으로 취급하여 그 신뢰성을 테스트하기 위해 연구를 진행했다. 그들은 소규모의 효율적인 시스템부터 거대하고 강력한 시스템에 이르기까지 12가지 서로 다른 버전의 모델들을 모았다. 그런 다음 연구자들은 알려진 인과 관계 지도로 표현된 6가지의 서로 다른 실제 세계 시나리오를 이 모델들에게 제시했다. 이 시나리오들은 간염 및 코로나19와 같은 의료 조건부터 산업 공정 및 생태계에 이르기까지 다양한 분야를 포괄했다. 이 지도에 있는 모든 변수 쌍에 대해, 연구자들은 모델들에게 간단한 질문을 던졌다: "첫 번째 항목이 두 번째 항목을 직접적으로 유발하는가?" 모델들은 '예' 또는 '아니오'로 답해야 했으며, 자신의 답변에 대한 확신 점수, 즉 자신이 얼마나 확신하는지를 나타내는 숫자를 함께 제시해야 했다.
결과는 일관된 과잉 열의 패턴을 드러냈다. 모델들은 너무 자주 "예"라고 답하는 경향이 있었다. 꼭 필요한 직접적인 연결만을 가진 희소한 지도를 그리는 대신, 모델들은 거의 모든 것이 서로 직접 연결된 것처럼 보이는 조밀한 그물망을 만들어냈다. 이러한 행동은 매우 강력해서 연구자들이 질문하는 방식을 다르게 시도하더라도 모델들이 더 선택적으로 변하도록 쉽게 훈련되지 않았다. 모델들은 두 사물이 연관되어 있다는 점은 올바르게 식별했지만, 직접적인 원인과 간접적인 원인을 구별하는 데는 실패했다. 예를 들어, 바이러스가 감염을 일으키고 그 감염이 열을 일으킨다면, 모델은 종종 중간 단계를 무시하고 바이러스가 열을 직접적으로 일으킨다고 주장하곤 했다. 이러한 오류는 관계가 간접적인 경우 약 40%에서, 방향이 반대인 경우 약 36%에서 발생했다.
아마도 가장 우려스러운 발견은 모델들의 자기 인식 결여였다. 모델들이 구조적 오류를 범했을 때, 그들은 주저하지 않았다. 간접적으로 관련된 항목들 사이에 직접적인 연결이 존재한다고 잘못 주장한 사례 중 80% 이상의 경우에서, 모델들은 최소 80% 이상의 확신 점수를 부여했다. 그들은 단순히 추측하는 것이 아니라, 확신에 차서 틀리고 있었다. 연구는 또한 모델이 자신의 확신 점수를 바탕으로 올바른 추측과 틀린 추측을 구분할 수 있는지 조사했다. 연구자들은 모델이 스스로 부여한 확신 수치가 흔히 신뢰할 수 없다는 것을 발견했다. 모델은 90% 확신한다고 말할 수도 있지만, 그 숫자는 실제로 답변이 맞는지 여부와 상관관계가 없었다. 유일하게 약간의 개선을 보인 방법은 모델에게 같은 질문을 다양한 방식으로 던져 서로 얼마나 동의하는지 확인하는 것이었으나, 이 방법조차 완벽한 해결책은 아니었다.
연구자들은 모델들이 이전에 보았던 테스트 질문들을 단순히 암기하고 있는 것인지도 조사했다. 특정 의료 질환과 관련된 하나의 데이터셋에 대해서는 여러 모델이 의심스러울 정도로 높은 성능을 보였는데, 이는 모델들이 훈련 과정에서 해당 데이터를 보았을 가능성을 시사했다. 그러나 이러한 친숙함이 나머지 5개의 데이터셋에서의 저조한 성능을 설명해주지는 못했는데, 모델들은 여전히 동일한 유형의 오류로 고전했기 때문이다. 연구자들이 모델들에게 단순히 두 가지 선택지가 아닌 세 가지 옵션(직접 원인, 역방향 원인, 혹은 직접적인 연결 없음) 중에서 선택하도록 강제했을 때도, 모델들의 성능은 유의미하게 개선되지 않았다. 모델들은 여-전히 존재하지 않는 직접적인 연결을 예측했으며, 이는 문제가 단순히 질문 방식의 결함이 아니라, 이러한 시스템이 인과관계를 이해하는 방식의 근본적인 한계임을 입증했다.
궁극적으로, 이 연구는 대규모 언어 모델이 아이디어를 생성하는 강력한 도구이기는 하지만, 세상이 작동하는 방식에 대한 결정적인 증거로 취급되어서는 안 된다고 결론짓는다. 이들은 확정적인 답이라기보다는, 다른 방법들에 의해 검증되고 확인되어야 할 출발점으로서의 '부드러운 제안'의 원천으로 보는 것이 더 적절하다. 모델들은 두 사물이 연관되어 있을 가능성이 높다는 점은 말해줄 수 있지만, 스스로 정밀한 인과 지도의 선을 그을 만큼 신뢰할 수는 없다. 모델이 표현하는 확신은 진실에 대한 진정한 척도라기보다 그들의 훈련 데이터의 반영인 경우가 많다. 정밀한 인과 기제를 이해해야 하는 과학자와 엔지니어들에게, 이 모델들에만 의존하는 것은 모든 거리와 모든 거리가 서로 연결된 지도를 가지고 복잡한 도시를 항해하는 것과 같다. 그 지도는 포괄적으로 보일 수는 있겠지만, 당신을 길을 잃게 만들 것이다. 앞으로 나아갈 길은 이 모델들을 사용하여 가설을 생성하고, 그 가설을 엄격하게 테스트하는 것이지, 모델의 확신에 찬 판단을 최종적인 답으로 받아들이는 것이 아니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.