← 최신 논문
💬 NLP

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

본 논문은 위키데이터에 지원 지식이 존재함에도 불구하고 현재 대규모 언어 모델들이 인과적 상식 추론 및 가설적 설명 능력에서 상당한 한계를 드러내는 것을 규명하는 15,000 개의 엔티티 기반 "왜" 질문으로 구성된 데이터셋인 CommonWhy 를 소개합니다.

원저자: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 매우 똑똑하고 독서량이 풍부한 로봇 비서가 있다고 가정해 봅시다. 당신은 그에게 "해리 포터가 날 수 있다는 것이 사실인가?"나 "아리스토텔레스가 노트북을 소유하고 있었는가?"와 같은 수천 가지 질문을 해왔습니다. 로봇은 방대한 사실 도서관을 스캔하여 답을 찾아낼 수 있기 때문에, 이러한 "예" 또는 "아니오" 질문에 답하는 데 매우 능숙해졌습니다.

하지만 이제, 로봇에게 훨씬 더 까다로운 질문을 해본다고 상상해 보세요: "카타리나 바를리가 2024 년 챔피언스리그 결승전을 관람하기 위해 비자가 필요하지 않았던 이유는 무엇인가?"

이 지점에서 로봇은 비틀거리기 시작합니다. 이것이 바로 CommonWhy 논문이 해결하려는 문제입니다.

문제: 로봇이 "점들을 연결"하지 못함

저자들은 로봇이 사실 검색(책에서 특정 사실을 찾는 것) 에는 뛰어나지만, 인과 추론(상식과 다양한 사실을 연결하여 어떤 일이 발생했는지 파악하는 것) 에는 형편없다고 주장합니다.

이렇게 생각해 보세요:

  • 사실 검색은 전화번호부에서 전화번호를 찾아보는 것과 같습니다.
  • 인과 추론은 탐정이 되는 것과 같습니다. 당신은 전화번호를 확인하고, 그 사람이 다른 나라에 산다는 것을 깨닫고, 그 나라가 그 사람의 모국과 비자 면제 협정을 맺고 있음을 기억한 다음, "아, 그래서 비자가 필요 없었던구나!"라고 결론 내려야 합니다.

현재의 로봇들은 종종 이러한 탐정 작업을 해내지 못합니다. 그들은 답을 추측하거나, 사실을 지어내거나 (환각), 훈련 데이터에 단일 문장으로 기록되어 있지 않기 때문에 그냥 막히곤 합니다.

해결책: 새로운 "탐정 시험"

연구자들은 CommonWhy라는 새로운 데이터셋을 만들었습니다. 이는 로봇들이 사물의 발생 원인을 파악하는지 얼마나 잘 테스트하도록 설계된 거대한 15,000 개 질문의 "탐정 시험"이라고 생각하시면 됩니다.

그들이 이 시험을 만든 방법은 다음과 같습니다:

  1. 규칙 (공리): 먼저, AI 에게 "A 국의 시민이고, B 국이 A 국 시민의 비자 없이 방문을 허용한다면, 비자가 필요하지 않다"와 같은 세계의 기본 규칙을 제공했습니다.
  2. 캐릭터 (개체): 그들은 Wikidata(구조화된 데이터를 위한 위키피디아와 같은 거대한 데이터베이스) 에서 실제 사람, 장소, 사건을 가져왔습니다.
  3. 질문: 그들은 규칙과 캐릭터를 혼합하여 질문을 만들었습니다. 예를 들어: "Person XEvent Y로 가는 데 비자가 필요하지 않았던 이유는 무엇인가?"
  4. 답변: 결정적으로, 그들은 하나의 정답만 찾지 않았습니다. 현실 세계에서는 종종 여러 가지 이유가 존재합니다. 아마도 Person X 가 주최국 시민이라서 비자가 필요 없었을 수도 있고, 혹은 외교관이라서 필요 없었을 수도 있습니다. 데이터셋에는 이러한 모든 유효한 가능성들이 포함되어 있습니다.

결과: 로봇들이 시험에 낙제함

연구자들은 최신 "추론" 모델을 포함한 오늘날 이용 가능한 가장 똑똑한 AI 모델들을 이 시험으로 테스트했습니다. 결과는 놀랍고 다소 우려스러웠습니다:

  • 막혔습니다: 최고의 모델조차도 정답의 약 68% 만 맞췄습니다. 이는 초지능 시스템으로 기대되는 것에 있어서는 낙제점입니다.
  • 사실을 지어냈습니다: 모델들이 결국 정답을 맞췄을 때조차, 종종 그 과정에 가짜 사실을 포함시켰습니다. 마치 학생이 수학 문제를 정답으로 풀었지만, 이를 위해 지어낸 공식을 사용한 것과 같습니다.
  • "롱테일" 문제: 로봇들은 잘 알려지지 않은 드문 사람이나 장소가 포함된 질문 ("롱테일") 일 때 더 나빴습니다. 그들은 논리를 실제로 추론하기보다는 유명한 사실들을 암기하는 데 의존하는 것처럼 보였습니다.
  • 구식 도구는 작동하지 않음: 그들은 데이터베이스 질문용 (KGQA) 표준 도구를 사용해 보았지만, 그 도구들은 처참하게 실패했습니다. 그들은 사실을 찾는 데는 설계되었지, 사물이 발생하는지 설명하는 데는 설계되지 않았습니다.

큰 그림

이 논문은 AI 에게 새로운 매우 어려운 과제가 있다고 결론 내립니다. 우리는 더 이상 로봇에게 사실을 암기하거나 단순한 "참/거짓" 질문에 답하도록 요구할 수만은 없습니다. 우리가 로봇들이 현실 세계와 효과적으로 상호작용하기를 원한다면, 그들에게 탐정이 되는 법, 즉 단단한 사실과 상식을 결합하여 세계가 작동하는 방식을 설명하는 법을 가르쳐야 합니다.

CommonWhy는 로봇들이 실제로 이런 종류의 사고 능력을 향상시키고 있는지, 아니면 단순히 추측을 더 잘하고 있는지 측정할 수 있는 최초의 도구입니다. 현재 논문에 따르면, 그들은 대부분 단지 추측하고 있을 뿐입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →