CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps
이 논문은 모델의 파라미터 지식에 대한 의존을 제거하기 위한 반사실적 연쇄(counterfactual chains)와 지름길 활용을 방지하기 위한 방해 요소(distractor traps)를 채택함으로써 대규모 언어 모델의 멀티홉 추론 능력을 엄격하게 평가하도록 설계된 새로운 데이터셋인 CRiT-QA를 소개하며, 이를 통해 표준 벤치마크와 비교하여 유의미한 성능 격차를 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 마치 돋보기 대신 거의 모든 책을 읽은 초지능 로봇 친구를 데리고 '탐정'이라는 고난도 게임을 하고 있다고 상상해 보세요. 당신은 로봇에게 "영화 UHF를 배급한 회사를 설립한 사람은 누구인가?"와 같은 미스터리를 해결하라고 과제를 줍니다.
옛날에는, 만약 당신이 로봇에게 이 미스터리를 풀기 위해 종이 뭉치(즉, "문맥")를 주었다면, 로봇은 종이를 완전히 무시하곤 했습니다. 로봇은 눈을 감고, 훈련 과정에서 학습한 방대한 지식 창고에서 정보를 꺼내어 "마이크 메다보이(Mike Medavoy)!"라고 외쳤을 것입니다. 정답은 맞혔지만, 당신이 준 단서들을 실제로 읽지 않고 속임수를 쓴 것이죠. 이는 마치 학생이 교과서의 해당 장을 읽는 대신 머릿속에 암기한 답을 써서 역사 시험을 통과하는 것과 같았습니다.
또 다른 경우에는, 로봇이 읽으려고 시도는 하지만 게으른 지름길을 택하기도 했습니다. 만약 질문이 "마크 디스모어(Mark Dismore)의 출생지는 어느 카운티인가?"라고 물었는데 첫 번째 단락에 "행콕 카운티(Hancock County)"라는 말이 나왔다면, 로봇은 질문에 포함된 "카운티"라는 단어와 일치한다는 이유만으로 그 단어를 덥석 잡아버렸을 것입니다. 여러 단락 사이의 연결 고리를 찾아 진짜 출생지를 찾는 어려운 과정을 건너뛴 것이죠. 이는 마치 미로의 탈출구를 찾기 위해 실제로 길을 걷는 대신, 벽의 색깔만 보고 출구를 짐작하여 문제를 푸는 것과 같았습니다.
대반전
윤정민(JungMin Yun)과 동료 연구자들은 이 "탐정" 게임의 훨씬 더 강력하고 까다로운 버전인 CRiT-QA를 구축하기로 했습니다. 그들의 주요 발견은, 최고의 로봇들을 이 새로운 까다로운 게임에 투입했을 때 로봇들의 성능이 폭락했다는 것입니다. 평소 높은 성적을 받던 GPT-4o나 Gemini-2.5-Pro와 같은 최첨단 모델들조차 갑자기 어려움을 겪었습니다. 그들은 "A+" 학생에서 겨우 낙제를 면하는 수준으로 떨어졌으며, 이는 그들의 이전 성공이 사실 빛의 착각이었음을 증명했습니다.
그들이 로봇을 속인 방법
로봇을 현장에서 잡기 위해, 연구진은 두 가지 영리한 함정을 사용했습니다:
"만약에" 함정 (Counterfactuals/역사실적 상황): 로봇의 기억 속에 "하늘은 파랗다"라고 되어 있다고 가정해 봅시다. 하지만 새로운 게임에서는 연구진이 이야기를 다시 써서, "이 특정 세계관에서는 하늘이 사실 초록색이다"라고 설정했습니다. 만약 로봇이 자신의 기존 기억에 의존한다면, "파란색"이라고 답하여 실패할 것입니다. 승리하려면 로봇은 자신의 기억을 무시하고 제공된 새롭고 이상한 이야기를 엄격히 따라야 합니다. 연구진은 실제 사실을 이러한 "만약에" 시나리오로 바꿨을 때 모델들이 혼란을 겪는다는 것을 발견했습니다. 예를 들어, Qwen2.5-7B라는 모델은 일반적인 테스트에서의 점수가 34.96이었으나, 가짜 사실에 직면했을 때는 24.77로 떨어졌습니다.
"가짜 단서" 함정 (Distractors/방해 요소): 이것은 눈 위에 가짜 발자국을 잔뜩 남겨두는 것과 같습니다. 연구진은 정답처럼 보이는 추가 단락들을 삽로 넣었습니다. 이 단락들은 사람의 이름이나 위치와 같은 올바른 유형의 단어들을 포함하고 있었지만, 잘못된 답으로 유도했습니다. 이는 보물이 있는 것처럼 보이는 열 개의 서로 다른 경로가 그려진 지도와 같으며, 그중 단 하나만이 진짜인 상황입니다. 지름길을 이용하는 데 익숙한 로봇들은 이 소음 속에서 길을 잃었습니다. 연구진이 이 "만약에" 이야기들에 가짜 단서들을 추가하자, 점수는 더욱 급락했습니다. Qwen2.5-7B의 점수는 19.30까지 곤두박질쳤습니다.
단계가 많아질수록 더 어려워진다
연구진은 또한 무서운 사실을 발견했습니다. 단서의 사슬이 길어질수록 로봇의 성능은 악화되었습니다.
- 2-hop 질문 (두 단계를 거쳐 해결해야 하는 문제)은 괜찮았습니다.
- 3-hop 질문 (세 단계)은 더 어려워졌습니다.
- 4-hop 질문 (네 단계)은 재앙이었습니다.
예를 들어, 오픈 소스 모델인 LLaMA-3-8B는 2단계 질문에서는 28.91의 정확도를 보였지만, 4단계 질문에서는 10.18로 폭락했습니다. 이는 마치 로봇이 간단한 퍼즐은 풀 수 있지만, 퍼즐 조각이 몇 개 더 늘어나면 게임을 하는 법 자체를 잊어버리는 것과 같습니다. 연구진은 2-hop, 3-hop, 4-hop 질문에 대해 테스트함으로써 이를 측정했으며, 결과는 추론이 깊어질수록 성능이 일관되게 하락함을 보여주었습니다.
이것이 의미하는 바 (그리고 의미하지 않는 것)
이 논문은 로봇들이 영원히 "고장 났다"고 말하는 것이 아닙니다. 대신 우리가 그들에게 너무 관대했다는 점을 시사합니다. 우리는 그들이 기억력을 사용하거나 패턴을 짐작하여 속임수를 쓸 수 있는 테스트를 주어왔습니다. 이 새로운 CRiT-QA 데이터셋은 "암기하지 마라, 짐작하지 마라. 오직 내가 준 단서만을 사용하여 단계별로 과정을 보여달라"라고 말하는 엄격한 선생님과 같습니다.
저자들은 매우 확신하고 있습니다: 그들은 점수를 측정했고, 실험을 수행했으며, 숫자가 떨어지는 것을 목격했습니다. 그들은 단순히 로봇이 약하다고 추측하는 것이 아니라, 데이터를 통해 이를 증명했습니다. 그러나 그들은 또한 이 새로운 테스트가 하나의 특정 유형의 퍼즐(MuSique 데이터셋)을 기반으로 구축되었기에, 이것이 세상의 모든 종류의 질문에서도 발생하는지는 아직 알 수 없다고 인정했습니다. 또한, 가짜 단서를 작성하는 데 다른 로봇을 사용했기 때문에, 로봇이 "로봇의 필체"를 알아채고 이를 새로운 지름길로 사용할 아주 작은 가능성이 있으며, 이는 향후 해결해야 할 과제라고 언급했습니다.
결론
현재 많은 똑똑한 AI 모델들은 대본을 이해하는 것이 아니라 대본을 암기한 배우와 같습니다. 대본이 약간만 바뀌거나 무대에 가짜 소품이 채워지면 그들은 얼어붙습니다. CRiT-QA는 그들에게 실제로 대본을 읽고 생각하게 만드는 새로운 무대이며, 그들의 강력한 힘에도 불구하고 진정한 탐정처럼 추론하기까지는 아직 갈 길이 멀다는 것을 증명합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.