The Riddle Riddle: Testing Flexible Reasoning in Large Language Models and Humans
이 논문은 인간은 문제 내용에 따라 추론 전략을 유연하게 조정하는 반면, 대규모 언어 모델은 종종 패턴 매칭과 표면적 특징에 의존하여 문자 그대로의 문제에 부적절하게 창의적 추론을 적용하며, 이로 인해 실제 수수께끼에서 보여주는 강력한 성능이 유연한 추론보다는 기억 회상에서 비롯되었을 수 있음을 입증하기 위해 "수수께끼 수수께끼(riddle riddle)" 패러다임을 도입한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 퍼즐을 풀어야 하는 게임을 하고 있다고 상상해 보세요. 어떤 퍼즐은 틀을 깨는 사고를 요구하는 까다로운 수수께끼인 반면, 다른 퍼즐들은 수수께끼처럼 보이지만 실제로는 단순한 수학 문제인 경우도 있습니다.
이 논문은 인공지능(대규모 언어 모델)이 인간과 비교했을 때 실제로 얼마나 똑똑한지를 테스트하는 새로운 방법을 소개합니다. 그들은 이를 "리들 리들(Riddle Riddle, 수수께끼 수수께끼)" 패러다임이라고 부릅니다.
연구진이 수행한 내용과 발견한 사실을 다음과 같이 간단히 정리했습니다.
설정: "트릭" vs "문자 그대로"
연구진은 겉보기에는 거의 동일해 보이는 두 가지 유형의 질문을 만들었습니다.
- 진짜 수수께끼 (트릭이 있는 경우):
- 예시: "한 카우보이가 금요일에 마을로 들어와서 3일 동안 머물다가 금요일에 떠났습니다. 이것이 어떻게 가능할까요?"
- 정답: "Friday"가 요일이 아니라 말(horse)의 이름이라는 것을 깨달아야 합니다. 이는 창의적인 사고를 요구합니다.
- "리들 리들" (문자 그대로인 경우):
- 예시: "한 카우보이가 금요일에 마을로 들어와서 3일 동안 머물다가 월요일에 떠났습니다. 이것이 어떻게 가능할까요?"
- 정답: 이것은 단순한 수학 문제입니다. 금요일 + 3일 = 월요일. 트릭이 필요 없습니다. 이는 문자 그대로의 사고를 요구합니다.
핵심은 두 질문의 형태가 같다는 점입니다. 문장 구조와 리듬이 동일합니다. 유일한 차이점은 트릭이 실제로 필요한지 여부입니다.
실험
연구진은 두 그룹에게 이 문제들을 풀게 했습니다.
- 그룹 1: 현재 사용 가능한 가장 똑똑한 AI 모델 9개 (GPT-5, Claude, Gemini 등).
- 그룹 2: 성인 인간 100명.
결과: 완벽한 역전
결과는 마치 거울을 보는 것 같았지만, 그 반영이 뒤집혀 있었습니다.
1. AI의 행동: "먼저 짐작하는" 해결사
AI 모델들은 진짜 수수께끼에는 매우 뛰어났지만(85% 정답), 리들 리들에는 어려움을 겪었습니다(정답률 50%에 불로 그침).
- 무슨 일이 일어났나: AI는 질문이 수수께끼처럼 보이면 즉시 "아, 이건 트릭이 있겠구나! 창의적이고 틀을 깨는 사고를 해야 해"라고 가정했습니다.
- 실수: 질문이 단순한 수학 문제일 때조차(리들 리들), AI는 여전히 숨겨진 트릭을 찾으려 했습니다. 이는 마치 잠긴 문을 보고 바로 비밀 통로가 있을 것이라고 단정 짓는 탐정과 같습니다. 문이 그냥 열려 있고 잠기지도 않았는데도 말이죠. AI는 수수께끼에는 트로가 있다는 것에 너무 익숙해져서, 트릭을 찾아보는 것을 멈출 수 없었습니다.
2. 인간의 행동: "문자 그대로 우선" 해결사
인간은 정반대의 패턴을 보였습니다. 인간은 리들 리들에는 뛰어났지만(80% 정답), 진짜 수수께끼에는 어려움을 겪었습니다(50% 정답).
- 무슨 일이 일어났나: 인간은 자연스럽게 문자 그대로 받아들이는 경향이 있습니다. "금요일 + 3일 = 월요일"이라는 질문을 보았을 때, 그들은 즉시 문제를 해결했습니다.
- 실수: 진짜 수수께끼(말 이름이 Friday인 경우)를 마주했을 때, 인간은 종종 "잠깐, 금요일은 요일인데, 이건 불가능해!"라며 막혔습니다. 인간은 트릭을 찾아내기 위해 문자 그대로의 사고를 극복하기 위해 더 많이 노력해야 했습니다.
핵심 요점
이 논문은 AI가 아직 유연하게 "추론"하는 것은 아니라고 주장합니다.
- 인간은 유연하지만 게으릅니다. 인간은 단순하고 문자 그대로의 답을 선호하며, 막혔다고 느낄 때만 "창의 모드"로 전환합니다.
- AI는 그 반대입니다. AI는 "수수께끼 같은 구조 = 창의적인 답변"이라는 것을 암기했습니다. AI는 창의적인 답변이 정말로 필요한지를 확인하지 않고, 질문의 형태를 보고 자동으로 "창의적 도구 상자"를 꺼냅니다.
이들은 이를 **"추론의 환상(Illusion of Reasoning)"**이라고 부릅니다. 시각적 착시 그림에서 선의 길이가 실제로는 다르더라도 착시를 느끼는 것처럼, AI는 문제가 단순한 수학 문제일 때조차 수수께끼의 트릭을 "봅니다".
결론
논문은 AI가 유명한 수수께끼를 맞힐 수는 있지만, 그것은 단순히 기억을 되살려 읊는 것이거나 엄격한 규칙("수수께끼처럼 보이면 트릭을 써라")을 따르는 것일 수 있다고 결론짓습니다. AI는 "이 문제가 정말로 트릭이 필요한가, 아니면 그냥 정상적으로 풀 수 있는가?"라고 스스로 멈춰서 질문하는 인간의 기술을 아직 배우지 못했습니다.
요약하자면: AI는 상자에 "수수께끼"라는 라벨이 붙어 있기만 하면, 설령 그 상자가 비어 있을지라도 언제든 상자 밖으로 생각하려 합니다. 인간은 보통 상자 안에 머물다가, 꼭 필요할 때만 밖을 내다봅니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.