← 최신 논문
💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

이 논문은 단어 중복, 사전 학습된 지식, 그리고 고유 명사를 통제함으로써 LLaMA 2와 Flan-T5가 진정한 이행적 추론을 수행하는지 아니면 피상적인 단서에 의존하는지를 조사하며, 두 모델 모두 어휘적 중복을 활용하지만 Flan-T5가 지식 기반 조작에 대해 더 높은 회복력을 보인다는 점을 밝혀내어, 미세 조정이 논리적 이해를 발달시키는 데 잠재적인 역할을 할 수 있음을 시사한다.

원저자: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

게시일 2026-09-10
📖 4 분 읽기☕ 가벼운 읽기

원저자: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

급속도로 발전하는 인공지능 분야에서, 대규모 언어 모델(Large Language Model)로 알려진 특정 유형의 컴퓨터 프로그램이 전 세계의 주목을 받고 있습니다. 인터넷의 방대한 텍스트를 학습한 이 시스템들은 이야기를 쓰고, 언어를 번역하며, 복잡한 질문에 답할 수 있습니다. 이 기계들을 연구하는 과학자들에게 핵심적인 질문은, 이들이 진정으로 논리를 이해하는 것인지 아니면 단순히 이전에 보았던 패턴을 흉내 내는 것인지 하는 점입니다. 이를 테스트하기 위해 연구자들은 '이행적 추론(transitive reasoning)'이라 불리는 근본적인 기술을 살펴봅니다. 일상적인 용어로 이는 두 개의 분리된 정보를 연결하여 새로운 결론에 도달하는 능력을 의미합니다. 예를 들어, 어떤 사람이 고양이가 동물의 한 종류라는 것을 알고, 모든 동물이 먹이를 필요로 한다는 것을 안다면, 그들은 고양이가 먹이를 필요로 한다는 구체적인 사실을 직접 듣지 않고도 논리적으로 추론할 수 있습니다. 이 과정은 단순한 기억력 그 이상을 요구합니다. 즉, 사실들을 엮어내는 능력을 필요로 합니다. 최근 연구를 이끄는 질문은, 이 강력한 컴퓨터 프로그램들이 실제로 이러한 정신적 엮기(mental weaving)를 수행하고 있는 것인지, 아니면 익숙한 단어를 포착하여 답을 추측하는 지름길을 택하고 있는 것인지 하는 것입니다.

헤리엇-와트 대학교(Heriot-Watt University)와 에든버러 대학교(University of Edinburgh)의 연구팀은 바로 이 문제를 조사하기 위해 나섰습니다. 그들은 두 가지 서로 다른 유형의 언어 모델인 LLaMA 2와 Flan-T5에 초점을 맞추어, 이 모델들이 두 사실을 연결해야 하는 질문을 어떻게 처리하는지 살펴보았습니다. 과학자들은 이러한 종류의 사고를 테스트하기 위해 설계된 두 가지 기존 질문 모음을 사용했습니다. QASC라고 알려진 한 컬렉션은 두 문장을 결합하여 정답을 찾아야 하는 과학 관련 객관식 질문을 제시합니다. 또 다른 컬렉션인 Bamboogle는 일반적인 인터넷 검색 엔진이 틀릴 만큼 까다로운 질문들을 포함하고 있어, 모델이 자신의 처리 능력에 의존하도록 만듭니다. 연구자들은 모델들이 단계별로 진정으로 추론하는 것인지, 아니면 질문과 정답에 모두 등장하는 날짜나 이름 같은 특정 단어들에 매달리는 것인지를 알고 싶었습니다.

진실을 밝히기 위해, 연구팀은 모델에게 주어진 정보를 체계적으로 변경하는 일련의 영리한 실험들을 설계했습니다. 그들은 먼저 모델에게 사실과 이를 연결하는 명확한 예시를 함께 제공했을 때 모델이 문제를 해결할 수 있는지 확인했습니다. 두 모델 모두 이러한 조건 하에서는 잘 수행했습니다. 하지만 연구자들은 이것이 너무 쉬운 방식일 수 있다고 의심했습니다. 그 후, 그들은 사실을 연결하는 방법에 대한 예시를 제거하여 모델이 스스로 이를 파악하도록 남겨두었습니다. 결과는 시사하는 바가 컸습니다. 유사한 추론 작업에 대해 특별히 훈련된 Flan-T5 모델은 예시 없이도 계속해서 매우 우수한 성능을 보였습니다. 반면, LLaMA 2 모델은 그러한 안내 없이는 상당히 어려움을 겪었는데, 이는 이 모델이 추론의 패턴을 따르기 전에 그 패턴을 먼저 보는 것에 크게 의존하고 있음을 시사했습니다.

연구자들은 모델들이 단어의 의미를 진정으로 이해하고 있는지 알아보기 위해 더 극단적인 접근 방식을 취했습니다. 그들은 사실 내의 단어 순서를 뒤섞어, 명확한 문장을 엉망이고 무의미한 텍스트의 나열로 만들었습니다. 만약 모델들이 의미에 대해 추론하고 있다면, 이 혼란은 정답을 찾는 것을 불가능하게 만들어야 했습니다. 놀랍게도 모델들의 성능은 거의 떨어지지 않았습니다. 그들은 문장이 문법적으로 말이 되지 않음에도 불구하고 여전히 정답을 선택할 수 있었습니다. 이는 모델들이 문장을 일관된 생각으로 읽고 있는 것이 아님을 시사했습니다. 대신, 그들은 정답 선택지와 일치하는 특정 키워드를 스캔하고 있었던 것입니다. 연구자들이 그 일치하는 키워드들을 완전히 제거했을 때, 모델들의 정확도는 급락했으며, 이는 그들이 종종 논리적 추론보다는 단어 매칭을 하고 있었다는 것을 확인시켜 주었습니다.

모델들이 훈련 데이터에서 정답을 단순히 암기했을 가능성을 배제하기 위해, 연구팀은 모델들이 이전에 본 적 없는 질문들이 담긴 Bamboogle 데이터셋을 활용했습니다. 여기서 그들은 마지막으로 엄격한 테스트를 도입했습니다. 그들은 정답에 자주 등장하는 구체적인 개체들인 사람, 장소, 날짜의 이름을 무의미한 단어들로 교체했습니다. 또한 사실 내의 단어 순서도 뒤섞었습니다. 모델들이 이러한 난해한 버전들과 마주했을 때, LLaMA 2 모델은 거의 완전히 실패했습니다. 그 모델은 자신을 안내할 익숙한 이름이나 날짜 없이는 답을 찾을 수 없었습니다. 그러나 Flan-T5 모델은 다른 종류의 회복력을 보여주었습니다. 성능이 떨어지기는 했지만, 다른 모델보다 훨씬 더 나은 수준을 유지했습니다. 이는 Flan-T5가 추론 작업에 대해 명시적으로 훈련되었기 때문에, 익숙한 단서들이 제거되었을 때도 논리적 사슬을 따라가는 더 견고한 능력을 발달시켰음을 시사합니다.

이 연구는 대규모 언어 모델이 추론하는 것처럼 보일 수 있지만, 그 성공은 종로 흔히 훈련 방식과 텍스트에 존재하는 단서들에 달려 있다는 결론을 내립니다. 추론 작업에 대해 미세 조정(fine-tuning)되지 않은 모델들의 경우, 복잡한 질문에 답하는 능력은 진정한 논리적 연역보다는 익숙한 단어와 패턴을 인식하는 것에 크게 의존하는 것으로 보입니다. 심지어 단계별로 생각하는 것처럼 보일 때조차, 그들은 단순히 올바른 키워드를 찾아내고 있는 것일 수 있습니다. 그러나 이 연구는 모델이 사실을 연결하는 법을 가르치기 위해 설계된 데이터셋을 통해 주의 깊게 훈련될 때, 더 진정한 의미의 이행적 추론 능력을 발달시킬 수 있음을 시사합니다. 이러한 능력은 일반적인 지름길인 인식 가능한 이름이나 날짜가 제거되었을 때도 질문을 처리할 수 있게 해줍니다. 이 연구 결과는 추론 테스트에서의 높은 점수가 항상 기계가 논리를 이해한다는 것을 증명하는 것은 아니며, 때로는 그저 적절한 단어를 찾는 데 매우 능숙한 것일 뿐이라는 점을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →