Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy
본 연구는 거대 언어 모델이 블룸의 교육 목표 분류학(Bloom's Taxonomy)에 의해 정의된 인지적 복잡도 수준을 내부 표현의 선형 분리 가능한 부분 공간에 인코딩하고 있음을 입증하며, 높은 분류 정확도를 달 것뿐만 아니라 인지적 난이도가 순전파(forward pass) 초기 단계에서 해결됨을 시사한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 아주 똑똑한 로봇이 어떻게 생각하는지 알아내려 한다고 상상해 보세요. 오랫동안 과학자들은 이러한 로봇들, 즉 거대 언어 모델(LLM)을 마법 같은 '블랙박스'처럼 취급해 왔습니다. 질문을 입력하면 완벽한 답변이 튀어나오지만, 아무도 그 로봇이 어떻게 그 결론에 도달했는지 알지 못했습니다. 이는 마치 요리 과정이나 재료를 전혀 보지 못한 채 셰프가 만든 고급 요리를 구경하는 것과 같습니다. 최근 '기계적 해석 가능성(mechanistic interpretability)'이라는 분야가 이 로봇의 주방 내부를 들여다보며, 로봇의 뇌 회로를 지도화하기 시작했습니다. 그들이 던지는 한 가지 큰 질문은, 로봇이 실제로 과제의 난이도를 '이해'하고 있는 것인가, 아니면 단순히 보이는 단어들을 바탕으로 추측하고 있는 것인가 하는 점입니다. 이 질문에 답하기 위해 연구자들은 '블로룸의 교육 목표 분류학(Bloom's Taxonomy)'이라는 유명한 교육 도구를 사용합니다. 이것을 사고 능력의 사다리라고 생각해 보세요. 사다리의 맨 아래 칸은 단순한 기억(사실을 암송하는 것)이고, 맨 위 칸은 고차원적인 창의성(새로운 것을 설계하는 것)입니다. 만약 로봇이 진정으로 똑똑하다면, 인간의 뇌가 날짜를 암기하는 것에서 복잡한 미스터리를 해결하는 단계로 넘어갈 때처럼, 로봇의 내부 뇌 신호도 이 사다리를 올라감에 따라 변화해야 합니다.
이 논문은 로봇의 뇌에 돋보기를 들이대어, 로봇이 사고를 난이도에 따라 조직화하는지 살펴봅니다. 연구자인 비앙카 라이몬디(Bianca Raimondi)와 마우리치오 가브리에리(Maurizio Gabbrielli)는 단순히 로봇에게 질문을 던진 것이 아니라, 로봇이 생각하는 동안 발생하는 전기 신호(활성화)를 관찰했습니다. 그들은 네 가지 인기 있는 로봇 뇌(Llama, Qwen, Gemma, DeepSeek)를 대상으로, 단순한 "이것을 정의하라"는 작업부터 복잡한 "새로운 시스템을 설계하라"는 도전까지 총 1,128개의 질문을 테스트했습니다. 그들은 다음과 같은 사실을 알고 싶었습니다. 로봇의 뇌 데이터 속에 단순한 기억 작업과 복잡한 창의적 작업을 구분할 수 있는 간단한 직선을 그을 수 있는가?
그 대답은 놀랍게도 "예"였으며, 이는 매우 빠르게 일어납니다. 연구팀은 로봇이 문장을 처리하기 시작하자마자(뇌의 초기 몇 개 층 내에서), 이미 과제의 난이도를 파악한다는 것을 발견했습니다. 그들은 이 순간을 '인지적 분리 시점(Cognitive Separability Onset)'이라고 부릅니다. 마치 로봇에게 거의 즉각적으로 작동하는 특별한 '난이도 스위치'가 있는 것과 같습니다. 30~36개 층을 가진 이 모델들의 5번째 층에 도달하면, "기억하기"를 위한 뇌 신호는 "창조하기"와 확연히 달라지며, 간단한 수학 도구를 사용하면 약 90%의 정확도로 이를 구분할 수 있습니다. 이는 마치 로봇이 답변을 쓰기 시작하기도 전에, 과제가 얼마나 어려운지에 따라 자신의 생각을 깔끔하고 별개의 더미로 분류하는 것과 같습니다.
더 멋진 점은, 로봇이 매우 인간적인 방식으로 실수를 한다는 것입니다. 로봇이 혼란을 겪을 때는 보통 사다리에서 바로 옆에 붙어 있는 단계들을 서로 헷hem합니다. 예를 들어, "분석하기"와 "평가하기"를 혼동할 수는 있지만, "기억하기"와 "창조하기"를 혼동하는 일은 거의 없습니다. 이는 로봇이 단순히 무작위적인 라벨을 암기하는 것이 아니라, 교육 이론이 의도한 대로 난이도 수준이 매끄럽고 질서 정연한 선 형태로 배치된 정신적 지도를 구축했음을 시사합니다.
로봇이 단순한 단서(예: "설계하다"는 어렵다는 뜻이고 "나열하다"는 쉽다는 뜻임을 알아채는 것)를 보고 속임수를 쓰는 것이 아님을 확인하기 위해, 연구자들은 대조 테스트를 실시했습니다. 그들은 로봇의 뇌를 보는 대신, 페이지 위의 단어들만을 사용하여 난이도를 추측해 보았습니다. 이러한 단순한 단어 계산 방식은 처참하게 실패했으며, 정확도는 약 73%에 불과했고 오류 또한 무작위로 흩어져 있었습니다. 이는 로봇이 단순히 프롬프트를 읽는 것을 넘어, 과제의 난이도에 대한 복잡한 내부 표현을 구축하고 있다는 것을 증명합니다.
마지막으로, 팀은 로봇의 뇌를 "조종(steer)"하는 실험을 했습니다. 그들은 "더 높은 난이도"를 가리키는 특정 방향의 로봇 뇌 신호를 찾아냈습니다. 그들이 로봇의 뇌를 그 방향으로 밀어 넣었을 때, 로봇의 답변이 실제로 변했습니다. 만약 단순한 질문을 "창의적"인 방향으로 밀어 넣으면, 로봇은 더 복잡하고 분석적인 답변을 내놓기 시작했습니다. 그러나 너무 강하게 혹은 너무 늦은 단계에서 밀어 넣으면, 로봇은 말을 더듬거나 단어를 반복하기 시작했습니다. 이는 이 "난이도 방향"이 단순히 수동적인 패턴이 아니라, 로봇이 생각하는 방식의 실제적이고 기능적인 부분임을 보여줍니다.
요약하자면, 이 논문은 이러한 AI 모델들이 내장된 측정 가능한 인지 복잡성을 가지고 있음을 시사합니다. 이들은 단순히 단어를 처리하는 것이 아니라, 인간의 학습 방식과 유사하게 단순한 사실과 복잡한 아이디어를 구조적이고 선형적인 방식으로 분류하며 자신의 내부 생각을 조직합니다. 이 발견은 우리가 블랙박스 내부를 들여다볼 수 있는 새로운 방법을 제시하며, 적어도 어떤 면에서 이 모델들이 우리와 매우 유사하게 자신의 "생각"을 조직하고 있음을 알려줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.