LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning
이 논문은 LLM이 암묵적 실행 가능성 제약 조건을 준수하지 못하는 원인이 지식의 부족이 아니라, 인코딩된 제약 조건이 의사 결정 과정에서 일관되게 활성화되지 않는 라우팅 병목 현상에 기인하며, 이는 프롬프트 기반 개입으로는 극복할 수 없으나 표적 활성화 패칭(targeted activation patching)을 통해 부분적으로 복구될 수 있다고 주장한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 초지능 로봇에게 의사결정 내리는 법을 가르치려 한다고 상상해 보세요. 당신은 로봇이 세상에 대해 거의 모든 것을 알 수 있도록 방대한 책 도서관을 제공했습니다. 그러고 나서 당신은 까다로운 질문을 던집니다. "나는 내 차를 세차하고 싶은데, 세차장은 50미터 거리에 있어. 걸어갈까, 아니로 운전해서 갈까?" 인간이라면 즉시 이렇게 깨달을 것입니다. "잠깐, 운전하려면 차가 거기 있어야 하잖아!" 하지만 이 로봇은 자동차에 관한 모든 책을 읽었음에도 불구하고, "자동차"라는 단어와 "운전하다"라는 단어를 보고 "오, 매칭되는구나!"라고 생각하며 자신 있게 "운전해!"라고 말할 수도 있습니다.
이 논문은 **대규모 언어 모델(LLM)**이라고 불리는 인공지능의 특정 영역을 깊이 파고듭니다. 이들은 대화를 나누고, 이야기를 쓰고, 문제를 해결하는 똑똑한 AI 시스템들입니다. 연구자들이 풀고자 하는 거대한 미스터리는 무언가를 **아는 것(knowing)**과 그것을 **사용하는 것(using)**의 차이입니다. 이것은 마치 게임의 모든 규칙을 통째로 암기했지만, 막상 게임을 할 때는 보드 위의 반짝이는 말들에 정신이 팔려 규칙을 계속 까먹는 학생과 같습니다. 과학자들은 오랫동안 이 AI들이 논리의 숨겨진 규칙을 '알고'는 있지만, 상황이 까다로워지면 이를 적용하는 데 실패한다고 의심해 왔습니다. 이는 우리가 AI가 의사, 운전자 등을 돕는 것처럼 현실 세계에서 안전하고 신뢰할 수 있게 만들기를 원한다면, AI가 실제로 생각하고 있는 것인지 아니면 단순히 표면적인 단서에 기반해 추측하고 있는 것인지를 알아야 하기 때문에 매우 중요합니다.
이 연구를 진행한 연구자들은 AI가 이러한 실수를 저지를 때 그들의 "두뇌" 속에서 정확히 어떤 일이 일어나는지 알아내기 위해 14개의 서로 다른 AI 모델을 대상으로 영리한 탐정 놀이를 시작했습니다. 그들은 "쿼텟(quartet)"이라 불리는 네 가지 시나리오를 사용하여 정교한 실험을 설계했습니다. 같은 이야기의 네 가지 버전이라고 상상해 보세요. 하나는 숨겨진 규칙이 존재하는 경우(차가 없는 상태), 하나는 규칙이 제거된 경우(차가 마법처럼 존재하는 상태), 하나는 규칙이 크게 외쳐지는 경우("기억해, 차가 없어!"라고 말함), 그리고 마지막은 AI가 단순히 긴 이야기를 좋아하는지 확인하기 위해 동일한 길이의 무작위 문장을 추가한 경우입니다.
여기서 그들이 발견한 반전이 있습니다: AI는 멍청한 것이 아니라, 그저 주의가 산만한 것입니다. 더 중요한 것은, 연구자들은 AI의 "주의 산만"이 두 가지 매우 다른 방식으로 일러난다는 것을 발견했습니다.
연구자들이 AI의 "두뇌"(데이터의 숨겨진 층) 내부를 들여다보았을 때, AI는 실제로 그 규칙을 알고 있었습니다. 연구자들은 AI의 내부 생각을 읽고 "네, 차가 없습니다!"라고 88%에서 94%의 정확도로 말할 수 있는 간단한 탐지기를 구축할 수 있었습니다. 지식은 마치 책상 위에 놓인 사실처럼, 모델의 처리 과정 중간에 그대로 자리 잡고 있었습니다.
하지만 문제는 AI가 최종 결정을 내려야 할 때 그 지식을 사용하지 않는다는 점입니다. 이것은 마치 도로가 폐쇄되었다는 것을 알고 있는 GPS를 가진 운전자가, GPS를 무시하고 그냥 계속 운전하는 것과 같습니다. 연구자들은 이를 **라우팅 문제(routing problem)**라고 부릅니다. 정보는 존재하지만, 정답으로 가는 경로가 막혀 있거나 무시되는 것입니다.
결정적으로, 그들은 서로 다른 방식으로 실패하는 두 종류의 로봇을 발견했습니다:
- "과잉 활성" 로봇들: 일부 모델(Llama-4 및 Claude Opus 등)은 너무 안전해지려는 욕심이 강해서, 제약 조건이 부재할 때도 제약이 많은 답변(예: "걷기")을 적용합니다. 만약 이야기에서 차를 제거하더라도, 그들은 여전히 "걷기"라고 말합니다. 왜냐하면 그들은 '안전한' 답변에 편향되어 있기 때문입니다. 그들은 규칙을 알고 있지만, 규칙이 존재하지 않을 때 그것을 끄는 법을 몰라서, 존재하지 않는 규칙을 적용함으로써 논리 테스트에서 실패하게 됩니다.
- "저활성" 로봇들: 다른 모델들(GPT-OSS 등)은 규칙이 있을 때조차 규칙을 적용하지 못합니다. 그들은 차가 없다는 것을 보았음에도 여 still "운전하기"라고 말합니다. 그들은 규칙이 거기 있다는 것을 알지만, 내부 배선이 너무 심하게 고장 나서 그 지식이 결정 버튼에 전혀 도달하지 못합니다.
그들은 이를 확인하기 위해 "활성화 패칭(activation patching)"이라는 기법을 테스트했습니다. 만약 당신이 AI가 규칙을 기억했던 순간(예: 규칙을 크게 외쳐주었을 때)의 "생각"을 가져와서, 규칙을 잊어버렸던 순간에 직접 붙여넣을 수 있다고 상상해 보세요. 균형 잡힌(balanced) 모델들(Qwen3-14B 등)의 경우, 이 마법 같은 붙여넣기는 완벽하게 작동했습니다! AI는 갑자기 정답을 맞혔고, 이는 지식이 그곳에 있었으며 단지 정답으로 가기 위한 자극이 필요했을 뿐이라는 것을 증명했습니다. 하지만 저활성 모델들의 경우, 이 붙여넣기는 아무런 효과가 없었습니다. 비록 그들이 규칙을 알고 있었음에도 불구하고, 내부 배선이 너무 망가져 있어서 그 지식이 결정 버튼에 도달하는 것을 막고 있었습니다. (참고: 연구자들은 이 패칭을 "과잉 활성" 그룹에 대해서는 테스트하지 않았으므로, 붙여넣기가 그들을 고칠 수 있을지는 알 수 없습니다.)
또한 연구자들은 사람들이 AI의 실수를 바로잡기 위해 사용하는 가장 대중적인 방법들, 즉 AI에게 "단계별로 생각하라"거나 "전제 조건을 나열하라"고 요청하는 방식들을 테스트했습니다. 결과는 놀라웠습니다: 이러한 기술 중 그 어떤 것도 문제를 해결하지 못했습니다. 오히려, 이 기술들은 AI가 규칙이 적용되지 않아야 할 때조차 "안전한" 답변(예: "걷기")을 선택하도록 유도하여 문제를 더 악화시켰습니다. AI에게 "더 깊이 생각하라"고 말하면, AI는 더 열심히 생각하는 것이 아니라 단지 그 규칙을 언급하는 데 더 목소리를 높일 뿐이라는 것이 드러났습니다. 이는 마치 학생에게 "풀이 과정을 보여달라"고 말했을 때, 규칙이 상관없는 모든 줄에도 그 규칙을 적어 내려가는 것과 같습니다.
요약하자면, 이 논문은 실패의 원인이 AI의 지식 부족 때문이 아니라고 제안합니다. 그것은 AI의 "라우팅 병목 현상(routing bottleneck)" 때문입니다. AI는 진실을 알고 있지만, 언제 그 진실이 자신의 답변을 인도하게 할지를 결정하지 못합니다. 현재의 방식처럼 단순히 AI에게 "더 노력하라"거나 "더 많이 생각하라"고 요구하는 것은 고장 난 배선을 고치는 것이 아니라, AI가 틀린 추측을 더 확신 있게 하도록 만들 뿐입니다. 이를 진정으로 해결하려면, AI가 아는 것과 그것이 말하기로 결정하는 것을 연결하는 내부 경로를 재구축해야 하며, 너무 의욕적인 로봇과 너무 수동적인 로봇을 위한 서로 다른 해결책이 필요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.