← 최신 논문
🤖 machine learning

AlgoTrace: Algorithmic Primitives and Compositional Geometry of Reasoning in Language Models

이 논문은 거대 언언 모델의 잠재 공간 내에서 재사용 가능한 알고리즘 프리미티브를 식별하고 조작하는 프레임워크인 AlgoTrace를 소개하며, 다단계 추론이 이러한 벡터들에 대한 기하학적 연산을 통해 제어되고 합성될 수 있음을 입증함으로써 교차 작업 일반화 능력을 향상시킨다는 점을 보여준다.

원저자: Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

게시일 2026-08-27
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samuel Lippl, Thomas McGee, Kimberly Lopez, Ziwen Pan, Pierce Zhang, Salma Ziadi, Oliver Eberle, Ida Momennejad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델은 현대 인공지능의 엔진으로서, 이야기를 쓰고, 방정식을 풀며, 복잡한 논리 퍼즐을 탐색할 수 있는 능력을 갖추고 있습니다. 수년 동안 과학자들은 이 시스템들이 실제로 어떻게 생각하는지 궁금해해 왔습니다. 이들은 단순히 훈련 데이터의 패턴을 암기하는 것일까요, 아니면 진정한 단계별 추론을 수행하는 것일까요? 이에 답하기 위해 연구자들은 모델이 생성하는 단어가 아니라, 모델이 작동할 때 내부 계층을 통해 흐르는 보이지 않는 수학적 신호에 주목하기 시작했습니다. 이 신호들은 흔-히 잠재 활성화(latent activations)라고 불리며, 기계 내부에서 사고의 원료가 됩니다. 문제는 이러한 신호들이 인간의 뇌의 서로 다른 부분이 서로 다른 작업에 특화되어 있는 것처럼, 특정 유형의 사고가 특정 장소에서 일어나는 구조화된 지도를 형성하느냐는 것이었습니다. 만약 그러한 지도가 존재한다면, 이는 추론이 혼란스러운 흐릿함이 아니라, 구별되고 재사용 가능한 정신적 도구들의 풍경을 통과하는 여정임을 의미할 것입니다.

한 연구팀은 이제 이 풍경을 지도화하여, 거대 언어 모델이 실제로 문제를 해결하기 위해 일련의 기본적이고 재사용 가능한 구성 요소들에 의존하고 있음을 밝혀냈습니다. 그들은 이 구성 요소들을 '알고리즘 프리미티브(algorithmic primitives)'라고 부릅니다. 프리미티브를 여행을 계획할 때 현재 위치에서 가장 가까운 도시를 찾는 것이나, 수학 방정식이 균형을 이루는지 확인하는 것과 같은 더 큰 과정의 단일하고 근본적인 단계라고 생각해보십시오. 연구진은 모델 내부에서 이러한 단계들이 발생하는 과정을 추적하는 새로운 방법을 개발했습니다. 모델이 어려운 문제를 해결하는 동안 내부 신호가 어떻게 변하는지 관찰함으로써, 그들은 유사한 사고의 순간들을 하나로 묶을 수 있었습니다. 그들은 모델이 복잡한 퍼즐을 풀 때, 마치 여행자가 지도 위의 마을들을 하나씩 이동하듯, 일련의 구별되는 정신적 상태들을 통과한다는 것을 발견했습니다.

무슨 일이 일어나고 있는지 이해하기 위해, 연구팀은 네 가지 매우 다른 유형의 도전 과제에 대해 모델을 테스트했습니다: 여러 도시를 방문하는 외판원의 최단 경로 찾기, 참과 거짓 문장이 포함된 논리 퍼즐 풀기, 어려운 수학 경시 문제 해결하기, 그리고 가상 미로 탐색하기입니다. 모델이 과제를 수행하는 동안 연구진은 매 단계마다 내부 신호를 기록했습니다. 그들은 컴퓨터 프로그램을 사용하여 이 신호들을 클러스터로 그룹화했는데, 특정 신호 그룹이 거리를 계산하거나 솔루션을 검증하는 것과 같이 모델이 특정한 일을 하고 있을 때 일관되게 나타난다는 것을 발견했습니다. 그런 다음 자동화된 시스템을 사용하여 그 정확한 순간에 모델이 작성하고 있는 텍스트를 읽어냄으로써, 내부 신호가 외부 행동과 일치함을 확인했습니다. 예를 들어, 한 클러스터의 신호는 모델이 다음에 방문할 가장 가까운 도시를 선택할 때 항상 나타났고, 다른 클서터는 모델이 자신의 작업을 재검토할 때 나타났습니다.

가장 중요한 발견은 이러한 정신적 구성 요소들이 단순히 수동적인 표식이 아니라, 능동적으로 제어될 수 있다는 점이었습니다. 연구진은 각 프리미티브에 대해 본질적으로 모델의 내부 공간에서의 방향인 특정 '벡터(vector)'를 추출했습니다. 그런 다음 이 벡터들을 모델이 생각하는 동안 다시 주입했습니다. '가장 가까운 이웃 찾기'를 위한 벡터를 추가했을 때, 모델은 비록 그것이 특정 문제에 최선의 접근 방식이 아닐지라도 즉시 그 전략을 더 자주 사용하기 시작했습니다. '새로운 경로 생성하기' 벡터를 추가했을 때, 모델은 더 많은 옵션을 탐색하기 시작했습니다. 이는 이러한 내부 신호가 모델 행동의 직접적인 원인임을 입증했습니다. 특정 정신적 스위치를 켜거나 끄는 것만으로도 연구진은 모델이 다르게 생각하도록 유도할 수 있었으며, 이는 모델의 추론이 이러한 구별되고 조작 가능한 부분들로 구성되어 있음을 시사합니다.

이 연구는 또한 이러한 구성 요소들이 결합될 수 있다는 것을 보여주었습니다. 마치 기본 색상을 섞어 새로운 색조를 만드는 것처럼, 연구진은 두 개의 서로 다른 프리미티브 벡터를 더하면 새로운 결합된 행동이 만들어진다는 것을 발견했습니다. 예를 들어, 경로의 끝을 찾는 데 도움을 주는 벡터와 값을 비교하는 데 도움을 주는 벡터를 섞었더니, 모델은 갑자기 두 가지 기술이 모두 필요한 더 복적인 과제를 수행할 수 있게 되었습니다. 이는 모델의 추론 능력이 단일하고 거대한 기술이 아니라, 단순한 연산들이 복잡한 솔루션으로 조립될 수 있는 유연한 기하학적 구조임을 시사합니다.

나아가 연구진은 표준 모델과 추론을 더 잘하도록 특별히 훈련된 모델을 비교했습니다. 그들은 훈련된 모델이 이러한 구성 요소들을 더 효과적으로 사용한다는 것을 발견했습니다. 훈련된 모델은 무차별적인 추측보다는 검증 및 계획과 같은 구조화된 단계에 더 많이 의존했습니다. 또한 훈련된 모델은 한 유형의 문제에서 학습한 기술을 다른 유형의 문제로 전이하는 더 뛰어난 능력을 보여주었습니다. 수학 문제를 풀 때 학습된 정신적 도구는 탐색 퍼즐을 해결하는 데 성공적으로 사용될 수 있었습니다. 이는 훈련 과정이 단순히 모델에게 더 많은 사실을 가르친 것이 아니라, 실제로 다양한 영역에 걸쳐 이러한 근본적인 추론 단계를 구성하고 재사용하는 능력을 강화했음을 나타냅니다.

이러한 발견은 인공지능을 바라보는 새로운 방식을 제공합니다. 우리는 이러한 모델을 정답을 마법처럼 만들어내는 블랙박스로 보는 대신, 알고리즘 단계의 구조화된 공간을 걸어가는 시스템으로 이제 볼 수 있습니다. 연구진은 이러한 단계들의 기하학적 구조를 이해함으로써, 모델이 왜 실수를 하는지 설명할 수 있을 뿐만 아니라 내부 신호를 조정하여 이를 수정할 수 있음을 입증했습니다. 이 연구는 더 신뢰할 수 있고 유능한 인공지능으로 가는 길이, 이러한 시스템이 이미 보유한 도구들을 결합함으로써 한 번도 본 적 없는 문제를 해결할 수 있도록 이 기본적인 구성 요소들을 더 잘 구성하고 일반화하도록 가르치는 데 달려 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →