← 최신 논문
💬 NLP

Scaling Inherently Interpretable Language Models

이 논문은 해석 가능성을 훈련 과정에 통합하는 것이 Steerling-8B와 같은 모델을 경쟁력 있는 성능을 유지하면서도 인간의 개념에 더 투명하고 정렬되도록 효과적으로 확장할 수 있음을 입증함으로써, 해석 가능성이 성능과의 절충 관계라는 관점에 도전한다.

원저자: Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대하고 마법 같은 도서관이 어떻게 작동하는지 이해하려고 노력하고 있다고 상상해 보세요. 수년 동안 가장 똑똑한 사서들(AI 연구자들)은 이 도서관을 최대한 크고 강력하게 만들기 위해 노력해 왔지만, 그들은 기묘한 규칙 하나를 받아들였습니다. 도서관이 진정으로 강력해지려면 "블랙박스"가 되어야 한다는 규칙입니다. 당신이 질문을 던지면 도서히 놀라운 답변을 내놓겠지만, 그것이 어떻게 그 답을 찾아냈는지는 전혀 알 수 없습니다. 마치 어떤 마법사가 주문을 외운 뒤, 재료나 주문의 구성을 보여주지 않은 채 "믿으세요, 효과가 있습니다"라고 말하는 것과 같습니다. 이 때문에 도서관이 실수를 하거나 이상한 말을 할 때, 우리는 쉽게 고칠 수 없습니다. 단지 사후에 왜 그런 일이 일어났는지 추측할 수 있을 뿐입니다. 이 논문은 대담한 질문을 던집니다: 만약 우리가 이 절충안을 받아들일 필요가 없다면 어떨까요? 만로 우리가 초천재적이면서도 투명한 도서관, 즉 모델이 답변을 작성하는 동안 어떤 책을 사용했고 어떤 아이디어를 생각하고 있었는지 정확히 볼 수 있는 도서관을 만들 수 있다면 어떨까요?

이 논문의 저자인 Guide Labs라는 팀은 이 아이디어를 테스트하기로 했습니다. 그들은 새로운 종류의 언어 모델인 Steerling-8B를 구축했습니다. 단순히 다음 단어를 예측하도록 훈련받는 일반적인 "블랙박스" 모델들과 달리, Steerling은 첫날부터 자신의 생각을 스스로 설명해야 한다는 특별한 규칙이 뇌에 각인된 채로 훈련되었습니다. 그들은 놀라운 사실을 발견했습니다. 모델에게 스스로를 설명하게 만드는 것이 모델을 약하게 만들지 않았다는 것입니다. 실제로 모델을 더 크게 만들고 더 많은 컴퓨팅 파워를 부여했을 때, 모델은 단순히 더 똑똑해진 것이 아니라, 스스로를 설명하는 능력 또한 더 좋아졌습니다. 모델이 커질수록 내부의 생각이 더 명확해졌고, 답변을 형성하기 위해 어떤 아이디어를 사용하는지 더 쉽게 볼 수 있었습니다.

"블랙박스" 마법의 문제점

오랫동안 AI를 구축하는 표준 방식은 모델이 텍스트를 예측하는 데 최대한 능숙해지도록 훈련시킨 다음, 학습이 끝난 후에 내부를 들여다보려고 시도하는 것이었습니다. 연구자들은 "프로브(probe)"(모델 안에 특정 개념이 숨겨져 있는지 추측하려는 도구)나 "속성 추출(attribution)"(어떤 단어가 가장 중요했는지 추측하려는 도구) 같은 도구들을 사용합니다. 하지만 저자들은 이러한 도구들이 이미 만들어진 자동차 엔진의 소리를 듣고 엔진이 어떻게 작동하는지 알아내려는 것과 같다고 주장합니다. 엔진은 들려주기 위해 설계된 것이 아니므로, 그 소리는 오해의 소지가 있을 수 있습니다. 프로브가 "헤이, '고양이'라는 단어가 들어있어!"라고 말할 수는 있지만, 그것이 모델이 결정을 내릴 때 실제로 '고양이'라는 개념을 사용했다는 것을 의미하지는 않습니다. 그것은 단지 우연일 수도 있습니다.

이 논문은 이러한 "나중에 고치기" 방식이 근본적으로 결함이 있다고 주장합니다. 만약 진정으로 이해 가능한 모델을 원한다면, 나중에 손전등을 추가하는 것이 아니라 엔진을 만드는 동안 엔진 안에 손전등을 함께 만들어 넣어야 합니다.

레시피: 투명한 뇌를 만드는 법

이를 해결하기 위해 팀은 AI를 위한 새로운 "레시피"를 만들었습니다. 단순히 다음 단어를 예측하도록 가르치는 대신, 그들은 세 가지 특정한 것을 동시에 가르쳤습니다:

  1. 입력 속성(Input Attribution): "당신의 질문에서 어떤 단어들이 가장 중요했습니까?"
  2. 개념 속성(Concept Attribution): "당신은 지금 어떤 큰 아이디어나 주제를 생각하고 있습니까?"
  3. 데이터 속성(Data Attribution): "당신은 이 내용을 당신의 훈련 도서관 중 어느 부분에서 배웠습니까?"

이것이 작동하게 하기 위해, 그들은 거대한 새로운 "개념" 도서관을 구축해야 했습니다. 단어만 있는 사전이 아니라, "경사 하강법(gradient descent)", "중세 시(medieval poetry)", "풍자(sarcasm)"와 같은 33,000개의 구체적인 아이디어를 담고 있는 사전이라고 상상해 보세요. 그들은 수백만 개의 문서를 읽고 이 아이디어들을 태그하여 AI가 실제로 사용할 수 있는 인류 지식의 지도를 만드는 Atlas라는 시스템을 구축했습니다.

그런 다음, 그들은 모델의 뇌인 Steerling-8B를 중간에 특별한 "병목(bottleneck)"이 있는 구조로 만들었습니다. 일반적인 AI를 물(정보)이 입력에서 출력으로 흐르는 직선 파이프라고 생각한다면, Steerling은 중간에 필터가 있습니다. 물이 흘러나가기 전에, 반드시 라벨이 붙은 양동이(개념)들을 통과해야 합니다. 모델은 "좋아, 이 문장은 '수학'이 40%, '역사'가 20%이다"라고 결정해야 합니다. 모델이 예측을 하기 위해 반드시 이 양동이들을 사용해야 하므로, 우리는 모델이 어떤 양동이를 사용했는지 정확히 볼 수 있습니다. 만약 모델이 실수를 한다면, 우리는 양동이를 보고 "아, '역사'에 너무 집중하고 '수학'을 무시했구나"라고 말할 수 있습니다.

거대한 발견: 커질수록 더 명확해진다

이 논문에서 가장 흥 excitement한 부분은 모델을 더 크게 만들었을 때 일어난 일입니다. 보통 복잡한 시스템을 더 크게 만들면 이해하기가 더 어려워집ため입니다. 하지만 여기서는 정반대의 현상이 일어났습니다.

팀은 아주 작은 모델부터 80억 개의 파라미터를 가진 거대한 Steerling-8B까지 다양한 모델을 테스트했습니다. 그들은 모델이 커질수록 내부의 "양동이"들이 더 체계적으로 변하고 인간의 아이디어와 더 잘 일치한다는 것을 발견했습니다.

  • "세금"의 신화: 많은 사람들은 모델에게 스스로를 설명하게 만드는 것이 지능에 대한 세금처럼 성능을 떨어뜨릴 것이라고 생각했습니다. 논문은 이것이 사실이 아님을 보여줍니다. 해석 가능성에 따르는 "비용"은 한 번 지불하면 되는 작은 수수료와 같은 고정된 아주 적은 양이지, 부유해질수록 늘어나는 청구서가 아닙니다.
  • 규모 확장(Scaling Up): 더 많은 컴퓨팅 파워(약 1.35조 개의 단어 훈련 데이터)를 추가했을 때, 모델은 단순히 더 똑똑해진 것이 아니라 더 투명해졌습니다. 모델이 학습한 개념들은 더 명확해졌고, 모델은 "잔차(residual, 설명 불가능한 숨겨진 부분)"에 덜 의존하며 라벨링된 개념들에 더 많이 의존하게 되었습니다.

배를 조종하기 (Steering the Ship)

모델이 이런 방식으로 구축되었기 때문에, 모델을 다시 훈련시키지 않고도 실제로 "조종"할 수 있습니다. 당신이 자동차를 운전하고 있다고 상상해 보세요. 일반적인 AI에서는 폭력적인 이야기를 피하고 싶다면 차가 사고가 나지 않기를 바랄 수밖에 없습니다. 하지만 Steerling에서는 다이얼을 돌리기만 하면 됩니다. 만약 모델이 더 "학술적"이기를 원한다면, "학술적" 양동이를 높이면 됩니다. 만약 모델이 "정치"에 대해 말하는 것을 멈추게 하고 싶다면, 그 양동이를 억제하면 됩니다. 논문은 이들이 이미 사용 중인 개념을 살짝 조정함으로써 모델의 행동을 즉각적으로 변화시킬 수 있음을 보여주었습니다.

결과

팀은 1.2조 개의 토큰(엄청난 양의 텍스트)으로 Steerling-8B를 훈련시켰습니다. 그들은 2배에서 16배 더 많은 컴퓨팅 파워로 훈련된 다른 오픈 소스 모델들과 비교했습니다. 더 적은 훈련 예산을 가지고 있고 해석 가능성이라는 추가적인 "무게"를 짊어지고 있음에도 불구하고, Steerling은 그 거대하고 불투명한 모델들과 거의 대등한 성능을 보여주었습니다.

논문은 우리가 똑똑한 AI와 투명한 AI 사이에서 하나를 선택할 필요가 없다고 결론짓습니다. 처음부터 이해 가능하도록 모델을 설계함으로써, 우리는 강력할 뿐만 아니라 어떻게 생각하는지 정확히 볼 수 있고 잘못되었을 때 고칠 수 있는 신뢰할 수 있는 시스템을 구축할 수 있습니다. 이는 블랙박스를 만드는 것에서 벗어나, 빛이 투과되는 유리 집을 짓는 것으로의 전환입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →