← 최신 논문
💻 computer science

What Does Development Add? Multiple-State Evidence Improves Causal Recovery in Constructed Transformer-Circuit Dossiers

본 연구는 언어 모델 분석가에게 구성된 트랜스포머 회로의 최종 상태뿐만 아니라 여러 순차적 상태를 제공하는 것이, 다른 모든 실험 조건이 동일할 때에도 인과적 엣지 복구 및 개입 후 예측의 정확도를 유의미하게 향상시킨다는 것을 입증한다.

원저자: Zuo Yuchen

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Zuo Yuchen

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

탐정의 딜레마: 영화를 보는 것이 왜 범죄를 해결하는 데 도움이 되는가

당신이 복잡한 기계가 어떻게 작동하는지 알아내려는 탐정이라고 상상해 보십시오. 보통, 당신은 그 기계의 일생이 끝나는 아주 마지막 순간, 즉 완전히 완성되어 작동 중인 모습만을 볼 수 있습니다. 당신은 그것을 쿡쿡 찔러보고, 레버를 당겨보며 어떤 일이 일어나는지 관찰합니다. 이것이 현재 과학자들이 인공지능(AI)을 연구하는 방식입니다. 그들은 완성된 AI 모델을 보고, 테스트를 실행하며, 그 모델의 지적인 행동을 담당하는 뇌의 어느 부분이 무엇인지 추측하려고 노력합니다. 이것을 **기계적 해석 가능성(mechanistic interpretability)**이라고 부릅니다. 이는 마치 마술사가 무대를 어떻게 준비했는지는 전혀 보지 못한 채, 오직 마술의 마지막 결과물만을 보고 마술의 트릭을 이해하려는 것과 같습니다.

하지만 여기에 문제가 있습니다. 때로는 서로 다른 두 가지 설정이 마지막에는 똑같이 보일 수 있다는 점입니다. 어떤 부품은 특정한 역할을 수행하기 위해 만들어졌을 수도 있고, 혹은 그냥 우연히 그 자리에 있어서 마치 도움을 주는 척하고 있는 것일 수도 있습니다. 만약 당신이 마지막 순간만을 본다면, 그 차이를 구별할 수 없습니다. 여기서 **발달(development)**이라는 개념이 등장합니다. 아이가 성장하는 과정을 지켜보는 것이 성인이 된 아이를 만나는 것보다 그 성격을 더 잘 알려주는 것처럼, AI가 단계별로 "학습"하는 과정을 지켜보는 것은 그것이 어떻게 생각하는지에 대한 진실한 이야기를 밝혀줄 수도 있습니다. 큰 질문은 이것입니다. "훈련 일지"(AI가 시간이 흐름에 따라 어떻게 변했는지에 대한 기록)를 갖는 것이 단순히 최종 결과만을 보는 것보다 탐정이 미스터리를 해결하는 데 실제로 더 도움이 될까요?

실험: 시간 여행을 하는 탐정

이 연구에서 주위첸(Zuo Yuchen)이라는 연구자는 이 아이디어를 테스트하기 위해 거대하고 통제된 미스터리를 설정했습니다. 실제 인터넷으로부터 학습하는 복잡하고 무질서한 AI를 사용하는 대신, 그들은 24개의 "구성된 도해(constructed dossiers)"를 만들었습니다. 이것을 레고 블록으로 만든 24개의 서로 다른 가짜 기계라고 생각하십시오. 연구자는 모든 조각이 어떻게 연결되어야 하고 무엇을 해야 하는지 정확히 알고 있었습니다. 그들은 완벽한 "지상 진실(ground truth)"을 만들어 탐정의 작업 성과를 100% 정확하게 채점할 수 있었습니다.

이 이야기에 등장하는 "탐정"은 초지능 언어 모델(GPT-5.6-Terra라고 불림)이었습니다. 연구자는 이 탐정에게 임무를 주었습니다. 바로 이 가짜 기계가 어떻게 작동하는지 파악하고, 특정 부품을 고장 냈을 때 어떤 일이 일어날지 예측하는 것입니다.

탐정은 두 팀으로 나뉘었지만, 서로 다른 단서를 받았습니다.

  1. "최종 상태 전용" 팀: 이 팀은 기계의 일생 마지막 단계에서 찍은 다섯 장의 서로 다른 사진을 받았습니다. 각 사진은 각도가 조금씩 달랐지만, 기계는 매번 똑같이 완성된 상태였습니다.
  2. "다중 상태" 팀: 이 팀 역시 다섯 장의 사진을 받았지만, 이 사진들은 기계가 제작되는 과정 중 서로 다른 시점에 찍힌 것들이었습니다. 그들은 기계가 아기였을 때, 청소년이었을 때, 그리고 성인이 되었을 때의 모습을 보았으며, 조각들이 하나씩 끼워 맞춰지는 과정을 지켜보았습니다.

결정적으로, 마지막 사진(최종 상태)은 두 팀 모두에게 동일했습니다. 유일한 차이점은 한 팀은 기계가 어떻게 만들어졌는지에 대한 역사를 볼 수 있었던 반면, 다른 팀은 완성된 제품만을 반복해서 쳐다봐야 했다는 점입니다.

발견한 사실: 역사는 중요하다

결과는 명확했고 놀라울 정도로 구체적이었습니다. 다중 상태(역사)를 본 팀이 미스터리를 훨씬 더 잘 해결했습니다.

  • 연결 관계 매핑: 기계의 부품들이 서로 어떻게 연결되는지 지도를 그리라는 요청을 받았을 때, "역사" 팀은 97.1%의 확률로 정답을 맞혔습니다. "최종 상태 전용" 팀은 88.8%의 확률로 맞혔습니다. 이것이 엄청난 격차처럼 보이지 않을 수도 있지만, 복잡한 퍼즐의 세계에서는 엄청난 개선입니다. 역사 팀은 진짜 연결 관계를 찾아내고, 마지막에 수상할 정도로 비슷해 보이는 가짜 연결들을 무시하는 데 더 뛰어났습니다.
  • 미래 예측: 탐정은 특정 전선을 끊거나 부품을 고정했을 때 어떤 일이 일어날지 추측해야 했습니다. "역사" 팀은 95.4%의 확률로 결과를 정확히 예측한 반면, "최종 상태 전용" 팀은 89.1%를 기록했습니다.
  • 천장 효과(Ceiling Effect): 흥미롭게도, 각 부품의 이름(예: "선택기" 또는 "매퍼")을 말하는 단순한 과제에서는 두 팀 모두 100%의 완벽한 점수를 받았습니다. 이는 부품의 이름을 맞히는 것은 쉽지만, 복잡한 연결망을 파악하는 데는 역사가 정말 빛을 발한다는 것을 시사합니다.

이것이 의미하는 바 (그리고 의미하지 않는 것)

이 연구는 이 특정 유형의 퍼즐에 대해서는 발달 과정을 보는 것이 도움이 된다는 점을 시사합니다. 그것은 마치 퍼즐이 조립되는 과정을 지켜보는 것과 같습니다. 어떤 조각이 먼저 놓였고, 어떤 조각이 실수를 바로잡기 위해 나중에 추가되었는지 볼 수 있기 때문입니다. "최종 상태 전용" 팀은 일부 가짜 연결들이 마지막에 매우 강력해 보였기 때문에 혼란을 겪었지만, "역사" 팀은 그 연결들이 게임 후반부에 나타났다는 것을 보고 그것이 원래 계획이 아니었음을 알 수 있었습니다.

하지만 논문은 과도한 기대를 경계하며 매우 신중하게 서술되었습니다.

  • 시뮬레이션이지 현실이 아니다: 이 연구의 "기계"들은 자연스럽게 학습된 것이 아니라 컴퓨터 프로그램에 의해 정교하게 만들어진 것입니다. 연구자는 이것이 하나의 "개념 증명(proof of concept)"임을 인정합니다. 이는 통제된 실험실 환경에서 이 아이디어가 작동한다는 것을 증명하지만, 이것이 세상에 존재하는 모든 실제 AI 모델에도 적용될 것이라고 보장하지는 않습니다.
  • "시간" 대 "다양성" 문제: 연구자는 또한 탐정이 더 잘한 이유가 사건의 순서(시간)를 보았기 때문인지, 아니면 단지 기계의 다른 버전들(다양성)을 보았기 때문인지 궁금했습니다. 이를 테스트하기 위해, 사진의 내용은 유지하되 순서를 뒤섞은 작은 추가 점검을 실시했습니다. 탐정은 여전히 높은 성적을 냈습니다. 이는 단순히 서로 다른 상태를 보는 것이 핵심이지, 반드시 타임라인 자체가 핵심은 아닐 수도 있음을 시사합니다. 다만 이 연구가 이를 확언하기에는 규모가 작았습니다.
  • 만능 열쇠는 아니다: 연구는 "최종 상태 전용" 팀이 무능했다는 것을 발견한 것이 아닙니다. 그들도 꽤 훌륭했습니다. 단지 역사가 그들에게 상당한 보너스를 주었을 뿐입니다.

요약

이 논문은 유쾌하면서도 진지한 실험을 통해 다음과 같이 말합니다. "이봐요, 만약 당신이 복잡한 시스템이 어떻게 작동하는지 알고 싶다면, 단순히 완성된 제품만 보지 마세요. 가능하다면, 그것이 어떻게 성장했는지 보세요."

이 글을 읽는 AI 연구자들에게 이 연구는 훈련 기록을 파헤치기 시작하라는 초록불입니다. 나머지 사람들에게 이 글은 맥락이 전부라는 사실을 상기시켜 줍니다. 마치 누군가의 어린 시절을 아는 것이 그 사람의 성인 시절 선택을 이해하는 데 도움이 되는 것처럼, AI의 "유년기"(그것의 훈련 단계)를 아는 것이 그것의 진정한 마음을 여는 열쇠가 될 수도 있습니다. 하지만 기억하십시오, 이것은 장난감 기계를 대상으로 한 테스트였습니다. 실제 세상은 훨씬 더 무질서하며, 다음 단계는 이 기술이 우리가 매일 사용하는 실제, 성숙한 AI에도 적용되는지 확인하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →