← 최신 논문
🤖 machine learning

Architecture-Dependent Causal Transfer of Activation States Across Large Language Models

이 논문은 내부 활성화 상태가 서로 다른 거대 언어 모델 아키텍처 간에 측정 가능한 표현 정렬을 가지며 투영될 수 있음에도 불구하고, 생성 과정 중 이러한 상태의 성공적인 엔드 투 엔드 인과적 전이는 보편적인 메커니즘으로 작용하기보다는 특정 디코더 전용 쌍에 대해서만 안정적으로 작동하며 엄격하게 아키텍처 의존적이라는 점을 입증한다.

원저자: Fernando Cardenas Piepereit

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Fernando Cardenas Piepereit

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

두 사람이 서로 대화를 나누려 하지만, 제3의 언어를 사용하는 통역사를 통해서만 말해야 하는 상황을 상상해 보십시오. 첫 번째 사람이 생각을 속삭이면, 통역사가 그것을 받아 적고, 두 번째 사람은 그것을 읽습니다. 그리고 통서은 다시 답장을 적습니다. 이 과정에는 시간이 걸리고, 비용이 들며, 원래의 의미를 잃어버릴 위험이 있습니다. 오늘날 인공지능 시스템은 정확히 이런 방식으로 소통합니다. 한 컴퓨터 프로그램이 다른 프로그램에 정보를 보내야 할 때, 자신의 내부적인 생각을 인간이 읽을 수 있는 텍텍스트로 변환하여 그 텍스트를 전송하고, 받는 프로그램은 그 텍스트를 읽어 다시 자신의 내부적인 생각으로 변환합니다. 이 중간 계층인 텍스트는 현재 그들이 대화하는 유일한 방법입니다. 하지만 만약 그들이 텍스트 단계를 완전히 건너뛸 수 있다면 어떨까요? 만약 한 기계가 글자로 적지 않고도 쪽지를 건네듯 자신의 내부 상태를 다른 기계에 직접 전달할 수 있다면 어떨까요? 이것이 연구자들이 해결하고자 했던 질문입니다. 서로 다른 기업에 의해 만들어지고 서로 다른 데이터로 학습된 서로 다른 유형의 인공지능들이, 텍스트로 번역할 필요 없이 서로의 내부 신호를 이해할 수 있을까요?

이 실험을 이해하려면, 이 프로그램들, 즉 거대 언어 모델(LLM)이 인간처럼 단어로 생각하지 않는다는 점을 아는 것이 도움이 됩니다. 대신 그들은 '활성화 상태(activation states)'라고 불리는 방대한 숫자의 변화하는 패턴으로서 정보를 처리합니다. 여러분은 이 패턴을 특정 순간에 뇌에서 일어나는 특정한 전기적 발화라고 생각할 수 있습니다. 모델이 질문을 읽을 때, 그 내부에는 고유한 활동 패턴이 빛을 발합니다. 연구자는 한 모델의 특정 아이디어에 대한 패턴이 다른 모델의 동일한 아이디어에 대한 패턴과 충분히 유사하여 그 사이에 다리를 놓을 수 있는지 알고 싶었습니다. 만약 패턴이 충분히 유사하다면, 컴퓨터는 텍스트를 거치지 않고 한 모델의 내부 신호를 다른 모델의 내부 신호로 직접 변환하는 법을 배울 수 있을 것입니다.

한 연구자가 네 가지 서로 다른 인공지능 모델을 사용하여 이 아이디어를 테스트하기 위해 실험을 시작했습니다. 이 모델들은 서로 다른 기술 계열과 서로 다른 학습 이력을 대표하도록 신중하게 선정되었습니다. 세 개는 텍스트를 한 번에 한 단어씩 생성하도록 만들어졌고, 네 번째 모델은 양방향에서 동시에 텍스트를 이해하도록 만들어졌습니다. 연구자는 먼저 이 모델들의 내부 패턴이 비교할 수 있을 만큼 충분히 유사한지 확인했습니다. 그들은 모델이 유의어나 책에서 자주 함께 발견되는 단어와 같이 서로 연관된 개념의 쌍에 어떻게 반응하는지를 살펴보았습니다. 그 결과, 동일한 방식으로 만들어진 세 모델의 경우 내부 패턴이 실제로 유사하다는 것을 발견했습니다. 그러나 다르게 만들어진 모델은 그러한 유사성을 보이지 않았습니다. 이는 모델을 어떻게 구축했느냐가 누가 만들었는지 또는 어떤 데이터로 학습시켰는지보다 더 중요하다는 것을 시사했습니다.

다음으로 연구자는 다리를 놓으려고 시도했습니다. 그들은 한 모델의 내부 신호를 다른 모델의 내부 신호로 변환하는 법을 배우는 작고 단순한 컴퓨터 프로그램을 훈련시켜 이 다리를 테스트했습니다. 그들은 질문을 보여주고, 그 질문에 대한 첫 번째 모델의 반응을 변환한 뒤, 두 번째 모델이 20개의 선택지 중에서 그것을 정답으로 인식하는지 확인하며 이 다리를 시험했습니다. 동일한 방식으로 구축된 세 모델의 경우, 이 다리는 놀라울 정도로 잘 작동했습니다. 두 번째 모델은 약 절반 정도의 확률로 신호의 출처를 정확히 식별해 냈는데, 이는 무작위 추측보다 훨씬 뛰어난 성과였습니다. 하지만 다르게 구축된 모델의 경우, 이 다리는 완전히 실패했습니다. 두 번째 모델은 그 신호를 전혀 인식하지 못했습니다. 이는 번역 계층이 가능하긴 하지만, 오직 특정 아키텍처 계열을 공유하는 모델들 사이에서만 작동한다는 것을 확인시켜 주었습니다.

마지막이자 가장 어려운 테스트는 이 번역이 실시간으로 받는 모델의 행동을 실제로 변화시킬 수 있는지 확인하는 것이었습니다. 연구자는 첫 번째 모델로부터 번ark된 신호를 가져와서, 두 번째 모델이 새로운 답변을 작성하는 도중에 직접 주입했습니다. 그들은 이 주입이 두 번째 모델의 출력을 원래 질문의 주제 쪽으로 유도할 수 있는지 알고 싶었습니다. 결과는 엇갈렸으며 중요한 한계를 드러냈습니다. 두 특정 모델 사이에서 이 작업을 수행했을 때, 주입은 효과가 있었습니다. 두 번째 모델의 출력이 첫 번째 모델의 질문 주제 쪽으로 눈에 띄게 변화했는데, 이는 신호가 수신되었고 인과적인 효과를 가졌음을 증명합니다. 그러나 세 번째 모델을 대상으로 동일한 기법을 시도했을 때는 완전히 실패했습니다. 서류상으로는 내부 패턴이 유사해 보였음에도 불구하고, 신호를 주입해도 출력이 전혀 변하지 않았습니다.

연구자는 생각의 물리적 운반체, 즉 특정 전기적 활동의 패턴을 한 기계에서 다른 기계로 전달하는 것은 가능하지만, 이것이 두 기계가 깊은 이해나 공통된 의미를 공유한다는 것을 의미하지는 않는다고 결론지었습니다. 성공적인 사례에서, 두 번째 모델은 반드시 원래 질문에 대한 정답을 내놓은 것은 아니었습니다. 대신, 원래 질문이 사각형에 관한 것이었다면 삼각형에 대해 이야기하는 것처럼 주제와 관련된 텍스트를 생성했습니다. 신호는 전달되었지만, 의미가 완벽하게 보존되지는 않았습니다. 이 연구는 인공지능 간의 직접적인 의사소통이 기술적으로는 가능하지만, 보편적인 언어는 아니라는 점을 보여줍니다. 그것은 전적으로 기계의 구체적인 설계에 달려 있습니다. 만약 설계가 일치하지 않는다면 신호는 이해될 수 없으며, 전달은 실패합니다. 이는 미래에 서로 다른 AI 시스템들이 직접 대화하게 하려면, 우리가 단순히 작동할 것이라고 가정해서는 안 되며, 반드시 호환 가능한 방식으로 구축하거나 연결하고자 하는 모든 쌍에 대해 특정한 번역기를 만들어야 함을 의미합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →