← 최신 논문
💬 NLP

Prompt-Model Interaction Reaches the Fixed Points: A deterministic, task-free structural readout -- and the factorizations of it that failed

이 논문은 프롬프트-모델 상호작용이 짧은 구간 내에서 결정론적이고 태스크가 없는 고정점 구조로 수렴함을 입증하며, 이러한 현상이 태스크 성능이나 프리픽스 길이 또는 어텐션 싱크와 같은 제안된 요인들이 아니라 특정 프롬프트-모델 쌍에 의해 유도된다는 것을 밝혀낸다.

원저자: Nicolás Vera Zúñiga

게시일 2026-08-24
📖 5 분 읽기🧠 심층 분석

원저자: Nicolás Vera Zúñiga

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 거대 언어 모델은 종종 보편적인 도구로 취급된다. 질문을 던지면 모델이 답을 제공하는 방식이다. 수년 동안 연구자들은 질문을 던지는 방식, 특정한 단어, 형식, 또는 스타일이 결과를 극적으로 바꿀 수 있다는 사실을 알고 있었다. 어떤 모델을 천재처럼 보이게 만드는 프롬프트가 다른 모델은 어리석게 보이게 만들 수도 있으며, 텍스트에 가해진 작고 무의미한 변화조차도 어떤 모델이 '최고'인지에 대한 순위를 뒤바꿔 놓을 수 있다. 이러한 현상은 수학 문제를 풀거나 코드를 작성하는 작업에서 잘 문서화되어 있는 '프롬프트-모델 상호작용(prompt-model interaction)'이라 불리는 현상이다. 그러나 하나의 미스터리가 남아 있었다. 이 민감성이 모델이 작업을 수행하는 데 사용하는 복잡한 메커니즘에 속하는 것인가, 아니면 모델이 정보를 처리하는 방식 자체의 근본적인 속성인가 하는 점이다. 이를 알아내기 위해 과학자들은 모델이 아무것도 하지 않고 있을 때를 관찰할 필요가 있었다. 그들은 모델을 지시, 목표, 혹은 정답을 맞춰야 한다는 압박에서 벗어나 순수한, 과업 없는 존재 상태로 만들어 관찰해야 했다.

독립 연구진은 과업을 완전히 제거함으로써 이를 조사하기 위해 나섰다. 모델에게 문제를 풀라고 요청하는 대신, 짧은 텍의 시퀀스를 입력하고 모델이 다음 단어, 그리고 그다음 단어를 예측하도록 강제하여 연속적인 루프를 돌게 했다. 모델이 무작위로 샘플링하는 것이 아니라 가장 가능성 높은 다음 단어를 선택하는 엄격하고 결정론적인 규칙을 따르고 있었기 때문에, 이 과정은 공이 언덕을 굴러 내려가 골짜기에 안착하는 것과 같았다. 어떤 경우에서 공은 하나의 안정적인 골짜기로 굴러 들어가 영원히 그곳에 머물렀고, 다른 경우에는 루프에 갇히거나 정처 없이 헤매기도 했다. 연구진은 모델의 예측이 얼마나 자주 그 안정적인 상태로 수렴하는지를 측정했으며, 이를 '고정점 분율(fixed-point fraction)'이라는 지표로 불렀다. 그런 다음 시퀀스가 시작되기 전, 단 아홉 개의 단어 혹은 토큰의 짧은 접두사를 추가했을 때 이 행동이 어떻게 변하는지 테스트했다. 목표는 간단했다. 아주 작은 추가 텍스트가 모델이 아무런 목적을 수행하지 않고 있을 때조차 모델의 내부 궤적을 근본적으로 바꿀 수 있는지 확인하는 것이었다.

결과는 놀라웠으며 연구진의 예상마저 뛰어넘었다. 프롬프트와 모델 사이의 상호작용이 이 과업 없는 판독(task-free readout) 단계에서도 온 힘을 다해 나타난다는 것을 발견했다. 단 아홉 개의 토큰의 조건부 텍스트를 추가하는 것만으로도 측정된 판독값을 가능한 전체 범위로 이동시키기에 충분했다. 어떤 모델의 경우, 이 작은 추가는 혼란스럽고 헤매는 듯한 예측 패턴을 완벽하게 안정적인 것으로 바꾸어 놓았다. 다른 모델의 경우에는 정반대로, 이전에 안정적이었던 패턴을 파괴하고 예측을 루프로 몰아넣었다. 그 효과는 너무나 강력해서 모델 행동의 구조적 분류 자체를 바꿀 수 있을 정도였다. 이를 설명하기 위해 연구진은 모델의 표준 벤치마크 성능을 보통 60점 이상 높이는 거대한 훈련 과정인 '지시어 튜닝(instruction tuning)'의 영향과 비교했다. 그러한 강력한 훈련이 모델의 과업 수행 능력은 크게 변화시켰지만, 이 특정 구조적 판독값은 전혀 변화시키지 못했다. 반면, 단 아홉 단어의 접두사는 모델의 행동을 한 극단에서 다른 극단으로 뒤집을 수 있었다. 이는 프롬프트-모델 상호작용이 단순히 모델이 지시를 따르는 방식의 기벽이 아니라, 모델이 텍스트의 파편을 읽는 방식에 관한 깊은 구조적 사실임을 입증했다.

연구진은 왜 이런 일이 일어나는지 설명하기 위해 그럴듯해 보이는 몇 가지 자연스러운 이론들을 제안했다. 그들은 추가된 텍스트의 길이가 원인인지, 아니면 내용(평범한 산문인지 형식이 갖춰진 코드인지)이 동력인지 궁금해했다. 또한 이 효과가 보편적인 것인지, 즉 항상 모델을 같은 방향으로 밀어붙이는 것인지, 아니면 지시를 따르도록 훈련된 특정 유형의 모델들이 가진 특정한 형질인지도 고려했다. 그들은 소규모 모델 그룹으로 시작하여 더 다양한 아키텍처와 텍스트 유형을 포함하도록 표본을 넓혀가며 이 아이디어들을 엄격하게 테스트했다. 그들이 제안한 다섯 가지 구체적 요인 분해(후보 설명)는 모두 표본 확대 과정에서 실패했다. 효과는 단순히 텍스트의 길이에 관한 것이 아니었다. 사실 관계는 매끄럽거나 예측 가능하지 않았으며, 어떤 모델은 단 한 단어의 추가에 격렬하게 반응하는 반면 다른 모델은 이를 무시하기도 했다. 텍스트의 내용 또한 패턴을 설명하는 데 실패했다. 한 모델에 효과적이었던 것이 다른 모델에는 실패하는 경우가 많았고, 변화의 방향은 텍스트와 모델의 특정 조합에 따라 뒤바뀌었다. 지시어 훈련을 받은 모델들이 이러한 변화에 저항할 것이라는 생각조차 더 다양한 텍스트를 테스트했을 때 거짓임이 드러났다.

이 모든 설명이 해체된 후 남은 것은 단순하고도 완고한 현실이었다. 효과는 개별적인 텍스트나 모델이 아니라, 프롬프트와 모델의 특정 쌍(pair)에 속해 있었다. 하나의 고정된 아홉 단어 접두사가 네 개의 서로 다른 모델을 완전한 안정 상태로 몰아넣는 동안, 두 개의 다른 모델은 완전한 혼돈 상태로 밀어 넣을 수 있었다. 한 모델의 예측을 고정시킨 것과 동일한 텍스트가 다른 모델의 예측을 붕괴시켰다. 이러한 행동은 연구진이 실제 세상에서 흔히 쓰이는 텍스트를 사용했을 때도 살아남았으며, 이는 이것이 이상하거나 무작위적인 단어를 사용해서 생긴 인위적인 결과가 아님을 증명했다. 연구진은 또한 모델의 내부 메커니즘, 구체적으로 모델이 시퀀스의 첫 번째 토큰에 얼마나 많은 주의(attention)를 기울이는지를 살펴보았다. 초기 토큰이 '싱크(sink)' 역할을 하여 모델의 집중을 흡수하고 결과를 결정한다는 유명한 이론이 있었다. 그러나 이를 측정했을 때, 그 이론은 변화의 방향을 예측하는 데 실패했다. 어떤 모델에서는 어텐션 싱크가 증가할 때 안정성도 높아졌지만, 다른 모델에서는 어텐션 싱크가 증가했음에도 안정성이 급락했다. 기계적 설명은 실제 텍스트에서는 유효했지만, 프로브(probe)에 사용된 무작위 입력에 대해서는 완전히 무너졌으며, 이는 연구진이 해당 기계적 이론이 적용되는 범위를 벗어나서 작업하고 있었음을 시사했다.

이 연구는 이 현상의 설명 단위가 프롬프트-모델 쌍 그 자체라고 결론짓는다. 특정 모델이 특정 프롬프트에 어떻게 반응할지를 예측할 수 있는 단일한 규칙(텍스트 길이, 내용, 혹은 모델 유형에 관한 규칙)은 존재하지 않는다. 연구진은 자신들의 데모가 흔히 범하는 오류, 즉 변할 여지가 없는 양량에 대해 경직된 기준을 적용하는 실수를 범했다는 점을 깨달았다. 예를 들어, 처음에 그들은 모든 모델이 같은 방향으로 움직이는 보편적인 방향을 찾았다고 생각했으나, 곧 자신들의 작은 표본 크기가 예외들을 숨기고 있었다는 것을 깨달았다. 표본을 넓히고 패턴이 실패할 수 없다는 것을 받아들이지 않음으로써, 그들은 자신들의 발견이 정직하다는 것을 보장했다. 최종적인 그림은 심오한 특수성이다. 모델이 텍스트의 파편을 읽는 방식은 일반적인 모델의 속성도 아니고, 일반적인 텍스트의 속성도 아니다. 그것은 특정 텍스트가 특정 모델과 만날 때만 발생하는 고유한 상호작용이다. 연구진은 과학계가 이를 계속 테스트하기를 권고하지만, 새로운 요인이 동일한 엄격한 표본 확대 과정을 견뎌내기 전까지, 답은 상호작용이 단순한 범주화를 거부하는 쌍 특이적(pair-specific) 사건이라는 사실로 남아 있다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →