← 최신 논문
💬 NLP

Production and Perception in LLMs: A Token Probability Approach

이 연구는 대규모 언어 모델이 토큰 확률 분포에서 프롬프트 프레이밍만으로도 생성된 텍스트와 재평가된 텍스트 간에 유의미하게 다른 가능성을 유도하는 뚜렷한 생성-지각 비대칭성을 보이며, 이러한 현상이 다양한 모델 아키텍처 전반에 걸쳐 재현되고 시퀀스 컨텍스트가 축적됨에 따라 감소한다는 것을 입증한다.

원저자: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 아주 똑똑한 로봇 시인이 있다고 상상해 보세요. 당신이 고슴도치에 대한 시를 써달라고 부탁하자, 로봇은 시를 씁니다. 하지만 여기 반전이 있습니다. 이 로봇은 인간처럼 단순히 '생각'하고 나서 '말하는' 것이 아닙니다. 이 로봇은 당신이 쓴 글을 읽는 데 사용하는 것과 자신의 단어를 쓰는 데 사용하는 것과 정확히 동일한 뇌 회로를 사용합니다. 마치 자동차가 양방향으로 달리기 위해 같은 엔진을 사용하는 일방통행로와 같습니다.

이 때문에 과학자들은 의문을 가졌습니다: 이 로봇에게 시를 '쓰는' 것과 시를 '읽는' 것 사이에 실제로 차이가 있을까? 아니면 그저 과정을 거꾸로 돌린 것뿐일까?

위대한 발견: "역할 연기(Role-Play)" 효과

연구진은 그렇다, 로봇은 다르게 행동한다는 것을 발견했습니다. 하지만 이는 로봇이 감정이나 의도를 가졌기 때문이 아닙니다. 로봇은 프롬프트, 즉 당신이 무언가를 요청하는 구체적인 방식에 따라 행동을 바꿉니다.

로봇을 메소드 배우처럼 생각해 보세요.

  • 시나리오 A (생산): 당신이 "고슴도치에 대한 시를 써주세요"라고 말합니다. 로봇은 '작가' 모자를 씁니다. 로봇은 단어를 생성하기 시작하며, 자신이 선택하는 각 단어에 특정 수준의 확신도(확률)를 부여합니다.
  • 시나리오 B (지각): 당신이 로봇이 방금 쓴 것과 정확히 똑같은 시를 가져와서, "여기 고슴도치에 대한 시가 있습니다. 점수를 매겨주세요"라고 말합니다. 로봇은 '독자/비평가' 모자를 씁니다. 로봇은 새로운 단어를 생성하는 대신, 방금 본 단어들을 재평가합니다.

연구진은 이 두 시나리오 사이에서 로봇의 '확신도'가 얼마나 변했는지 측정했습니다.

결과: 로봇이 '작가' 모드에서 '독자' 모드로 전환되었을 때, 단어에 대한 확신도가 크게 변화했습니다. 그 차이는 엄청났습니다. 실제로 로봇이 시를 쓰는 두 가지 다른 방식으로 요청했을 때의 차이보다, 시를 쓰는 것과 읽는 것 사이의 격차가 약 1.8배 더 컸습니다.

숫자로 표현하면 다음과 같습니다:

  • 로봇에게 약간 다른 두 가지 방식으로 쓰라고 요청했을 때(예: "시를 써줘" vs "시를 써주셨으면 합니다"), 단어 선택의 차이는 매우 작았습니다(약 0.010).
  • 하지만 쓰기에서 읽기로 전환했을 때, 그 차이는 0.034로 급증했습니다.

이는 단순히 요청의 "프레이밍(틀 짜기)"을 바꾸는 것—로봇에게 창작자가 될 것인지 비평가가 될 것인지 말해주는 것—만으로도, 로봇이 두 작업을 수행하기 위해 동일한 뇌 부위를 사용함에도 불구하고 내부적인 수학적 계산 방식이 달라질 수 있음을 시사합니다.

로봇이 하고 있는 것이 '아닌' 것

이 논문은 이 현상이 무엇이 아닌지에 대해 매우 명확히 밝히고 있습니다.

  • 이것은 로봇이 갑자기 인간과 같은 의도나 영혼을 갖게 된 것이 아닙니다. 로봇은 실제로 쓰고 싶어 하거나 읽고 싶어 하는 '욕구'가 없습니다.
  • 이것은 로로봇이 한쪽 작업에 더 능숙하기 때문도 아닙니다.
  • 이것은 단순히 사용된 단어들로 인한 오류도 아닙니다. 연구진은 시를 요청하는 네 가지 서로 다른 방식을 사용하여 이를 테스트했습니다. 효과는 요청 방식에 상관없이 매번 나타났습니다.

"첫인상" 법칙

이 현상이 언제 발생하는지에 대한 또 다른 흥식한 디테일이 있습니다. "쓰기"와 "읽기" 사이의 차이는 시의 맨 처음에 가장 강력하게 나타납니다.

프롬프트가 경주 시작 때 지시를 내리며 크게 외치는 목소리라고 상상해 보세요.

  • 시작 부분 (토큰 1~10): "독자"의 목소리가 매우 크며, 로봇의 확신도가 크게 요동칩니다.
  • 시가 진행됨에 따라: 로봇은 자신의 단어를 읽기 시작합니다. 로-봇이 들려주는 이야기(문맥)가 원래의 지시 사항을 덮어버리기 시작합니다. "작가" 모드와 "독자" 모드의 차이는 시가 길어질수록 점점 작아집니다.

연구진은 이 쇠퇴 과정을 모델링했으며, 초기 "충격"은 사라지지만 끝부분에도 미세한 차이가 남아 있다는 것을 발견했습니다.

얼마나 확신하는가?

연구팀은 단순히 추측한 것이 아니라, 1,089개의 서로 다른 시(약 93,000단어)를 5개의 서로 다른 로봇 모델(Llama-3.1-8B, EuroLLM-9B 등 포함)을 사용하여 실험했습니다.

  • 그들은 이 효과를 다섯 가지 모델 모두에서 발견했으며, 여기에는 "가공되지 않은" 베이스 모델과 도움을 주는 어시스턴트로 훈련된 모델이 모두 포함되었습니다.
  • 이 차이는 매우 일관적이어서, "쓰기"와 "읽기"의 결과 범위가 전혀 겹치지 않았습니다.

하지만 저자들은 이 결과가 기능적인 차이를 시사한다고 조심스럽게 언급하며, 로봇이 인간처럼 생각한다는 뜻은 아니라고 말합니다. 그들은 이 차이가 통계적으로는 실재하고 측정 가능하지만, 이것이 말하기와 듣기를 구분하는 인간의 사고 방식과 정말로 유사한 수준인지에 대해서는 아직 알 수 없다고 덧붙였습니다.

결론

이 연구는 대규모 언어 모델이 읽기와 쓰기 모두에 단일하고 대칭적인 엔진을 사용함에도 불구하고, 당신이 어떻게 말을 거느냐에 따라 모델의 처리 방식이 달라진다는 것을 보여줍니다.

만약 당신이 로봇에게 시인이 되라고 말하면, 로봇은 한 방식으로 생각합니다. 만약 당신이 비평가가 되라고 말하면, 로봇은 다른 방식으로 생각합니다. 그것은 마치 카멜레온과 같습니다. 로봇의 내부 "색상"(확률 분포)은 당신이 부여한 역할에 맞춰 변화하며, 대화의 문맥이 단어 자체만큼이나 중요하다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →