← 최신 논문
🤖 machine learning

The Truth Lies Somewhere in the Middle (of the Generated Tokens)

본 논문은 자동회귀적으로 생성된 토큰에 대한 평균 풀링이 개별 토큰 상태보다 우수한 의미 표현을 산출함을 보여주며, 이는 정보가 단일 위치에 국한되지 않고 생성 전 과정에 걸쳐 분산되어 있음을 드러낸다.

원저자: Sophie L. Wang, Phillip Isola, Brian Cheung

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sophie L. Wang, Phillip Isola, Brian Cheung

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 당신에게 들려주는 이야기의 "영혼"이나 진정한 의미를 이해하려 한다고 상상해 보세요. 로봇 (AI 언어 모델) 은 이야기를 한 번에 통째로 뱉어내는 것이 아니라, 화가가 한 붓씩 붓질을 이어가듯 단어를 하나씩 쌓아 올리며 이야기를 만들어냅니다.

오랫동안 연구자들은 로봇이 쓴 마지막 단어만 보거나, 어쩌면 프롬프트의 첫 번째 단어만 보면 그 이야기를 이해할 수 있다고 생각했습니다. 그들은 로봇의 내부 "생각"(은닉 상태) 을 가장 중요한 정보가 단일 순간에 잠겨 있는 것처럼 취급했습니다.

이 논문은 진실은 사실 전체 이야기에 걸쳐 분산되어 있다고 주장합니다.

간단한 비유를 통해 그들의 발견을 살펴보면 다음과 같습니다:

1. "수프" 대 "단일 재료"

로봇이 수프를 만들고 있다고 상상해 보세요.

  • 옛날 방식: 연구자들은 수프가 "닭고기 수프"인지 "소고기 수프"인지 결정하기 위해 마지막 한 숟가락만 맛보곤 했습니다.
  • 새로운 발견: 저자들은 로봇이 만든 수프의 숟가락 한 숟가락씩 모두를 취해 섞으면 (이를 "평균 풀링"이라고 합니다), 그 결과물이 어떤 단일 숟가락보다 훨씬 더 명확하고 정확한 맛을 낸다는 것을 발견했습니다.

이 논문은 로봇이 주제에 대해 이해하는 방식이 특정 단어 하나에 잠겨 있지 않다고 보여줍니다. 대신 의미는 모자이크와 같습니다. 로봇이 생성하는 각 단어는 퍼즐의 작고 보완적인 조각을 담고 있습니다. 이 모든 것을 평균 내면 전체 그림이 선명하고 명확해집니다.

2. "관광 가이드" 비유

로봇을 당신이 질문한 주제 (박물관) 를 안내하는 관광 가이드라고 생각해 보세요.

  • 프롬프트: 당신은 가이드에게 "새 그림을 보여줘"라고 말합니다.
  • 생성: 가이드가 걷기 시작하며 말을 이어갑니다.
    • 초반 몇 걸음: "좋아요, 새에 대해 생각하고 있네요..." (일반적인 사고).
    • 중반 단계: "샌더링이 어떤 모습인지 떠올려 볼게요..." (회상 단계).
    • 나중 단계: "여기 모래를 쪼고 있는 샌더링의 그림이 있습니다..." (구체적인 세부 사항).

이 논문은 가이드가 "좋아요"라고 말할 때의 표정만 본다면 그 안내를 이해할 수 없으며, 끝부분만 본다면 맥락을 놓치게 된다는 것을 발견했습니다. 하지만 가이드의 전체 여정을 평균 내면 그 안내에 대한 완벽한 요약이 나옵니다.

놀랍게도 가이드의 자신만의 말(생성된 텍스트) 은 당신이 준 원래 지시사항보다 주제를 더 잘 이해하는 데 도움이 됩니다. 답을 말로 풀어내는 과정에서 로봇은 "생각"을 통해 더 명확한 이해에 도달합니다.

3. 다른 버전 섞기 ("합창" 효과)

연구자들은 재미있는 아이디어도 테스트했습니다. 로봇이 같은 이야기를 세 번 다른 방식으로 (세 가지 다른 무작위 "시드"를 사용하여) 들려준다면 어떨까요?

  • 버전 A는 "그 새는 파랗다"라고 말할 수 있습니다.
  • 버전 B는 "그 새는 푸른 깃털을 가졌다"라고 말할 수 있습니다.
  • 버전 C는 "푸른 샌더링입니다"라고 말할 수 있습니다.

세 가지 버전 모두에서 "생각"을 취해 섞으면, 어떤 단일 버전보다도 결과가 더 좋아집니다. 이는 합창단과 같습니다. 한 명의 가수는 약간 음정이 틀릴 수 있지만, 세 명의 다른 가수를 섞으면 화음이 완벽해집니다. 이는 정보가 분산되어 있음을 증명합니다. 어떤 단일 단어나 단일 버전이 전체 진실을 담고 있는 것이 아닙니다.

4. "거울" 효과

이 논문은 로봇이 자신을 어떻게 바라보는지에 대해 이상한 점도 발견했습니다.

  • 로봇 A 가 이야기를 쓰고, 로봇 A 가 그 이야기를 읽으면 완벽하게 이해합니다.
  • 하지만 로봇 B 가 로봇 A 의 이야기를 읽으면 "이해"가 혼란스러워집니다. 로봇 A 가 주제를 생각한 특정 리듬이 사라지기 때문입니다.

이는 "의미"가 단순히 페이지 위의 단어에 있는 것이 아니라, 로봇이 그곳에 도달하기 위해 취한 특정 경로에 있다는 것을 의미합니다. 로봇은 생성하는 과정에서 내부 상태가 변하며, 그 변화는 그 특정 로봇에게 고유합니다.

핵심 결론

이 논문은 AI 가 무엇을 생각하고 있는지에 대한 최고의 "요약"을 얻으려면 마지막에 말한 단어만 가져와서는 안 된다고 결론 내립니다. 대신 생각하는 동안 말한 모든 것의 평균을 취해야 합니다.

이는 사람의 기분을 이해하려는 것과 같습니다. 그들이 방금 말한 한 문장으로 판단하지 않고, 전체 대화의 평균으로 판단합니다. "진실"은 모든 생성된 토큰의 맨 끝이 아니라, 그 모든 것의 어딘가 중간에 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →