Neither Parallel Nor Sequential: How DiffusionGemma Actually Commits Tokens
DiffusionGemma 26B를 계측함으로써, 본 연구는 해당 모델의 토큰 확정 과정이 순수하게 병렬적이지도 엄격하게 순차적이지도 않으며, 오히려 대규모의 동시 배치를 형성하는 레짐 의존적인 부분적 좌에서 우로의 편향임을 밝혀내며, 이는 인지된 디코딩 순서가 고정된 아키텍처적 속성이라기보다 측정 정밀도의 산물인 경우가 많음을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
거대하고 혼란스러운 예술 작업실을 상상해 보세요. 한 로봇이 커다란 캔버스에 그림을 그리거나(또는 이야기를 쓰려고) 노력하고 있습니다.
기존의 방식(이를 "자기회귀(Autoregressive)" 모델이라고 부릅니다)에서 로봇은 마치 책을 읽는 것처럼 엄격하게 왼쪽에서 오른쪽으로 그림을 그립니다. 단어 하나를 완성하면, 그다음 단어를 하나씩 완성해 나가는 식이죠.
새로운 "디퓨전(Diffusion)" 방식에서 로봇은 마스크로 가려진 빈 사각형들로 가득 찬 캔버스를 가지고 시작합니다. 이 로봇은 전체 그림을 한 번에 보고 동시에 많은 사각형을 채워 넣어야 합니다. 연구자들이 던진 큰 질문은 이것이었습니다: 이 새로운 로봇이 실제로 캔버스 전체를 한꺼번에 그리는 것일까요, 아니면 몰래 다시 왼쪽으로 돌아가서 단어 단위로 하나씩 그리는 것일까요?
이 논문의 저자들은 로봇이 정확히 어떻게 그리는지 관찰하기 위해 로봇의 뇌 안에 아주 작은 카메라를 설치하기로 했습니다. 그들은 DiffusionGemma라는 특정 모델을 연구했습니다.
연구 결과는 다음과 같이 쉽게 설명할 수 있습니다.
1. "한꺼번에"도 아니지만, "하나씩"도 아니다
로봇은 단 한 번의 마법 같은 섬광으로 전체 그림을 그리는 것도 아니고, 인간이 책을 읽는 것처럼 엄격하게 왼쪽에서 오른쪽으로만 그리는 것도 아닙니다.
대신, 로봇은 크고 무더기적인 배치(batches) 단위로 그립니다.
- 비유: 선생님이 20개의 에세이 뭉치를 채점하고 있다고 상상해 보세요. 엄격한 왼쪽에서 오른쪽 방식의 로틴을 가진 로봇이라면 에세이 1번을 채점하고, 그다음 2번, 그다음 3번을 채점할 것입니다.
- DiffusionGemma가 하는 일: 로봇은 한 움큼의 에세이(예를 들어 15개)를 집어 들고, 그것들을 동시에 채점한 뒤 내려놓습니다. 그러고 나서 또 다른 한 움큼을 집어 들어 채점합니다.
- 결과: 이 한 움큼 안에서는 로봇이 어떤 에세이를 먼저 채점했는지 상관하지 않습니다. 그것은 하나의 "배치" 작업입니다. 이러한 큰 배치 단위로 작업을 수행하기 때문에 순서가 약간 무질서해 보일 수 있지만, 배치를 진행함에 따라 여전히 왼쪽에서 오른쪽으로 이동하려는 약간의 경향성이 나타납니다.
2. "16블록"의 신화
이전에는 사람들이 로봇이 완벽한 16단어 블록(마치 16개의 객차가 달린 기차처럼) 단위로 작동한다고 생각했습니다.
- 연구 결과: 연구진은 로봇의 작업을 4, 8, 16, 32, 64단어 그룹으로 나누어 테스트했습니다.
- 진실: 로봇은 16단어에서 갑자기 완벽한 패턴으로 딱딱 끊겨서 작동하지 않았습니다. 그룹이 커질수록 패턴은 그저 더 매끄러워지고 더 "왼쪽에서 오른쪽으로" 향하는 성질을 띠게 될 뿐이었습니다. 16이라는 숫자는 로봇을 위한 특별한 규칙이 아니라, 연구진이 데이터를 살펴보기 위해 선택한 숫자였을 뿐입니다. 로봇은 그보다 더 유동적입니다.
3. "JSON" 예외 사항
로봇은 요청받은 작업에 따라 다르게 행동합니다.
- 이야기, 코드, 수학 문제의 경우: 이 "무더기 배치" 형태의 왼쪽에서 오른쪽 패턴을 따릅니다.
- 구조화된 데이터(JSON 등)의 경우: 거의 무작위로 흩뿌리는 것처럼 행동합니다. 만약 특정 키와 값을 가진 양식을 채우라고 요청하면, 로봇은 순서에 전혀 신경 쓰지 않습니다. 로봇은 순서에 대한 편향 없이 자신이 원하는 곳 어디든 채워 넣습니다.
4. "확신도" 체크
로봇에게는 "확신도 미터기"(단어를 확정하기 전에 해당 단어에 대해 얼마나 확신하는지를 측정하는 장치)가 있습니다.
- 수학 문제의 경우: 로봇이 매우 확신할 때(낮은 엔트로피), 대개 정답을 맞힙니다. 확신이 없을 때는 틀릴 가능성이 높습니다. 여기서 확신도 미터기는 잘 작동합니다.
- 사실 관계 질문의 경우: 확신도 미터기는 쓸모가 없습니다. 로봇은 매우 확신하면서도 사실을 틀릴 수 있습니다. 이는 마치 어떤 학생이 프랑스의 수도가 "런던"이라고 100% 확신하며 말하는 것과 같습니다. 근거가 있어서가 아니라 단순히 본인이 확신하고 있기 때문입니다.
5. "조기 종료"의 놀라움
로봇에게는 작업을 끝내기 위해 최대 48 "스텝(생각하는 단계)"까지 사용할 수 있는 예산이 주어졌습니다.
- 현실: 로봇은 전체 예산을 거의 사용하지 않습니다. 보통 단 3~17 스텝이라는 아주 짧은 폭발적인 단계 내에 작업을 끝냅니다. 로봇은 시간이 다 지나가기도 훨씬 전, 이미 매우 확신이 든 상태에서 매우 빠르게 답을 확정 짓습니다.
6. 기존의 로봇보다 뛰어난가?
연구진이 이 새로운 디퓨전 로봇을 기존의 "왼쪽에서 오른쪽으로" 가는 로봇(Gemma-4)과 비교했을 때, 수학, 사실 관계, JSON 작업에서 정답을 맞히는 능력은 동등하게 우수함을 발견했습니다. 새로운 로봇은 단지 조금 더 무질서한 방식으로 그곳에 도달할 뿐입니다.
요약
이 논문은 DiffusionGemma가 순수하게 병렬적이지도, 순수하게 순차적이지도 않다고 결론 내립니다. 그것은 하이브리드입니다:
- 크고 동시적인 배치 단위로 작업합니다.
- 멀리서 바라볼 때만 나타나는 약한 왼쪽에서 오른쪽으로의 경향성을 가집니다.
- 조기에 종료하며, 확신이 생기면 생각을 멈춥니다.
- "확신"은 수학에서는 성공을 예측하는 좋은 지표이지만, 사실 관계에서는 나쁜 지표입니다.
저자들은 우리가 이 모델들이 완벽한 블록이나 완벽한 선 형태로 작동한다고 가정하는 것을 멈춰야 한다고 강조합니다. 이 모델들은 마치 팀을 이루어 일하는 화가들과 같습니다. 때로는 겹쳐서 작업하고, 때로는 일찍 끝내며, 작업 종류에 따라 순서를 완전히 무시하기도 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.