← 최신 논문
🤖 machine learning

Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models

본 논문은 바이트 단위 언어 모델에서 동적으로 일시적인 스크래치패드를 삽입하여 패치 지연을 완화함으로써 연산과 패치 크기를 분리하는 스크래치패드 패칭 (SP) 기법을 소개하며, 이를 통해 모델링 품질을 저하시키지 않으면서도 KV 캐시 및 연산 비용을 줄이기 위해 더 큰 패치를 사용할 수 있도록 한다.

원저자: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

게시일 2026-05-12
📖 3 분 읽기☕ 가벼운 읽기

원저자: Lin Zheng, Vasilisa Bashlovkina, Timothy Dozat, Dan Garrette, Laura Rimell, Joshua Maynez

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 긴 책을 읽으려는데, 한 번에 한 장씩이 아니라 한 줌씩 페이지를 잡아서만 볼 수 있다는 엄격한 규칙이 있다고 상상해 보세요. 이것이 현대의 '패치 기반' AI 모델이 작동하는 방식입니다. 단어별로(토큰 단위) 읽는 대신, 문자의 원시 컴퓨터 코드인 바이트를 패치라고 불리는 그룹 단위로 읽습니다.

이 '한 줌씩 잡기' 방식의 문제는 저자들이 **패치 지연 (Patch Lag)**이라고 부르는 현상입니다.

문제: '오래된' 한 줌

단락을 읽는다고 상상해 보세요. 처리할 텍스트 덩어리 (패치) 를 한 줌 잡습니다.

  • 마지막 페이지: 그 덩어리의 마지막 페이지에 도달하면, 방금 읽은 내용에 대한 전체 그림을 갖게 됩니다. 다음에 무엇이 올지 완벽하게 추측할 수 있습니다.
  • 첫 페이지: 하지만 같은 덩어리의 페이지에 있을 때는 아직 덩어리의 나머지 부분을 보지 못했습니다! 따라서 이전에 읽은 이전 덩어리를 바탕으로 추측해야 합니다.

덩어리가 거대하다면 (예: 16 바이트), 앞선 15 바이트는 과거의 '오래된' 정보를 바탕으로 추측하게 됩니다. 덩어리가 클수록 이 '지연'은 더 길어지고, AI 가 다음 문자를 예측하는 능력은 더 떨어집니다.

보통은 다음 중 하나를 선택해야 합니다:

  1. 작은 덩어리: 정확도는 높지만, AI 가 많은 작업을 해야 하므로 느리고 비용이 많이 듭니다.
  2. 큰 덩어리: 빠르고 저렴하지만, AI 가 너무 앞서서 추측하기 때문에 실수가 더 많습니다.

해결책: '스크래치패드'

저자들은 **스크래치패드 패칭 (Scratchpad Patching, SP)**이라는 교묘한 트릭을 소개합니다.

이렇게 생각해 보세요: 효율성을 유지하기 위해 여전히 큰 한 줌의 페이지 (패치) 를 잡습니다. 하지만 그 손 안에는 일시적인 스크래치패드가 있습니다.

덩어리의 앞쪽 몇 페이지를 볼 때, 스크래치패드에 빠르게 메모를 적습니다.

  • 마법 같은 점: 이 메모는 일시적입니다. 이를 통해 이해도를 즉시 업데이트하여 다음 몇 페이지에 대한 추측을 더 잘할 수 있습니다.
  • 단점: 덩어리를 처리하고 다음 것으로 이동하면 스크래치패드를 버립니다. 장기 기억 (KV 캐시) 에 보관하지 않습니다.

이를 통해 AI 는 덩어리의 최종 결과만 저장하므로 큰 덩어리의 속도를 가지면서도, 덩어리 중간에 지식을 갱신하므로 작은 덩어리의 지능을 갖게 됩니다.

언제 스크래치패드를 사용할지 어떻게 알까요?

AI 는 모든 문자마다 스크래치패드를 사용하지 않습니다. 그렇게 하면 너무 느려지기 때문입니다. 대신 엔트로피(놀라움 또는 불확실성을 나타내는 어려운 용어) 를 기반으로 한 '교통등' 시스템을 사용합니다.

  • 낮은 놀라움: 텍스트가 지루하고 예측 가능하다면 (예: "고양이가 ... 위에 앉았다"), AI 는 스크래치패드를 건너뜁니다. 다음에 무엇이 올지 알고 있기 때문입니다.
  • 높은 놀라움: 텍스트가 복잡하거나 예측 불가능해지면 (예: 갑작스러운 코드 변수 이름이나 이상한 기호), AI 는 스크래치패드를 활성화합니다. "잠깐, 이건 중요해! 다음 문자를 추측하기 전에 이 덩어리에서 지금까지 본 모든 것을 다시 평가해 보자"라고 말합니다.

결과: 양쪽 세계의 최고

이 논문은 이 방법이 마법 같은 스위치처럼 작동함을 보여줍니다:

  1. 비용 없는 품질: 매우 큰 덩어리 (16 바이트) 를 사용하더라도, 스크래치패드를 가진 AI 는 바이트 단위로 읽는 것과 거의 동일한 성능을 발휘합니다.
  2. 메모리 절약: 스크래치패드는 즉시 버려지므로 AI 는 추가 메모리를 저장할 필요가 없습니다. AI 의 단기 기억인 'KV 캐시'를 표준 바이트 단위 모델보다 16 배 작게 유지합니다.
  3. 유연한 속도: 모델이 훈련된 후에도 '스크래치패드 스위치'를 조절할 수 있습니다. 매우 빠르게 만들려면 스크래치패드를 끄고, 더 똑똑하게 만들려면 켭니다. 이를 위해 모델을 다시 훈련할 필요가 없습니다.

요약 비유

거대한 스튜를 요리하는 셰프가 있다고 상상해 보세요.

  • 구식 방법 (일반 패칭): 10 분에 한 번만 스튜를 맛봅니다. 1 분目に 매운 재료를 넣으면 10 분까지 다시 맛보지 못합니다. 그때까지 맛이 변질되었을 수 있습니다.
  • 새로운 방법 (스크래치패드 패칭): 레시피를 기록하기 위해 10 분마다 '공식' 맛을 보는 것은 여전히 같습니다. 하지만 그 사이에서 냄새가 극적으로 변할 때 (높은 엔트로피) 숟가락을 넣어 즉시 간을 맞춥니다. 맛본 후 숟가락을 버리므로 수백만 개의 숟가락을 씻을 필요가 없지만 (메모리), 스튜의 맛은 완벽합니다.

이 논문은 이러한 임시 '맛보기'(스크래치패드) 를 추가함으로써 거대한 냄비 (긴 텍스트 처리) 를 빠르고, 저렴하며, 완벽한 맛으로 요리할 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →