← 최신 논문
🤖 machine learning

LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget

LongStraw는 자동 미분(autograd) 없는 프롬프트 공유 평가와 순차적 응답 리플레이를 통해 메모리 사용량을 최적화함으로써 고정된 GPU 예산 내에서 백만 토큰 규모의 강화 학습 사후 학습을 가능하게 하는 아키텍처 인식 실행 스택으로, Qwen3.6-27B 및 GLM-5.2와 같은 모델에서 200만 토큰 이상의 컨텍스트 길이에 대한 실행 능력을 성공적으로 입증하였다.

원저자: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Che
게시일 2026-07-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 거대하고 다단계적인 미스터리를 해결하는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 해결책을 추측하기 시작하기도 전에 도서관 한 권 분량의 단서(즉, "컨텍스트")를 읽어야 합니다. 인공지능의 세계에서 이것을 "롱 컨텍스트 트레이닝(long-context training)"이라고 부릅니다. 보통 우리가 이 로봇들을 훈련시킬 때는, 엄청나게 긴 단서가 담긴 책을 로봇에게 먹여준 다음 짧은 답변을 쓰라고 요구합니다. 문제는 로봇의 뇌(컴퓨터 메모리)가 그 책의 세부 사항들로 너무 가득 차버려서, 답변을 완성하기도 전에 공간이 부족해진다는 점입니다. 이는 마치 도서관 전체를 손에 들고 미스터리를 풀려고 하는 것과 같습니다. 결국, 당신의 팔은 움직일 힘조차 남지 않게 될 것입니다.

이를 해결하기 위해 과학자들은 모든 정보를 담아둘 수 있도록 점점 더 큰 컴퓨터 칩(GPU)의 도서관을 구축해 왔습니다. 하지만 만약 당신에게 슈퍼컴퓨터가 없다면 어떨까요? 만약 당신이 8개나 32개처럼 정해진 적은 수의 칩만을 가지고 있다면 어떻게 될까요? 이것이 바로 "LongStraw"라는 논문이 해결하고자 하는 퍼즐입니다. 이 논문은 다음과 같이 묻습니다. 우리는 더 많은 칩을 구매하지 않고도, 고정된 적은 수의 컴퓨터 칩만을 사용하여 로봇이 200만 단어짜리 이야기를 읽고 해결책을 쓰도록 가르칠 수 있을까요? 그 답은 "네, 우리는 칩을 더 크게 만들었습니다"가 아니라, "네, 우리는 책을 잡는 방식을 바꿨습니다"입니다.

연구진은 LongStraw라고 불리는 영리한 시스템을 구축했습니다. 이것을 매우 정리 정돈을 잘하는 사서라고 생각해보세요. 로봇이 답변을 쓰는 동안 200만 단어짜리 이야기를 책상 위에 통째로 펼쳐 놓는 대신(그렇게 하면 책상이 무너질 것입니다), 사서는 이야기를 한 번 쭉 읽고 나서 이야기의 핵심적인 "분위기"나 "상태"만을 기억한 뒤 무거운 책을 치워버립니다. 이제 로봇은 그 작은 "분위기" 메모만을 보면서 짧은 답변을 쓰기만 하면 됩니다. 만약 로봇이 특정 세부 사항을 확인해야 한다면, 사서는 재빨리 그 페이지 하나만을 꺼내서 로봇에게 보여준 뒤 즉시 다시 집어넣습니다. 이렇게 하면 이야기가 아무리 방대하더라도 책상이 어지러워지지 않습니다.

이 논문은 이 아이디어를 QwenGLM이라는 두 가지 유형의 로봇 뇌에 테스트했습니다. 연구진은 이 로봇들이 (프롬프트/이야기가) 2,097,152 토큰(약 200만 단어 또는 글자)인 내용을 읽고 응답을 작성하도록 했습니다. 이 과정은 엄격한 예산 하에 진행되었습니다: Qwen 로봇에는 8개의 H20 GPU를, GLM 로봇에는 32개의 H20 GPU를 사용했습니다.

결과는 다음과 같습니다:

  • "읽기" 부분은 성공적이었습니다: 연구진은 컴퓨터 메모리가 충돌하지 않고도 200만 토큰의 전체 이야기를 성공적으로 처리해 냈습니다. 정보를 언제 붙잡고 있고 언제 놓아줄지를 영리하게 조절함으로써, 고정된 수의 칩에 이 거대한 작업을 담아낼 수 있음을 증명했습니다.
  • 공간은 절약하지만, 시간은 더 걸립니다: 무거운 책을 치워두었다가 필요할 때만 페이지를 꺼내는 방식을 통해 엄청난 양의 메모리를 아꼈습니다. 예를 들어, 로봇의 "추측" 횟수(그룹 크기)를 2에서 8로 늘렸을 때, 메모리 사용량은 거의 변하지 않았지만(약 0.21 GB 증가), 페이지를 한꺼번에 꺼내는 대신 하나씩 꺼내야 했기 때문에 작업을 마치는 데 시간이 더 오래 걸렸습니다.
  • 이것은 "개념 증명"이지, 완벽한 결말은 아닙니다: 이 논문은 자신들이 하지 못한 부분에 대해서도 매우 솔직합니다. 시스템이 시뮬레이션을 성공적으로 실행했고 로봇이 긴 이야기를 읽고 답변을 쓸 수 있다는 것을 보여주긴 했지만, 로봇이 자신의 뇌를 업데이트하는 "완벽한 방식"을 완전히 배웠다는 것까지 입증하지는 못했습니다. 로봇의 서로 다른 "뇌 부위"(그래디언트)를 연결하는 수학적 계산 중 일부가, 완벽한 훈련 세션에서 요구되는 방식만큼 모든 칩 사이에서 완전히 동기화되지 않았기 때문입니다. 이는 마치 자동차 엔진이 아주 적은 양의 연료로도 작동할 수 있다는 것은 보여주었지만, 아직 경주 트랙 전체를 멈춤 없이 달릴 수 있다는 것까지는 증명하지 못한 것과 같습니다.

연구진은 이 결과를 "실행 영수증(execution receipt)"이라고 부릅니다. 이는 "네, 우리는 특정 하드웨어에서 이 거대한 작업을 충돌 없이 성공적으로 실행했습니다"라고 말해주는 영수증입니다. 그들은 레이스에서 승리했거나 가장 빠른 차를 만들었다고 주장하는 것이 아닙니다. 단지 그 차가 특정 양의 연료를 가지고 특정 트랙을 달릴 수 있다는 것을 증명했을 뿐입니다.

요약하자면, LongStraw는 AI를 거대한 이야기에 대해 훈련시키기 위해 반드시 슈퍼컴퓨터가 필요한 것은 아니라는 점을 보여줍니다. 대신, 시간을 조금 더 투자하더라도 훨씬 더 많은 공간을 절약할 수 있는 더 똑똑한 메모리 관리 방식이 필요합니다. 이는 더 적은 예산을 가진 작은 팀이나 연구자들이 거대한 AI 모델을 실험할 수 있는 길을 열어주며, 충분히 영리하다면 고정된 작은 도구 세트로도 큰 일을 해낼 수 있음을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →