← 최신 논문
💻 computer science

Versioned Late Materialization for Ultra-Long Sequence Training in Recommendation Systems at Scale

본 논문은 사용자 상호작용 이력을 한 번만 저장하고 시퀀스를 필요 시에 재구성함으로써 초장기 시퀀스 학습에서 데이터 중복을 제거하는 버전 관리형 지연 물질화 패러다임을 소개하여, 확장 가능하고 고품질의 딥러닝 추천 모델을 가능하게 하는 저장 및 I/O 병목 현상을 극복합니다.

원저자: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

게시일 2026-04-29
📖 4 분 읽기☕ 가벼운 읽기

원저자: Liang Guo, Ge Song, Litao Deng, Jianhui Sun, Chufeng Hu, Lu Zhang, Zhen Ma, Shouwei Chen, Weiran Liu, Sarang Masti Sreeshylan, Xiaoxuan Meng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 도서관을 운영한다고 상상해 보세요. 도서관에는 도서관에 들어오는 모든 사람에게 완벽한 영화를 추천하는 방법을 배우는 초지능 로봇 (AI 모델) 이 있습니다.

이를 위해 로봇은 사용자의 전체 기록을 알아야 합니다. 지난 몇 년 동안 사용자가 무엇을 시청했는지, 무엇을 좋아했는지, 무엇을 건너뛸지 등입니다. 이를 **사용자 상호작용 기록 (UIH)**이라고 합니다.

구식 방식: "무거운 행 (Fat Row)" 문제

과거 도서관은 이 정보를 조직화하는 매우 비효율적인 방식을 사용했습니다. 로봇이 사용자를 연구할 때마다 사서들은 해당 사용자의 전체 기록을 복사하여 특정 학습 세션을 위해 단일 용지에 붙였습니다.

로봇이 1,000 명의 서로 다른 사용자를 연구해야 하고 각 사용자의 기록이 10,000 개의 사건으로 이루어져 있다면, 사서들은 1,000 개의 별도 용지를 만들어야 했습니다. 각 용지에는 10,000 개의 반복된 사실이 담겨 있었습니다.

  • 문제점: 이로 인해 데이터의 "무거운 행 (Fat Row)"이 생성되었습니다. 도서관은 선반 공간 (저장소) 이 부족해졌고, 사서들은 실제로 로봇을 가르치는 대신 종이를 복사하는 데 모든 시간을 보냈습니다.
  • 병목 현상: 이러한 거대하고 중복된 기록을 복사하고 저장하는 비용이 로봇을 훈련시키는 데 사용된 컴퓨터 (GPU) 비용보다 더 비싸게 될 정도로 높아졌습니다. 마치 교제비보다 복사 용지 비용에 더 많은 돈을 쓰는 것과 같습니다.

새로운 해결책: 버전 관리된 지연 물질화 (Versioned Late Materialization)

메타의 연구자들은 매번 기록을 복사할 필요가 없다는 것을 깨달았습니다. 사용자의 기록은 일방통행로와 같다는 것을 발견했습니다. 즉, 새로운 사건을 끝에 추가할 수는 있지만 과거로 돌아가 변경할 수는 없습니다.

그들은 **버전 관리된 지연 물질화 (Versioned Late Materialization)**라는 새로운 시스템을 발명했습니다. 간단한 비유를 통해 작동 방식을 설명해 보겠습니다.

1. 단일 마스터 책 (정규화된 저장소)
학생마다 기록을 복사하는 대신, 도서관은 모든 사용자의 기록을 담은 단일하고 완벽한 마스터 책을 보관합니다. 이 책은 하루에 한 번 업데이트된 이후에는 변경되지 않습니다 (불변).

2. 작은 인덱스 카드 (버전 관리된 포인터)
로봇이 특정 시간에 특정 사용자를 연구해야 할 때 (예: "화요일 오후 2 시에 사용자 A 가 무엇을 알았을까?"), 사서들은 책 전체를 복사하지 않습니다. 대신 해당 학습 세션을 위한 작은 인덱스 카드를 작성합니다.

  • 카드는 다음과 같이 적혀 있습니다. "마스터 책으로 가서 100 페이지부터 500 페이지까지 보고 오후 2 시 항목에서 멈추세요."
  • 이 카드는 책 전체에 비해 매우 작습니다 (가벼운 메타데이터).

3. 필요 시 즉시 재구성 (Just-in-Time Reconstruction)
로봇이 학습할 준비가 되면 시스템은 인덱스 카드를 사용하여 마스터 책의 정확한 페이지로 빠르게 이동하여 그 순간에 기록을 조립합니다. 이것이 "지연 물질화"입니다. 즉, 데이터가 실제로 필요할 때만 구축하고 미리 구축하지 않는 것입니다.

이것이 게임 체인저인 이유

"미래 누출 (Future Leak)" 해결 (시간 여행 문제)
추천 시스템에서는 로봇이 결정을 내려야 할 순간 이후에 일어난 사건을 "속임수"로 보지 않도록 주의해야 합니다.

  • 새로운 시스템은 "시간 여행" 프로토콜을 사용합니다. 인덱스 카드는 시간을 잠급니다. 나중에 마스터 책에 새로운 사건이 업데이트되더라도 로봇은 과거의 특정 순간에 존재했던 책의 버전만 볼 수 있습니다. 이를 통해 로봇이 실시간으로 인간이 보았을 것과 정확히 동일한 것을 학습하도록 보장합니다.

다중 테넌트 이점 (다른 학급 규모)
도서관이 두 가지 유형의 학생을 대상으로 한다고 상상해 보세요.

  • 학생 A는 마지막 10,000 페이지를 읽어야 합니다 (복잡한 모델).
  • 학생 B는 마지막 100 페이지만 필요합니다 (간단한 모델).
  • 구식 방식: 두 학생 모두 10,000 페이지 전체를 복사한 것을 받았습니다. 학생 B 는 필요 없는 페이지를 읽는 시간을 낭비했습니다.
  • 신식 방식: 학생 B 의 인덱스 카드에는 "100 페이지부터 200 페이지까지 읽으세요"라고만 적혀 있습니다. 시스템은 해당 특정 페이지만 가져옵니다. 이로 인해 막대한 에너지와 시간이 절약됩니다.

결과

"모든 것을 복사"하는 방식에서 "특정 페이지를 가져오기 위해 인덱스 카드 사용" 방식으로 전환함으로써 메타는 다음과 같은 성과를 거두었습니다.

  1. 엄청난 절감: 저장하고 이동해야 하는 데이터 양을 거의 50% 줄였습니다.
  2. 더 빠른 학습: 컴퓨터 (GPU) 가 데이터를 기다리는 것을 멈추고 더 빠르게 학습하기 시작했습니다.
  3. 더 나은 로봇: 마침내 로봇에게 훨씬 더 긴 기록 (4,000 개가 아닌 최대 64,000 개의 사건) 을 제공할 수 있게 되어 로봇의 콘텐츠 추천 능력이 크게 향상되었습니다.

요약하자면: 그들은 같은 기록을 반복해서 복사하는 돈과 시간을 낭비하는 것을 멈췄습니다. 대신 AI 가 정확히 필요한 것을 정확히 필요한 때에 읽을 수 있게 해주는 스마트한 시간 여행 파일 시스템을 구축하여 예산을 초과하지 않으면서 더 지능적인 추천을 가능하게 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →