← 최신 논문
🤖 AI

Towards a Densing Law for User Representation Learning at Billion-Scale Capacity

이 논문은 데이터 크기와 최소 충분 토큰화 용량을 연결하는 정량적 스케일링 패턴인 "사용자 행동 밀집 법칙(User Behavioral Densing Law)"을 제안하고, 십억 단위 규모의 데이터 병목 현상을 극복하며 사용자 표현 학습에서 기존 베이스라인보다 뛰어난 성능을 보이는 적응형 토큰화 방법인 ALGN을 소개한다.

원저자: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Bin Dou, Junru Zhang, Zhaoyi Yuan, Wuliang Huang, Letian Gong, Baokun Wang, Huan Li, Yu Cheng, Weiqiang Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

디지털 세상에서 모든 클릭, 구매, 검색은 흔적을 남깁니다. 우리가 매일 사용하는 플랫폼을 구축하는 기업들에게 이러한 흔적은 단순한 기록이 아닙니다. 그것은 우리가 누구인지 이해하기 위한 원재료입니다. 인공지능 시스템은 한 개인의 행동이 남긴 길고 구불구불한 역사를 분석함으로써 그 사람의 선호와 습관에 대한 단일하고 강력한 요약본을 만들려고 시합니다. 흔히 '사용자 표현(user representation)'이라 불리는 이 요약본은 어떤 뉴스를 보여줄지, 어떤 제품을 추천할지, 혹은 어떤 광고를 표시할지를 결정하는 디지털 지문 역할을 합니다. 수년 동안 엔지니어들 사이에서 지배적이었던 믿음은 단순했습니다. 이 지문을 더 정확하게 만들기 위해서는 단순히 더 많은 데이터가 필요하다는 것이었습니다. 논리는 타당해 보였습니다. 시스템에 더 많은 사용자, 더 긴 삶의 기록, 그리고 이를 처리할 더 큰 컴퓨터 뇌를 제공하면 결과는 자연스럽게 좋아질 것이라는 생각이었습니다.

하지만 한 새로운 연구는 이러한 "다다익선"의 가설에 도전합니다. 앤트 그룹(Ant Group)과 저장 대학교(Zhejiang University)의 연구진은 알리페이(Alipay)가 처리하는 수십억 건의 거래와 같은 실제 세계의 방대한 규모의 데이터를 다룰 때, 이러한 무한한 확장 전략이 실제로 효과가 있는지 조사했습니다. 그들은 데이터를 계속 추가하는 것이 도움이 되기는커녕 오히려 해가 되기 시작하는 지점이 있다는 것을 발견했습니다. 방 안에 가구가 너무 많아져서 움직이기 힘들어지는 것처럼, 시스템도 반복적이고 가치가 낮은 데이터로 너무 넘쳐나면 정말 중요한 것을 보는 능력을 상 теря하게 됩니다. 연구팀은 병목 현상이 컴퓨터 모델의 크기가 아니라, 입력되는 정보의 질과 밀도에 있다는 것을 발견했습니다. 그들은 이 거대한 역사를 압축된 고가치의 요약본으로 압축하여, 시스템이 더 적은 것으로 더 많이 배울 수 있도록 하는 새로운 접근 방식을 제안합니다.

연구진은 수억 명의 사용자를 포함하는 데이터셋을 통해 전통적인 방식의 한계를 테스트하는 것으로 시작했습니다. 그들은 사용자 수, 관찰하는 시간 범위, 그리고 컴퓨터 모델 자체의 크기를 체계적으로 늘려 나갔습니다. 그들은 성능이 처음에는 빠르게 향상되지만, 곧 단단한 벽에 부딪힌다는 것을 발견했습니다. 특정 지점 이상의 사용자를 추가하거나, 약 60일 이상의 기록을 살펴보면 시스템은 더 이상 새로운 것을 배우지 못했습니다. 추가된 데이터는 대부분 10년 동안 매일 아침 같은 커피를 사는 사람처럼, 반복되는 오래된 습관의 재탕에 불 불과했습니다. 컴퓨터 모델을 훨씬 더 크게 만들었음에도 불구하고, 모델은 더 똑똑해지지 못했습니다. 그것은 실질적인 통찰력을 얻는 대신 이러한 반복적인 세부 사항들을 단순히 암기할 뿐이었습니다. 저자들이 '원시 행동 스케일링 벽(raw behavioral scaling wall)'이라고 부르는 이 현상은, 단순히 문제에 더 많은 데이터를 들이붓는 것이 더 이상 유효한 전략이 아님을 보여주었습니다.

이 벽을 깨기 위해 연구팀은 데이터를 '밀집(densing)'시키는 방법을 도입했습니다. 시스템에 원시 이벤트의 전체적이고 무질서한 역사를 그대로 입력하는 대신, 그들은 먼저 이러한 이벤트들을 책의 줄거리를 잃지 않으면서 몇 개의 핵심 문장으로 요약하는 것과 유사하게, 압축된 디지털 토큰 세트로 변환했습니다. 그들은 유사한 행동들을 그룹화하고 중복성을 제거하여 가장 정보가 많은 신호만을 남기는 기술을 사용했습니다. 이 압축되고 토큰화된 버전의 사용자 이력으로 모델을 훈련했을 때, 결과는 놀라웠습니다. 원시 데이터로 훈련된 시스템은 이미 정체된 반면, 압축된 데이터 기반의 시스템은 데이터가 커짐에 따라 계속해서 개선되었습니다. 압축된 데이터 덕분에 모델은 나무 하나하나에 길을 잃는 대신 숲을 볼 수 있었고, 입력량이 방대해지더라도 학습하고 적응하는 능력을 유지할 수 있었습니다.

연구는 더 나아가 데이터가 증가함에 따라 얼마나 많은 압축이 필요한지에 대한 정밀한 규칙을 정의했습니다. 그들은 사용자의 요약을 저장하는 데 필요한 '공간'이 원시 데이터의 양에 직접 비례하여 늘어날 필요가 없다는 것을 발견했습니다. 대신, 이는 데이터 볼륨이 증가함에 따라 필요한 용량이 완만하게 성장하는 예측 가능한 패턴을 따릅니다. 이는 10억 명의 사용자를 처리하는 시스템이라 할지라도 10억 배 더 많은 메모리나 컴퓨팅 파워가 필요한 것이 아니라, 정교하게 계산된 훨씬 작은 양의 고품질 토큰만 있으면 된다는 것을 의미합니다. 그들이 '행동 밀집 법칙(Behavioral Densing Law)'이라 명명한 이 발견은, 엔지니어들이 주어진 데이터 양에 대해 정확히 얼마만큼의 압축을 적용해야 하는지 알 수 있는 수학적 가이드를 제공하며, 불필요한 정보에 자원을 낭비하지 않도록 보장합니다.

마지막으로, 연구진은 이 법칙을 실제로 적용하기 위해 '적응형 길이 게이트 네트워크(Adaptive Length Gated Network)'라는 새로운 도구를 개발했습니다. 기존 방식은 모든 사용자의 이력을 동일하게 취급하여, 실제 삶이 얼마나 복잡한지와 상관없이 모두에게 동일한 양의 압축 공간을 할당했습니다. 새로운 도구는 더 똑똑합니다. 각 사용자를 개별적으로 살펴보고 얼마나 많은 세부 정보를 유지할지 결정합니다. 매우 규칙적이고 예측 가능한 삶을 사는 사용자에게는 매우 짧은 요약을 할당합니다. 반면, 복잡하고 다양한 관심사와 습관을 가진 사용자에게는 더 길고 상세한 요약을 할당합니다. 이러한 동적인 접근 방식은 지루하고 반복적인 데이터에 컴퓨팅 파워가 낭비되지 않도록 보장하는 동시에, 복잡한 사용자들에게는 필요한 만큼의 주의를 기울이게 합니다. 테스트 결과, 이 적응형 방식은 정확도 면에서 기존의 모든 시스템보다 뛰어났을 뿐만 아니라 컴퓨팅 용량도 현저히 적게 사용하며, 효율성과 성능이 공존할 수 있음을 증명했습니다.

이 연구의 함의는 단일 앱이나 웹사이트를 훨씬 넘어섭니다. 이는 미래를 위한 지능형 시스템을 구축하는 방식의 근본적인 변화를 시사합니다. 더 많은 데이터를 수집하고 더 큰 모델을 만드는 끝없는 경주 대신, 앞으로의 길은 우리가 이미 가지고 있는 데이터로부터 더 많은 가치를 추출하는 법을 배우는 데 있습니다. 정보의 양이 아닌 정보의 밀도에 집중함으로써, 우리는 더 정확할 뿐만 아니라 더 효율적이고 지속 가능한 시스템을 구축할 수 있습니다. 이 연구는 빅데이터 시대에 가장 강력한 도구는 더 큰 양동이가 아니라, 더 나은 필터라는 점을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →