← 최신 논문
💻 computer science

Scaling Laws for Behavioral Foundation Models over User Event Sequences

이 논문은 사용자 이벤트 시퀀스로 학습된 행동 파운데이션 모델에 대한 스케일링 법칙을 확립하며, 작은 피처 기반 임베더가 일관되게 연산 최적적(compute-optimal)이라는 점, 최적의 학습 전략이 예산 및 평가 지표에 따라 변화한다는 점, 그리고 네거티브 샘플링 제약이 결국 FLOPs에서 메모리 제한으로 전이된다는 점을 밝힌다.

원저자: Rickard Brüel Gabrielsson

게시일 2026-06-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Rickard Brüel Gabrielsson

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 거대한 온라인 쇼핑몰을 위한 거대하고 고속인 추천 엔진을 운영하고 있다고 상상해 보세요. 고객이 클릭하거나, 구매하거나, 검색할 때마다 디지털 발자국이 남습니다. 당신의 목표는 고객의 과거 이력을 바탕으로 다음에 무엇을 할지 예측하는 AI를 구축하는 것입니다.

이 논문은 그러한 AI를 만들기 위한 일종의 거대한 과학적 "레시피 북"과 같습니다. 저자들은 AI의 두뇌를 가능한 모든 방식으로 미세하게 조정하며 약 600번의 서로 다른 실험을 수행했고, 이를 통해 컴퓨팅 파워(비용과 전기가 많이 드는 작업)를 가장 효율적으로 사용하는 방법을 찾아냈습니다.

다음은 쉬운 비유를 사용한 연구 결과의 요약입니다.

1. 두 부분으로 된 두뇌: 사서와 이야기꾼

대부분의 이러한 AI 모델은 함께 작동하는 두 개의 뚜렷한 부분으로 구성됩니다:

  • 사서 (임베더, The Embedder): 이 부분은 특정 아이템(예: 신발 한 켤레 또는 거래 내역)을 보고 그것이 무엇인지 파악합니다. 텍text, 가격, 색상, 카테고리를 읽어냅니다.
  • 이야기꾼 (트랜스포머, The Transformer): 이 부분은 사건의 순서를 살펴봅니다. 당신이 신발을 보고, 그다음 모자를 보고, 그다음 재킷을 본 것을 기억하여 다음에 무엇을 살지 추측합니다.

중요한 발견: 저자들은 "사서"가 아주 작아야 한다는 것을 발견했습니다.

  • 비유: 당신이 소설을 쓰는 팀을 고용한다고 가정해 봅시다. 예산이 한정되어 있습니다. 당신은 모든 단어를 조사하기 위해 엄청난 규모의 연구진(사서)이 필요할 것이라고 생각할 수도 있습니다. 하지만 저자들은 당신에게 **아주 작은 규모의 연구팀(전체 인력의 약 2%)**만 필요하다는 것을 발견했습니다.
  • 이유: "사서"는 동일한 인기 아이템(예: "나이키 운동화")을 수천 번씩 보게 됩니다. 그래서 금방 지루해지고 빠르게 학습합니다. 반면, "이야기꾼"은 좀처럼 반복되지 않는 독특한 사건들의 조합을 봅니다. 따라서 이야기꾼에게 큰 두뇌가 필요하며, 사서는 작고 효율적인 두뇌만 있으면 됩니다.

2. "배치 크기"의 딜레마: 교실에 학생이 몇 명이나 있는가?

AI를 학습시킬 때, 한 번에 하나의 예시만 보여주는 것이 아니라 하나의 "배치(batch)" 단위로 묶어서 보여줍니다.

  • 비유: 선생님이 학급을 가르치는 상황을 생각해 보세요. 학급 규모가 너무 작으면(배치 크기 64), 선생님은 개별적인 특이한 점들에 의해 주의가 산만해집니다. 만약 학급 규모가 너무 크면(배치 크기 2048), 선생님은 압도당하거나 수업 내용이 너무 일반적이 되어버릴 수 있습니다.
  • 발견: "최적의 지점(sweet spot)"은 무엇을 측정하느냐에 따라 다릅니다.
    • 만약 정확도(정답을 맞혔는가?)를 중요하게 생각한다면, 적당한 규모의 학급(약 570명)이 최적입니다.
    • 만 만약 랭킹(최상단 결과가 가장 좋은 것인가?)을 중요하게 생각한다면, 작은 규모의 학급(약 200~275명)이 최적입니다.
    • 교훈: 모든 것을 위해 하나의 배치 크기만 선택할 수는 없습니다. "최적"의 크기는 무엇을 최적화하려 하는지에 따라 달라집니다.

3. 데이터 vs 모델의 트레이드오프: 큰 두뇌인가, 큰 도서관인가?

당신에게는 고정된 금액의 컴퓨팅 예산(Compute Budget)이 있습니다. 아주 똑똑한 AI(더 많은 파라미터)를 사고 데이터는 적게 줄 것입니까? 아니면 약간 덜 똑똑한 AI를 만들고 방대한 양의 데이터를 먹일 것입니까?

  • 발견:
    • 작은 예산일 때: AI에게 방대한 양의 데이터를 주어야 합니다. AI는 스펀지와 같아서, 스스로 일반화할 만큼 똑똑하지 않기 때문에 가능한 한 많은 정보를 흡수해야 합니다.
    • 거대한 예산일 때: 당신이 더 부유해짐에 따라(더 많은 컴퓨팅 파워를 갖게 됨에 따라), 그 균형이 이동합니다. 이제는 더 똑똑한 AI가 필요하고 데이터는 적게 필요하게 되며, 결국 텍스트를 작성하는 대규모 언어 모델(LLM)이 학습되는 방식과 유사한 비율에 도달하게 됩니다.
    • 추세: 이는 "데이터 중심" 전략에서 시작하여, 더 강력한 컴퓨터를 갖게 됨에 따라 서서히 "균형 잡힌" 전략으로 이동합니다.

4. "네거티브 샘플링": 오답을 얼마나 많이 보여줄 것인가?

AI가 학습할 때, 정답만 보는 것이 아니라 무엇을 선택하지 말아야 할지 배우기 위해 "방해 요소"(오답)도 함께 봅니다.

  • 비유: 객관식 시험을 상상해 보세요. 학생에게 오답을 3개만 보여준다면 운 좋게 맞힐 수도 있습니다. 하지만 1,000,000개의 오답을 보여준다면, 학생은 패턴을 완벽하게 학습할 것입니다.
  • 발견:
    • 작은 예산: 적당한 수의 오답(수십만 개)이 필요합니다.
    • 거대한 예산: 가능한 한 많은 오답을 보여줘야 합니다. 실제로 테스트된 가장 큰 예산에서는, 한계가 컴퓨팅 파워가 아니라 메모리였습니다. 시스템은 200만 개의 오답을 보여주고 싶어 했지만, 컴퓨터가 그것을 담을 공간이 부족했습니다.
    • 주의점: "최적"의 오답 개수는 단순 정확도를 측정하느냐 혹은 복잡한 랭킹을 측정하느냐에 따라 다릅니다. 두 지표는 일치하지 않습니다.

5. 가장 중요한 교훈: 골대(목표)가 움직인다

이 논문의 가장 결정적인 경고는 지표(metrics), 즉 성공을 측정하는 방법입니다.

  • 비유: 당신이 레이싱 카를 훈련시킨다고 가정해 봅시다. 만약 성공을 "최고 속도"로 측정한다면 엔진을 한 방향으로 튜닝할 것입니다. 만약 "연비"로 측정한다면, 완전히 다른 방향으로 튜닝하게 될 것입니다.
  • 발견: 이러한 행동 모델에서, 당신이 선택한 지표는 레시피를 바꿉니다.
    • 만약 "손실(loss, 수학적 오차)"을 최소화하도록 학습시킨다면, 하나의 설정 세트가 나옵니다.
    • 만약 "랭킹(ranking, 최상의 아이템을 첫 번째로 두는 것)"을 극대화하도록 학습시킨다면, 또 다른 설정 세트가 나옵니다.
    • 핵심 포인트: 수학적 오차를 최소화하는 데 가장 뛰어난 AI가 반드시 아이템을 올바르게 랭킹하는 데 가장 뛰어난 AI는 아닙니다. 모델을 구축하기 전에 당신이 무엇을 최적화할 것인지 정확히 결정해야 합니다. 왜냐하면 "최적"의 모델은 그 선택에 따라 변하기 때문입니다.

요약

가장 효율적인 "행동 기반 파운데이션 모델"(인간의 행동을 이해하는 AI)을 구축하려면:

  1. "아이템 이해" 부분(임베더)을 매우 작게 유지하십시오(전체 크기의 약 2%).
  2. 중간 규모의 배치 크기를 사용하되, 정확도를 중시하는지 랭킹을 중시하는지에 따라 조정하십시오.
  3. 방대한 양의 데이터로 시작하되, 더 강력한 컴퓨터를 갖게 됨에 따라 더 똑똑한 모델로 무게 중심을 옮기십시오.
  4. 컴퓨터의 메모리가 허용하는 한 최대한 많은 "오답" 예시를 사용하십시오.
  5. 가장 중요한 것은: 시작하기 전에 무엇이 "성공"인지(지표)를 정확히 결정하십시오. 그 결정이 당신의 AI 아키텍처 전체를 결정하기 때문입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →