← 최신 논문
🤖 machine learning

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

본 논문은 고비용의 인간 주석이 필요 없이 전체 페이지 검색 및 추천을 위한 거시적 페이지 수준의 일관성과 미시적 항목 수준의 배치를 동시에 최적화하기 위해 암시적 사용자 피드백을 활용하는 다중 입자 보상 프레임워크인 PageLLM 을 소개하며, 이는 순위 지표와 실제 비즈니스 KPI 에서 상당한 개선을 달성합니다.

원저자: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대한 디지털 백화점의 매니저가 되어본다고 상상해 보세요. 고객이 들어올 때마다, 당신은 그들에게 보여줄 방대한 창고의 제품들을 가지고 있습니다. 당신의 일은 단순히 몇 가지 좋은 상품을 고르는 것이 아니라, 그들을 위한 전체 쇼핑 페이지를 구성하는 것입니다.

이것이 전체 페이지 최적화 (Whole-Page Optimization, WPO) 의 도전 과제입니다. 단순히 올바른 신발을 찾는 것만으로는 부족합니다. 당신은 다음을 결정해야 합니다:

  • 신발을 페이지의 어디에 배치할 것인가?
  • 양말 옆에 놓을 것인가, 아니면 텐트 옆에 놓을 것인가?
  • 빨간색 신발은 너무 많이, 파란색 신발은 너무 적게 보여주는 것은 아닐까?
  • 페이지가 너무 지저분한가, 아니면 지루하게 반복되는가?

오랫동안 컴퓨터는 이 문제에 직면해 어려움을 겪었습니다. 왜냐하면 컴퓨터는 전체 그림을 이해할 만큼 "바보" 같았거나, 아니면 비싼 인력 매니저들이 매 페이지 레이아웃을 수동으로 평가해야 했기 때문입니다.

이제 PageLLM이 등장했습니다. 이는 대규모 언어 모델 (LLM) 인 "초지능 어시스턴트"를 사용하여 이러한 페이지를 자동으로 설계하는 새로운 시스템입니다. 하지만 여기에는 함정이 있습니다. 저자들은 단순히 AI 에게 "좋은 페이지를 만들어라"라고 말하는 것만으로는 효과가 없다는 것을 발견했습니다. 이는 셰프에게 "맛있는 식사를 만들어라"라고 말하되, 스테이크의 맛 (개별 항목) 에 집중해야 하는지, 아니면 전체 메뉴의 균형 (페이지 레이아웃) 에 집중해야 하는지 구체적으로 명시하지 않는 것과 같습니다.

간단한 비유를 사용하여 PageLLM 이 이를 어떻게 해결하는지 살펴보겠습니다:

1. 문제: "장님" 셰프

이전에 AI 를 이 문제에 적용하려는 시도들은 두 가지 큰 문제가 있었습니다:

  • "인간 평가" 병목 현상: AI 를 가르치기 위해서는 보통 인간이 두 개의 다른 페이지를 보고 "A 페이지가 B 페이지보다 마음에 든다"라고 말해야 합니다. 수백만 명의 사용자에게 이를 수행하는 것은 너무 비싸고 느립니다.
  • "단일 입자" 실수: 대부분의 AI 시스템은 문제를 한 가지 방식으로만 바라보았습니다.
    • 일부는 개별 항목만 보았습니다 (예: "사용자가 이 특정 신발을 클릭했는가?"). 이는 스테이크가 잘 익었는지만 신경 쓰고, 수프는 차갑고 샐러드는 시들었는지 무시하는 셰프와 같습니다.
    • 다른 일부는 전체 페이지만 보았습니다 (예: "이 페이지가 다양해 보이는가?"). 이는 메뉴의 균형을 신경 쓰지만 스테이크가 타버린 것은 눈치채지 못하는 셰프와 같습니다.

2. 해결책: "두 눈" 보상 시스템

저자들은 AI 를 가르치기 위해서는 서로 다른 두 가지 피드백이 함께 작동해야 한다는 것을 깨달았습니다. 마치 한쪽 눈은 세부 사항을, 다른 한쪽 눈은 큰 그림을 보는 두 눈을 가진 셰프와 같습니다.

그들은 인간이 페이지를 평가하도록 요청하는 대신 "암시적 피드백"(클릭 및 구매와 같은 사용자가 실제로 수행한 행동) 을 사용하는 PageLLM이라는 시스템을 구축했습니다. 그들은 이 복잡한 데이터를 **4 가지 유형의 "훈련 시나리오"**로 변환했습니다:

  1. 관련성: 사용자가 확실히 원하지 않는 항목을 보여주는 것.
  2. 순위: 항목의 순서를 바꾸어 사용자가 누가 먼저인지 신경 쓰는지 확인하는 것.
  3. 다양성: 한 가지 유형의 항목만으로 가득 찬 페이지를 보여줌으로써 (예: 빨간색 신발만) 다양성이 좋다는 것을 AI 에게 가르치는 것.
  4. 중복성: 너무 많은 유사한 항목이 뭉쳐 있는 것을 보여줌으로써 AI 에게 항목들을 분산시키도록 가르치는 것.

3. 마술: "대략적"과 "정밀한" 보상

이것이 핵심 혁신입니다. PageLLM 은 동일한 데이터에서 두 개의 별도 보상 헤드(두 명의 다른 심사위원이라고 생각하세요) 를 훈련시킵니다:

  • 심사위원 A (페이지 레벨 코치): 이 심사위원은 전체 쇼핑 페이지를 한 번에 봅니다. 그들은 "이것은 균형 잡히고 일관된 목록인가? 다양한 카테고리를 포함하고 있는가?"라고 묻습니다. 그들은 전체 메뉴가 지루하거나 반복되는지 파악하는 데 뛰어납니다.
  • 심사위원 B (항목 레벨 코치): 이 심사위원은 개별 항목과 그 위치를 봅니다. 그들은 "이 항목을 5 번 위치에서 2 번 위치로 옮긴 것이 사용자의 클릭을 더 늘렸는가?"라고 묻습니다. 그들은 큰 그림이 놓치는 작고 중요한 세부 사항을 파악하는 데 뛰어납니다.

왜 둘 다 필요한가?
이 논문은 심사위원 A 만 사용하면 AI 가 보기 좋은 페이지를 만들지만 사용자가 구매하려는 특정 항목을 놓친다는 것을 발견했습니다. 반면 심사위원 B 만 사용하면 AI 는 훌륭한 항목을 선택하지만 이를 지저분하고 혼란스러운 방식으로 배치합니다.

  • 결과: 두 심사위원을 결합하면 AI 는 단일 심사위원을 사용할 때보다 항목 순위를 정확히 매기는 능력이 46.8% 향상됩니다. 이는 오케스트라가 함께 연주하도록 지휘자 (심사위원 A) 가 역할을 하고, 각 바이올리니스트가 올바른 음을 치도록 솔로 코치 (심사위원 B) 가 역할을 하는 것과 같습니다.

4. 현실 세계 증명

이 팀은 이 실험을 실험실에서만 하지 않았습니다. 그들은 1 천만 명의 사용자가 있는 실제 전자상거래 사이트에서 이를 테스트했습니다.

  • 결과: 이 시스템은 매장의 총 판매액 (GMV) 을 0.44% 증가시켰고, 클릭 수는 0.14% 증가시켰습니다.
  • 중요성: 수백만 명의 고객이 있는 비즈니스에서, 그 같은 작은 비율은 수만 건의 추가 판매로 이어집니다.

5. "게으른" 배포 보너스

이 시스템의 한 가지 교묘한 부수 효과는 배포가 쉽다는 것입니다. "페이지 레벨 코치"(심사위원 A) 가 전체 목록을 보는 데 매우 능숙하기 때문에, 회사는 강력한 서버 (GPU) 를 전체 AI 실행을 위해 점진적으로 업그레이드하는 동안 기존에 있는 더 느린 컴퓨터 서버 (CPU) 에서 그 부분만 사용할 수 있습니다. 마치 고해상도 사진이 준비되기 전에 메뉴의 스케치를 사용할 수 있는 것과 같습니다.

요약

PageLLM은 온라인 쇼핑 페이지를 구성하는 새로운 방법입니다. 인간에게 모든 페이지를 평가하도록 요청하는 대신, "나쁜 예"(너무 반복적, 잘못된 순서, 다양성 부족) 를 보여줌으로써 AI 를 가르칩니다. 이는 두 가지 다른 피드백 루프(큰 그림용과 작은 세부 사항용) 를 사용하여 AI 가 논리적으로 균형 잡히고 사용자가 클릭하려는 내용에 완벽하게 맞춰진 페이지를 만들도록 보장합니다. 그 결과, 인간 평가자 팀이 필요 없이 더 똑똑하고 수익성이 높은 쇼핑 경험을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →