← 최신 논문
🤖 AI

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

본 논문은 적응형 하이퍼파라미터 튜닝을 위한 대규모 언어 모델, 동적 전문가 모델 선택을 위한 편향 수정 SARSA 에이전트, 그리고 입찰 실행을 위한 다양한 전문가 풀을 통합하여, 오프라인 학습 기반 입찰 시스템의 한계를 극복하고 상당한 온라인 적응성과 대규모 배포에서의 입증된 비즈니스 가치를 제공하는 계층적 강화 학습 프레임워크인 HOBA를 제안한다.

원저자: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

게시일 2026-07-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수백만 명의 사람들이 매초마다 아주 작은 주의력(attention)의 조각들을 사기 위해 경쟁하는 거대하고 빠른 경매장을 상상해 보십시오. 이것이 바로 온라인 광고의 세계입니다. 광고주들은 자신의 예산을 단 1분 만에 모두 써버리지 않으면서도, 적절한 사람들에게 광고를 보여주고 싶어 합니다. 이를 위해 그들은 광고 슬롯에 얼마를 지불할지 결정하는 컴퓨터 프로그램인 '비딩 에이전트(bidding agents)'를 사용합니다. 이 에이전트들을 레이싱 카 드라이버라고 생각해 봅시다. 어떤 드라이버는 매우 신중하며 엄격한 규칙 책(예: PID 제어기)을 따르는 반면, 다른 드라이버들은 최선의 움직임을 배우기 위해 수천 번의 지난 경주를 연구한 그랜드마스터(예: 오프라인 강화 학습)와 같습니다.

문제는 레이스 트랙이 끊임없이 변한다는 점입니다. 날씨가 바뀌고, 다른 드라이버들이 더 빨라지며, 도로의 규칙이 진화합니다. 정적인 규칙 책만을 따르는 드라이버는 트랙이 미끄러워지면 충돌할 수 있습니다. 또한 시속 200마일로 질주하는 동안 새로운 기술을 배우려고 시도하는 드라이버는 통제력을 잃고 몇 초 만에 연료(예산)를 다 써버릴 수도 있습니다. 과학자들은 안전하면서도 실시간으로 적응할 수 있는 드라이버를 구축하기 위해 노력해 왔지만, 이는 매우 까다로운 균형 잡기입니다. 컴퓨터가 너무 자유롭게 학습하도록 내버려 두면 처참한 실수를 저지를 수 있고, 학습을 전혀 하지 못하게 하면 시장이 변할 때 뒤처지게 됩니다.

여기서 "HOBA: 계층적 온폴리시(On-Policy) 적응형 온라인 광고 비딩 에이전트"라는 논문이 등장합니다. Kuaishou Technology의 연구진은 이 레이싱 드라이버들을 관리하는 새로운 방법인 HOBA를 제안합니다. 하나의 단일 드라이버에게 모든 것을 가르치는 대신, 그들은 피트 크루(pit crew), 전략가(strategist), 그리고 드라이버가 함께 협력하는 3단계 팀을 구축했습니다.

팀의 최상위에는 거대 언어 모델(LLM)로 구동되는 '전략가(Strategist)'가 있습니다. 이것을 한 시간마다 한 번씩 큰 그림을 보는 현명한 코치라고 상상해 보십시오. 이 코치는 모든 코너에서 정확한 속도를 결정하는 것이 아니라, 날씨, 연료 잔량, 경쟁 상황을 살펴본 뒤 팀을 위한 새로운 지침 세트를 작성합니다. 그들은 "오늘은 조금 더 공격적으로 임하라"라거나 "지출을 느리고 꾸준하게 유지하라"라고 말할 수 있습니다. 이 코치는 과거의 경주 기록이 담긴 메모리 뱅크를 사용하여 시간이 지남에 따라 점점 더 똑똑해집니다.

중간 단계에는 2분마다 체크하는 스마트 에이전트인 '전술 매니저(Tactical Manager)'가 있습니다. 이 매니저의 역할은 사전 훈련된 전문가들이 모여 있는 차고에서 가장 적합한 '드라이버'를 선택하는 것입니다. 차고에는 다양한 유형의 드라이버가 있습니다. 빠른 교정에 능숙한 드라이버(PID), 장기 계획에 능숙한 드라이버(MPC), 그리고 방대한 데이터셋으로부터 학습한 전문가(IQL 또는 Decision Transformer와 같은) 등이 있습니다. 전술 매니저는 무작위로 추측하지 않습니다. 대신, 운에 속지 않기 위해 특별한 '인과적 조정(causal adjustment)' 도구를 사용합니다. 예를 들어, 어떤 드라이버가 날씨가 완벽했기 때문에 우연히 경주에서 이겼다면, 매니저는 그 승리 때문에 드라이버를 칭찬하거나 비난하지 않도록 조절합니다. 매니저는 현재 순간에 진정으로 가장 적합한 드라이버를 선택합니다.

최하위에는 '드라이버(Drivers)'들이 있습니다. 이들은 밀리초 단위로 발생하는 모든 광고 경매에 실제로 입찰을 넣는 전문가들입니다. 이들은 전략가가 설정한 규칙과 전술 매니저가 내린 선택을 따릅니다. 결정적으로, 이 드라이버들은 경주하는 동안 자신의 뇌를 바꾸지 않습니다. 그들은 안전하고 사전 테스트를 마친 도구들입니다. '학습'은 오직 중간 계층, 즉 팀이 어떤 드라이버를 사용할지 결정하는 단계에서만 일어납니다. 이는 시스템이 예산을 탕진하는 처참한 실수를 저지르는 것을 방지하면서도, 변화하는 시장에 빠르게 적응할 수 있게 해줍니다.

연구진은 두 가지 방식으로 이 시스템을 테스트했습니다. 첫째, 광고 시장의 비디오 게임 버전인 AuctionNet이라는 시뮬레이션 환경에서 실행했습니다. 이 테스트에서 HOBA는 기존의 가장 뛰어난 방법들을 지속적으로 압도하며, 예측 불가능한 어려운 시나리오에서 최대 12%의 성능 향상을 보여주었습니다. 둘째, 가장 중요한 단계로, 실제 환경에서 테스트했습니다. 수천 개의 캠페인과 수백만 달러의 예산이 투입되는 실제 광고 플랫폼에서 대규모 테스트를 진행했습니다.

결과는 인상적이었습니다. 실제 테스트에서 HOBA는 광고주들이 기존 시스템보다 목표 비용을 3.6% 더 자주 달성할 수 있도록 도왔습니다. 이는 광고주들이 과도한 지출 없이 더 많은 가치를 얻을 수 있음을 의미합니다. 또한 시스템은 총 전환 가치를 8.1% 증가시켰고 투자 수익률(ROI)을 3.3% 개선했습니다. 무엇보다 중요한 것은, 이 모든 과정이 예산을 파괴하거나 혼란을 일으키지 않고 수행되었다는 점입니다. 이 시스템은 전략적 코치, 전술 매니저, 그리고 전문화된 드라이버 팀으로 역할을 분담함으로써, 안전하면서도 놀라울 정도로 적응력이 뛰어난 광고 시스템을 만들 수 있다는 것을 증명했습니다. 이는 때때로 경주에서 이기는 가장 영리한 방법은 단 한 명의 슈퍼 드라이버를 갖는 것이 아니라, 완벽하게 협력하는 팀을 구성하는 것임을 상기시켜 줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →