← 최신 논문
🤖 machine learning

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

이 논문은 전략적 추론, 수치적 정밀도, 그리고 경험 기반 루프를 통한 자율적 최적화를 강화함으로써 기존의 AI 생성 입찰 방식의 한계를 극복하기 위해, 플래너-실행자(planner-executor) 아키텍처를 갖춘 대규모 언어 모델과 새로운 분리형 그룹 상대 정책 최적화(Decoupled Group Relative Policy Optimization, D-GRPO) 알고리즘을 활용하는 계층적 자기 진화형 자동 입찰 프레임워크인 AIGB-R1을 소개한다.

원저자: Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

게시일 2026-07-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 스마트폰을 스크롤할 때마다, 보이지 않는 초고속 경매가 벌어지는 세상을 상상해 보세요. 광고주들은 당신의 관심을 끌기 위해 화면에 디지털 자금을 쏟아부으며 경쟁하고 있습니다. 이것은 온라인 광고의 거친 개척지로, 눈 깜짝할 사이에 수십억 개의 기회가 스쳐 지나가는 곳입니다. 이 전투에서 승리하기 위해 기업들은 과거에 사람이 직접 입찰가를 조정하곤 했지만, 이는 마치 스파게티로 만든 그물로 날아가는 총알을 잡으려는 것과 같습니다. 너무 느리고 엉망이었기 때문입니다. 그래서 그들은 컴퓨터로 눈을 돌렸습니다. 처음에는 알고리즘이 최적의 거래를 위해 가격을 자동으로 조정하는 "자동 입찰(Auto-bidding)"이 등장했습니다. 그다음에는 과거의 경매를 학습하여 완벽한 수를 예측하려는 "생성형 AI(Generative AI)"가 등장했습니다. 하지만 여기에는 함정이 있습니다. 이 AI 모델들은 단 한 권의 낡은 교과서로만 공부한 학생과 같습니다. 세상이 변하면 혼란에 빠지며, 수학 계산에 어려움을 겪어 때로는 말이 안 되는 숫자를 "환각(hallucinating)"하기도 합니다.

새로운 주인공인 대규모 언어 모델(LLM)이 등장합니다. 여러분은 아마 시를 쓰거나 수수께 수를 풀 수 있는 챗봇으로 이들을 알고 있을 것입니다. 이들은 맥락을 이해하고 계획을 세우는 데는 매우 똑똑하지만, 빠르고 정밀한 수학 계산에는 젬병이며 실시간 경매를 수행하기에는 너무 느립니다. 과학자들이 던지는 핵심 질문은 이것입니다. "우리는 똑똑한 기획자의 두뇌와 빠른 계산기의 속도를 결합하여 이 디지털 경매에서 승리할 수 있을까?" 이것이 바로 연구진이 해결하고자 하는 과제이며, 단순히 추측하는 것이 아니라 실제로 '생각'하여 승리로 향하는 AI를 구축하는 것을 목표로 합니다.

두뇌와 근육: AIGB-R1

연구진은 AIGB-R1이라는 새로운 시스템을 제안합니다. 이를 역할이 완벽하게 나뉜 고위험 거래 팀이라고 생각해보세요. 과거에는 하나의 거대한 AI가 생각하고, 계산하고, 행동하는 모든 것을 다 하려고 했습니다. 하지만 저자들은 AI가 정밀한 숫자에는 약하고 반응 속도는 느리기 때문에 이것이 나쁜 아이디어라고 주장합니다. 대신, AIGB-R1은 계층적(hierarchical) 접근 방식을 사용하여 업무를 **기획자(Planner)**와 **실행자(Executor)**라는 두 개의 뚜렷한 부분으로 나눕니다.

기획자는 "거대한 두뇌"입니다. 이는 노련한 장군이나 체스 그랜드마스터처럼 행동하는 강력한 대규모 언어 모델입니다. 경매가 시작되기도 전에, 이 장군은 광고주의 예산, 목표, 그리고 과거 성과를 살펴봅니다. 다음 1초의 세세한 디테일에 신경 쓰는 대신, 거시적 수준의 전략을 수립합니다. 예를 들어, "오늘은 공격적으로 빠르게 지출한다"라거나 "보수적으로 운영하며 돈을 아낀다"라고 말할 수 있습니다. 그리고 이 전략을 명확하고 구조화된 프롬프트로 작성합니다.

실행자는 "근육"입니다. 이는 가볍고 매우 빠른 AI 모델(구체적으로는 프롬프트 디시전 트랜스포머, Prompt Decision Transformer)로, 실제 입찰을 수행합니다. 실행자는 장군의 전략 프롬프트를 전달받아 즉시 현재의 순간에 집중합니다. 경매의 현재 상태, 남은 예산, 그리고 경쟁 상황을 살펴보고 즉각적으로 정확한 입찰 금액을 계산합니다. 실행자는 특화된 수학 모델이기 때문에 숫자를 환각하지 않으며, 밀리초 단위로 반응합니다. 기획자가 '무엇을' 할지와 '왜' 하는지를 알려준다면, 실행자는 '어떻게'와 '언제'를 처리합니다.

책이 아닌 경험으로부터의 학습

또한 이 논문은 이 시스템이 시간이 지남에 따라 어떻게 더 똑똑해질 수 있는지에 대한 영리한 방법인 **자기 진화 루프(self-evolving loop)**를 소개합니다. 대부분의 AI 시스템은 10년 된 교과서로 시험 공부를 하는 것처럼 오래되고 정적인 데이터로 훈련됩니다. 시장이 변하면 AI는 혼란에 빠집니다. 하지만 AIGB-R1은 AuctionNetEnv라고 불리는 시뮬레이션 환경을 구축합니다. AI가 수천 명의 다른 봇들을 상대로 게임을 하며 다양한 전략을 반복해서 시도해 볼 수 있는 비디오 게임을 상상해 보세요.

여기서 정말 멋진 점이 나옵니다. 시스템은 단순히 무작ful하게 추측하지 않습니다. 시스템은 자신의 가장 좋았던 과거의 움직임들을 담은 메모리 뱅크를 유지합니다. 만약 특정 전략이 어제 효과적이었다면, 기획자는 그것을 기억하고 오늘 더 정교하게 다듬습니다. 만약 전략이 실패했다면, 그 실수로부터 배웁니다. 이것이 바로 "자기 진화" 부분입니다. 시스템은 축적된 자신의 경험으로부터 학습하며, 완벽한 입찰에 가까워지기 위해 끊임없이 접근 방식을 미세하게 조정합니다.

비밀 소스: D-GRPO

이 설정에서 가장 큰 도전 중 하나는 팀이 이기거나 졌을 때 누구에게 공로(또는 책임)를 돌릴 것인가를 결정하는 것입니다. 기획자가 나쁜 명령을 내린 것일까요, 아니면 실행자가 명령을 따르지 못한 것일까요? 이를 해결하기 위해 저자들은 **분리된 그룹 상대 정책 최적화(Decoupled Group Relative Policy Optimization, D-GRPO)**라는 새로운 수학적 기법을 발명했습니다.

코치가 계주 경기를 지켜보고 있다고 상상해 보세요. 팀이 졌을 때, 코치는 첫 번째 주자가 느렸던 것인지 아니면 두 번째 주자가 바톤을 놓친 것인지 알아내야 합니다. D-GRPO는 기획자의 성과와 실행자의 성과를 분리할 수 있는 매우 똑똑한 코치 역할을 합니다. 결과가 나오면 "전략은 좋았지만 실행이 잘못되었다"라거나 "실행은 완벽했지만 전략이 틀렸다"라고 판단합니다. 이 두 가지 신호를 분리함으로써, 시스템은 서로 혼동되지 않고 두 부분을 동시에 훈련할 수 있으며, 이는 훨씬 더 안정적이고 효과적인 학습 과정으로 이어집니다.

연구 결과

연구진은 알리바바(Alibaba)의 약 480,000개 입찰 궤적을 포함한 방대한 실제 데이터셋을 통해 AIGB-R1을 테스트했습니다. 그들은 강화 학습 및 다른 생성형 모델에 기반한 여러 최상위 AI 방법들과 비교했습니다.

결과는 명확했습니다: AIGB-R1의 승리였습니다. AIGB-R1은 표준 및 까다로운 "희소(sparse)" 경매 시나리오 모두에서 가장 높은 점수를 기록하며 다른 모든 방법보다 일관되게 우수한 성능을 보였습니다. 이 논문은 단순히 대규모 언어 모델을 의사 결정자로 사용하는 것만으로는 수학적 한계 때문에 충분하지 않지만, 이를 전략적 기획자로 사용하고 특화된 모델이 숫자를 처리하게 하는 것이 게임 체인저가 된다는 점을 시사합니다.

또한 연구는 시스템의 모든 부분이 필수적임을 보여주었습니다. "자기 진화" 훈련(AI가 자체 시뮬레이션으로부터 학습하게 하는 것)을 제거했을 때 성능이 떨어졌습니다. 기획자를 제거하고 실행자에게 추측하게만 했을 때도 성과가 더 낮았습니다. 그리고 기획자를 고정하여 새로운 경험으로부터 배울 수 없게 만들었을 때도 시스템은 학습이 가능할 때만큼 좋지 않았습니다. 이는 똑똑한 기획자, 빠른 실행자, 그리고 경험으로부터 배우는 루프의 조합이 차세대 자동 입찰을 여는 열쇠라는 것을 증명합니다.

요약하자면, AIGB-R1은 자동 광고의 미래가 하나의 거대하고 전지전능한 로봇을 만드는 것이 아니라는 점을 시사합니다. 그것은 경로를 계획하는 현명한 전략가와 자동차를 운전하는 민첩한 드라이버가 함께 구성된 팀을 만드는 것이며, 두 존재가 이동하는 모든 거리로부터 함께 배워나가는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →