← 최신 논문
🤖 machine learning

CADET: Context-Conditioned Ads CTR Prediction With a Decoder-Only Transformer

이 논문은 멀티 타워 포스트 스코어링 모델링과 셀프 게이티드 어텐션과 같은 혁신을 통해 광고 CTR 예측의 주요 과제를 극해하고 프로덕션 베이스라인 대비 11.04%의 CTR 상승을 달성하며 LinkedIn에 배포된 컨텍스트 조건부 디코더 전용 트랜스포머인 CADET을 소개합니다.

원저자: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi
게시일 2026-08-12
📖 6 분 읽기🧠 심층 분석

원저자: David Pardoe, Neil Daftary, Miro Furtado, Aditya Aiyer, Yu Wang, Liuqing Li, Tao Song, Lars Hertel, Young Jin Yun, Senthil Radhakrishnan, Zhiwei Wang, Tommy Li, Khai Tran, Ananth Nagarajan, Ali Naqvi, Yue Zhang, Renpeng Fang, Avi Romascanu, Arjun Kulothungun, Deepak Kumar, Praneeth Boda, Fedor Borisyuk, Ruoyan Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

=== 요약 ===
당신이 거대하고 북적이는 디지털 시장을 걷고 있다고 상상해 보세요. 매 초마다 수천 개의 디지털 표지판이 당신의 눈길을 끌기 위해 번쩍입니다. 어떤 표지판은 신발을, 어떤 것은 구인 광고를, 또 어떤 것은 커피를 나타냅니다. 이 시장을 운영하는 사람들에게는 까다로운 과제가 있습니다. 바로 당신이 실제로 멈춰 서서 표지판을 보기 전까지, 당신이 어떤 표지판에 관심을 가질지 미리 추측해야 한다는 것입니다. 이 추측 게임을 "클릭률(CTR)" 예측이라고 부릅니다. 오랫동안 최고의 추측가들은 마치 매우 똑똑한 회계사처럼, 당신의 과거 습관 목록과 표지판의 세부 정보를 살펴보고 계산을 수행했습니다. 하지만 최근에는 영화나 노래를 추천하는 등의 다른 분야에서 새로운 종류의 "생성형" AI가 등장하기 시작했습니다. 이 새로운 AI들은 단순한 숫자 계산을 넘어, 당신이 이전에 했던 행동들의 전체적인 '이야기'를 읽고 다음에 일어날 일을 예측하는 스토리텔러와 같습니다. 시장 운영자들의 큰 고민은 이것이었습니다. "우리가 이 새로운 '스토리텔러' AI를 사용하여, 예측이 이루어진 에 게임의 규칙이 바뀌더라도 당신이 어떤 광고를 클릭할지 맞출 수 있을까?"

이것이 바로 LinkedIn 팀이 그들의 새로운 시스템인 CADET을 통해 해결하고자 했던 문제입니다. 그들은 "디코더 전용 트랜스포머(decoder-only transformer)"를 구축했는데, 이는 쉽게 말해 AI가 일련의 사건들(당신의 과거 클릭 및 조회 기록 등)을 읽고 하나의 매끄러운 과정으로 미래를 예측하도록 만든 것입니다. 하지만 광고는 까다롭습니다. 영화 추천과 달리, 광고의 성공은 AI가 예측을 마친 에야 알 수 있는 요소들, 예를 들어 화면상의 정확한 위치 등에 의존하는 경우가 많습니다. 만약 AI가 광고가 페이지 상단이 아닌 하단에 위치할 것이라는 사실을 모른 채 잘못된 예측을 한다면, 전체 시스템은 혼란에 빠지게 됩니다.

연구진은 AI에게 특별한 도구 세트를 제공함으로써 이 퍼즐을 풀 수 있다는 것을 발견했습니다. 그들은 모델이 광고가 어디에 놓일지에 대한 다양한 "만약에(what-if)" 시나리오를 상상하도록 가르쳤고, AI가 소음이 심하거나 혼란스러운 정보에 의해 주의가 분산되는 것을 막아주는 보초 역할을 하는 "셀프 게이팅(self-gating)" 메커니즘을 구축했습니다. 또한 AI에게 특별한 시간 감각을 부여하여, 5분 전의 클릭과 5개월 전의 클릭이 서로 다르다는 것을 이해할 수 있게 했습니다. 가장 중요한 것은, 훈련 과정 중에 실제 세상에서는 가질 수 없는 정보를 AI가 사용하지 않도록 보장했다는 점입니다. 이 새로운 시스템을 실제 LinkedIn 시장에서 테스트했을 한 결과, 단순히 작동하는 수준을 넘어 기존의 복잡한 시스템들을 크게 능가했습니다. 이 새로운 AI는 사용자가 광고를 클릭할 확률이 11.04% 더 높다는 것을 제시하며, 통합된 스토리텔링 방식이 기존의 다중 구조 머신보다 더 뛰어난 성능을 발휘할 수 있음을 증명했습니다.

CADET의 이야기: 광고를 위한 스토리텔러

그렇다면 이들은 이것을 어떻게 만들었을까요? CADET(Context-Conditioned Ads Decoder-Only Transformer)의 마법을 일상적인 개념으로 나누어 살펴보겠습니다.

"닭과 달걀" 문제
당신이 고객이 식사를 얼마나 즐길지 추측하려는 셰프라고 상상해 보세요. 하지만 여기 함정이 있습니다. 테이블이 어디에 놓일지 알기도 전에 즐거움을 예측해야 한다는 것입니다. 만약 테이블이 주방 바로 옆에 있다면 고객은 배가 고프고 흥분된 상태일 것입니다. 반대로 어두운 구석에 있다면 고객은 기분이 언짢을 수도 있습니다. 광고의 세계에서 "테이블"은 화면상의 광고 위치를 의미합니다. AI는 당신이 광고를 클릭할지 예측해야 하지만, 그 광고가 화면 맨 위(모두가 보는 곳)에 있을지 아니면 저 아래에 있을지는 아직 모릅니다. 이것이 바로 "닭과 달걀" 문제입니다. 예측은 위치에 달려 있지만, 위치는 예측에 달려 있기 때문입니다.

CADET은 "만약에" 시나리오의 달인이 됨으로써 이 문제를 해결합니다. 단 하나의 예측만을 하는 대신, 여러 개의 "예측 헤드(prediction heads)"(주방에 있는 서로 다른 셰프들이라고 생각하세요)를 가집적합니다. 한 셰프는 "만หาก 이 광고가 상단에 있다면, 당신은 클릭할 것인가?"라고 묻습니다. 다른 셰프는 "만약 하단에 있다면, 당신은 클릭할 것인가?"라고 묻습니다. 모델은 이 모든 답변을 동시에 생성하는 법을 배웁니다. 실제로 광고가 배치되면, 시스템은 위치에 대해 정답을 맞힌 셰프의 답변을 선택하기만 하면 됩니다. 이런 방식을 통해 AI는 광고가 어디에 놓일지에 대한 미스터리로 인해 혼란을 겪지 않습니다.

보초 (셀프 게이티드 어텐션 - Self-Gated Attention)
붐비는 방에서는 때때로 한 명의 큰 목소리가 다른 모든 사람의 목소리를 묻어버리곤 합니다. AI에서는 이를 "어텐션 싱크(attention sink)"라고 부르는데, 모델이 하나의 토큰(데이터 조각)에 너무 집중한 나머지 나머지를 무시하여 잘못된 예측을 하게 되는 현상을 말합니다. 연구진은 CADET에게 셀프 게이티드 어텐션 메커니즘이라는 "보초"를 부여했습니다.

AI의 뇌를 바쁜 복도라고 생각해 보세요. 정보가 통과하려고 할 때마다 보초가 이를 검사합니다. 만약 정보가 소음이 심하거나 유용하지 않다면, 보초는 그 빛을 줄여(게이트를 내려) 모델의 주의를 분산시키지 않도록 합니다. 반대로 정보가 중요하다면, 보초는 그 정보가 빛나도록 허용합니다. 이 과정은 두 단계로 일어납니다. 정보가 처음 도착할 때(표현 레벨)와 AI가 서로 다른 정보들을 연결하려고 할 때(상호작용 레벨)입니다. 이를 통해 훈련 과정을 매끄럽고 안정적으로 유지하며, AI가 이상한 패턴에 빠지거나 잘못된 패턴에 고착되는 것을 방지합니다.

타임머신 (타임스탬프 RoPE)
대부분의 AI 모델은 단계를 셉니다: "단계 1, 단계 2, 단계 3." 하지만 현실 세계에서 시간은 단순히 단계가 아니라, 언제 일이 일어났느냐의 문제입니다. 10초 전에 발생한 클릭은 10개월 전에 발생한 클릭과는 매우 다릅니다.

CADET은 **타임스탬프 기반 회전 위치 임베딩(Timestamp-based Rotary Positional Embedding, RoPE)**이라는 특별한 종류의 "타임머신"을 사용합니다. 단순히 단계를 세는 대신, AI는 모든 이벤트의 실제 시각(Unix 타임스탬프)을 확인합니다. 이를 통해 AI는 두 이벤트 사이의 간격이 짧은지(몇 초) 혹은 긴지(몇 달)를 이해할 수 있습니다. 이는 모델이 시간이 흐름에 따라 변화하는 패턴을 학습하는 데 도움을 줍니다. 만약 당신이 어제 구인 광고를 클릭했다면 오늘도 여전히 관심이 있을 수 있지만, 6개월 전에 클릭했다면 아마 더 이상 그렇지 않을 것입니다. 이러한 시간 감각 덕분에 AI는 즉각적인 순간부터 장기적인 트렌드까지 다양한 규모의 패턴을 학습할 수 있습니다.

"부정행위 금지" 규칙 (세션 마스킹 - Session Masking)
AI를 훈련시킬 때는 학생처럼 배우기를 원하지, 부정행위자처럼 배우기를 원하지 않습니다. 현실 세계에서 광고가 보여질 때, 시스템은 데이터가 전달되는 아주 짧은 시간(몇 초 또는 몇 분) 동안 당신이 클릭했는지 여부를 즉시 알 수 없습니다. 만약 AI가 클릭이 발생하기 전의 데이터만 보고 훈련된다면, 실제 상황에서 사용할 수 없는 정보를 미리 보고 학습하게 됩니다. 즉, "오, 결과가 나왔으니 당신이 클릭했다는 걸 알았어요!"라고 생각하게 되지만, 실제 환경에서는 그 정보를 가질 수 없습니다.

이를 막기 위해 연구진은 세션 마스킹을 사용했습니다. 선생님이 시험지의 답안지를 가리고 있는 상황을 상상해 보세요. 훈련 중에 AI는 오직 그 정확한 순간에 이용 가능했던 정보만을 보도록 강제됩니다. 만약 어떤 클릭이 30초 후에 발생한다면, 현재 시점의 훈련 과정에서 AI는 그 클릭을 볼 수 없습니다. 이는 AI가 실제 환경(온라인 서빙)에 나갔을 때, 실제로 볼 수 없는 정보에 의존하여 혼란을 겪거나 잘못된 예측을 하지 않도록 보장합니다.

속도 향상 (프로덕션 엔지니어링)
마지막으로, 똑똑한 AI를 만드는 것도 중요하지만, 매일 수십억 개의 광고를 처리할 수 있을 만큼 빠르게 만드는 것은 또 다른 문제입니다. 팀은 몇 가지 영리한 엔지니어링 기술을 사용했습니다. 데이터를 마치 여행 가방을 정리하듯 빈틈없이 꽉 채워(packing) 훈련 속도를 훨씬 높였습니다. 또한, 특화된 소프트웨어 엔진인 "플래시 어텐션(FlashAttention)"을 구축하여, AI가 광고를 하나씩 확인하는 대신 한 번의 매우 빠른 패스로 수백 개의 광고를 동시에 처리할 수 있도록 했습니다.

결과: LinkedIn의 큰 승리

팀이 LinkedIn의 메인 피드에서 CADET을 테스트했을 때, 결과는 인상적이었습니다. 그들은 기존의 고도로 최적화된 시스템(여러 모델이 결합된 형태)과 비교했습니다. 새로운 CADET 모델은 단순히 대등한 수준을 유지하는 것에 그치지 않고 경쟁 상대를 압도했습니다.

대규모 온라인 테스트에서 CADET은 기존 시스템 대비 11.04%의 클릭률 증가를 달 achievement 했습니다. 이는 100개의 광고가 노출될 때마다 훨씬 더 많은 사람이 광고를 멈춰 서서 보게 되었음을 의미합니다. 흥란 점은, LinkedIn의 광고주들이 보통 예산을 자동으로 모두 소진하기 때문에 총 지출액은 크게 변하지 않았지만, 클릭의 가치가 높아졌다는 것입니다. 클릭당 비용(CPC)은 10.9% 감소하여, 광고주들이 투자 대비 더 높은 수익을 얻을 수 있었습니다.

이 논문은 이러한 성공이 통합된 "스토리텔링" AI와 광고의 특정 문제들(위치 및 시간 등)에 대한 스마트한 해결책을 결합했기 때문이라고 제안합니다. 이는 잘 설계된 단일 모델이 복잡한 다중 모델 팀을 이길 수 있음을 보여줍니다. 연구진은 더 많은 종류의 "만약에" 시나리오를 다루는 등 아직 할 일이 남아있다고 언급했지만, 그들의 연구는 디코더 전용 트랜스포머가 온라인 광고 세계의 주도권을 잡을 준비가 되었음을 입증했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →