← 최신 논문
💬 NLP

Interactor: Agentic RL oriented Iterative Creation for Ad Description Generation in Sponsored Search

이 논문은 생성형 보상 모델과의 다회차 상호작용을 통해 스폰서 검색의 광고 설명을 반복적으로 개선함으로써 지식의 풍부함과 랜딩 페이지 일관성을 크게 향상시키고 성공적인 온라인 배포를 달성한 에이전트 기반 강화 학습 프레임워크인 Interactor를 소개한다.

원저자: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

게시일 2026-06-16
📖 3 분 읽기☕ 가벼운 읽기

원저자: Penghui Wei, Jiayu Wu, Chao Ye, Zhi Guo, Shuanglong Li, Lin Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 레모네이드 가판대를 운영하고 있다고 상상해 보세요. 단순히 "레모네이드!"라고 외치는 것(이것은 광고 제목과 같습니다) 대신, 당신의 레모네이드가 왜 특별한지 설명할 수 있는 길고 상세한 메뉴판을 가지고 있는 상황입니다.

이 논문은 검색 광고를 위한 저 길고 상세한 설명글을 작성하기 위해, 똑똑하고 스스로 교정 가능한 마케팅 비서 역할을 하는 INTERACTOR라는 새로운 시스템을 소개합니다.

작동 방식은 다음과 같이 간단한 개념으로 나누어 설명할 수 있습니다.

1. 문제점: "원샷(One-Shot)"의 실수

현재 대부분의 AI 도구는 연습장도 없이 시험을 치르는 학생처럼, 단 한 번의 시도로 광고 설명을 쓰려고 합니다. 가끔은 맞히기도 하지만, 종종 두 가지 큰 실수를 저지릅니다:

  • 내용을 지어냅니다: 공급업체는 일반 레몬만 판매하는데, AI가 "유기농 레몬"을 사용한다고 말할 수 있습니다 (이를 랜딩 페이지에 대해 **불충실(unfaithful)**하다고 합니다).
  • 너무 모호합니다: 레몬을 새벽에 직접 손으로 골랐다는 점을 설명하는 대신, 그저 "맛이 좋다"라고만 말할 수 있습니다 (이것은 **세계 지식(world knowledge)**을 놓친 것입니다).

AI는 사용자의 반응을 즉각적으로 "볼" 수 없기 때문에, 같은 실수를 반복하게 됩니다.

2. 해결책: "코치와 선수"의 루프

INTERACTOR는 게임의 판도를 바꿉니다. 원샷 테스트 대신, 선수(광고를 쓰는 AI)와 코치(특화된 AI 심판들) 사이의 **다회차 대화(multi-turn conversation)**로 광고 작성을 전환합니다.

단계별 루프는 다음과 같습니다:

  1. 선수가 초안을 작성합니다: AI가 광고의 첫 번째 버전을 씁니다.
  2. 코치가 검토합니다: 코치는 단순히 점수(예: "10점 만점에 8점")만 주는 것이 아닙니다. 코치는 빨간 펜을 든 엄격한 편집자처럼 행동합니다. 코치는 이렇게 말합니다:
    • "당신은 '무료 배송'이라고 주장했지만, 웹사이트에는 '배송비 발생'이라고 되어 있습니다. 이건 거짓말입니다. 수정하세요."
    • "사용자가 실제로 궁금해하는 것은 흑임이 탈모 건강에 도움이 된다는 점인데, 그 내용을 언급하지 않았습니다. 추가하세요."
  3. 선수가 다듬습니다: AI는 코치의 노트를 읽고, 생각하고, 특정 오류를 수정하기 위해 광고를 다시 씁니다.
  4. 반복: 광고가 완벽해질 때까지 이 과정이 여러 번 반복됩니다.

3. 핵심 비결: "에이전틱 RL (Agentic RL)"

논문에서는 이를 **에이전틱 강화 학습(Agentic Reinforcement Learning)**이라고 부릅니다. 이것은 똑똑한 강아지를 훈련시키는 것과 같습니다. 강아지가 왜 간식을 받았는지 혹은 왜 지적을 받았는지 그 이유를 이해할 수 있는 수준의 훈련입니다.

  • 전통적인 RL: AI는 "잘했어!" 또는 "못했어!"라는 신호만 받습니다. 그래서 다음에 무엇을 해야 할지 추측해야 합니다.
  • INTERACTOR (Agentic RL): AI는 **추론 피드백(reasoning feedback)**을 받습니다. 어떤 문장이 왜 틀렸는지 정확히 알게 됩니다. 이를 통해 훨씬 더 빠르게 학습하고 훨씬 더 나은 설명을 쓸 수 있습니다.

4. 결과: "미사여구"에서 "사실"로

이 논문은 실제 바이두(Baidu) 검색 엔진의 데이터를 바탕으로 테스트를 진행했습니다.

  • 이전: AI 광고는 종종 "미사여구(fluffy)"가 많거나(빈말이 가득함), "환각(hallucinated)" 현상(사실을 지어냄)을 보였습니다.
  • 이후: INTERACTOR 시스템은 다음과 같은 광고를 만들어냈습니다:
    • 지식 풍부(Knowledge-Rich): 실제 사실을 바탕으로 사용자의 질문에 제대로 답변합니다.
    • 충실함(Faithful): 광고주 웹사이트에서 실제로 제공하는 내용에 엄격하게 충실합니다.
    • 클릭률 증가: 광고가 더 좋아졌기 때문에, 더 많은 사람이 클릭했고 회사는 더 많은 수익을 올렸습니다.

5. 현실 세계의 영향

논문에 따르면, 이 시스템은 2026년 5월부터 주요 검색 엔진에서 실제로 운영되고 있습니다. 이는 단순한 이론이 아닙니다. 현재 광고주들이 더 나은 광고를 쓰도록 돕고, 사용자들이 더 관련성 높은 정보를 찾을 수 있도록 도우며, 동시에 검색 엔진의 수익을 높이고 있습니다.

요약하자면: INTERACTOR는 AI 작가에게 단순히 성적을 매기는 것을 넘어, 광고가 완벽해질 때까지 모든 실수를 고칠 수 있도록 옆에서 도와주는 전문가 편집자 팀을 붙여주는 것과 같습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →