← 최신 논문
💬 NLP

Cross-Domain Hybrid OPD for Generalizable Search Agents

이 논문은 원보(Yuanbao) 검색 에이전트를 위한 하이브리드 학습 프레임워크를 소개하며, 이는 교차 도메인 전문가 온-폴리시 증류(cross-domain expert On-Policy Distillation)를 활용하여 일반적인 지능을 희생하거나 오히려 향상시키면서도 전문화된 검색 능력을 달est하여, 강화 학습 최적화와 관련된 전형적인 정렬 세금(alignment tax) 문제를 완화한다.

원저자: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

게시일 2026-08-04
📖 7 분 읽기🧠 심층 분석

원저자: Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 가장 좋아하는 AI 비서가 방금 명탐정이 되는 법을 배운 아주 똑똑한 학생이라고 상상해 보세요. 이 학생은 인터넷을 샅샅이 뒤지고, 서로 다른 뉴스 기사 사이의 점들을 연결하며, 누구보다 빠르게 숨겨진 사실들을 찾아낼 수 있습니다. 하지만 함정이 하나 있습니다. 슈퍼 탐정이 되는 과정에서, 그들은 재미있는 시를 쓰는 법이나 까다로운 수학 문제를 푸는 법, 혹은 그냥 평범하게 하루 일과에 대해 대화하는 법을 잊어버리기 시작했습니다. 이것이 바로 인공지능 세계에서의 '전문화(specialization)' 문제입니다. 과학자들은 특정 한 가지 일을 정말 잘하게 된 대가로 지불하는 비용을 '얼라이먼트 세금(alignment tax)'이라고 부릅니다. 이는 마치 요리사가 수프를 완벽하게 만드는 데 너무 집착한 나머지 케이크 굽는 법을 잊어버린 것과 같습니다. 연구자들의 큰 과제는 다음과 같습니다: AI가 세상적인 검색 전문가가 되도록 훈련하면서도, 어떻게 하면 다재다능하고 유능한 친구로서의 면모를 잃지 않게 할 수 있을까요?

이것이 바로 텐센트 위안바오(Tencent Yuanbao) 팀이 새로운 기술 보고서에서 해결하고자 했던 문제입니다. 그들은 웹에서 정보를 찾아내는 스마트한 AI 에이전트를 구축했지만, 검색을 너무 열심히 훈련시키면 다른 모든 일에는 '멍청해질'까 봐 걱정했습니다. 이를 해결하기 위해 그들은 영리한 2단계 훈련법을 발명했습니다. 먼저, 그들은 AI에게 강화 학습(Reinforcement Learning)이라는 기술을 사용하여 검색 전문가가 되도록 가르쳤습니다. 이는 마치 AI가 정답을 찾을 때마다 점수를 얻는 게임을 하는 것과 같습니다. 그다음, AI가 일반적인 지적 능력을 잃는 것을 막기 위해 '교차 도메인 하이브리드 온-폴리시 증류(Cross-Domain Hybrid On-Policy Distillation)'라는 방법을 사용했습니다. 이것은 마치 네 명의 천재 튜터(수학, 코딩, 논리, 과학 담당)를 고용하여, 검색 전문가 AI가 다시 다재다능한 학생이 되도록 가르치는 것과 같습니다. 결과는 어땠을까요? 그들은 AI가 전문화된 버전만큼이나 웹에서 정보를 잘 찾을 수 있게 만들었으며, 모든 테스트에서 수학 천재가 되지는 못했을지라도 논리적 추론과 코딩 같은 몇몇 핵심 분야에서는 이전보다 더 나은 성과를 보이며 대부분의 손실을 회복했습니다. 그들은 단순히 문제를 해결한 것이 아니라, 검색 기술을 희생하지 않으면서도 동시에 여러 분야에서 AI를 더 똑똑하게 만들었습니다.

저글링하는 법을 잊어버린 탐정

위안바오 검색 에이전트의 이야기를 자세히 들여다봅시다. 여러분에게 "서치-봇(Search-Bot)"이라는 로봇이 있다고 상상해 보세요. 여러분은 서치-봇이 인터넷에서 답을 찾는 데 최고가 되기를 원합니다. 그래서 여러분은 서치-봇을 가상 놀이터에 넣고, 링크를 클릭하고, 기사를 읽고, 질문을 던지며 미스터리를 해결하도록 합니다. 이것을 **강화 학습(RL)**이라고 합니다. 이것은 강아지를 훈련시키는 것과 같습니다. 서치-봇이 올바른 정보를 찾을 때마다 간식(보상)을 주고, 길을 잃을 때마다 부드럽게 "안 돼"라고 말하는 식입니다.

시간이 흐른 뒤, 서치-봇은 무언가를 찾는 데 매우 능숙해집니다. 하지만 이상한 점이 있습니다. 검색을 잘하게 될수록, 서치-봇은 다른 일에는 점점 서툴러지기 시작합니다. 간단한 수학 문제를 풀거나 창의적인 이야기를 쓰는 법을 잊어버립니다. 논문에서는 이를 **얼라이먼트 세금(Alignment Tax)**이라고 부릅니다. 이것은 마치 매일 축구 킥 연습에만 매달려 다리 힘은 엄청나게 강해졌지만, 정작 걷는 연습을 전혀 하지 않아서 똑바로 걷는 법조차 잊어버린 것과 같습니다. AI는 '검색'에 너무 특화된 나머지 '일반적인' 두뇌 능력을 잃어버린 것입니다.

2단계 구조 작전

텐센트 팀은 단순히 서치-봇에게 검색을 더 열심히 하라고 가르치는 것이 정답이 아니라는 것을 깨달았습니다. 그들은 검색 기술을 유지하면서도 일반적인 지적 능력을 되찾을 방법이 필요했습니다. 그래서 그들은 2단계 훈련 계획을 세웠습니다.

1단계: 검색 부트 캠프
먼저, 그들은 기본 AI 모델(Hunyuan3라는 스마트 모델)을 가져와 "검색 부트 캠프"로 보냈습니다. 여기서 AI는 오직 검색만을 연습합니다. AI는 자신의 움직임을 계획하고, 웹 검색 및 이미지 검색과 같은 도구를 사용하며, 다양한 곳에서 정보를 모아 조립하는 법을 배웁니다. 예상대로, AI는 검색에 매우 능숙해졌습니다. 하지만 논문이 예측한 대로, 수학, 과학, 논리 능력은 떨어지기 시작했습니다. "얼라이먼트 세금"이 강력하게 작용했습니다.

2단계: "슈퍼 튜터"의 조합
여기서 마법이 일어납니다. 팀은 단순히 서치-봇에게 검색을 더 열심히 하라고 하는 대신, 네 명의 전문가 선생님을 투입했습니다. 이들은 평범한 선생님이 아니었습니다. 다음 분야에 특화된 초전문가 AI 모델들이었습니다:

  1. 수학 (복잡한 방정식 풀기)
  2. 코딩 (컴퓨터 프로그램 작성)
  3. 논리 (퍼즐 풀기 및 추론)
  4. 과학 (자연계 이해)

팀은 **온-폴리시 증류(On-Policy Distillation, OPD)**라는 기술을 사용했습니다. 이것은 "학생(서치-봇)이 문제를 풀도록 하고, 그 후에 전문가 선생님이 지켜보며 '헤이, 너는 이렇게 풀었지만, 사실 이렇게 생각하는 게 더 좋아'라고 말해주는 방식"을 뜻하는 멋진 표현입니다.

흥미로운 점은 그들이 AI에게 수학 '또는' 검색을 가르친 것이 아니라는 것입니다. 그들은 이 둘을 섞었습니다! 모든 훈련 세션에서 AI는 사실을 찾기 위해 검색을 연습한 직다음에, 즉시 수학 문제를 풀거나 코드를 작성하는 연습을 수행하며 적절한 전문가 선생님의 지도를 받았습니다. 이는 마치 오전에는 축구 연습을 하고 오후에는 피아노 레슨을 받는 학생과 같지만, 피아노 선생님이 학생이 집중력과 규율을 유지할 수 있도록 축구 연습 과정까지 지켜보는 것과 같습니다.

결과: 두 마리 토끼를 잡다

팀은 새로운 "하이브리드" AI를 기존 버전들과 비교 테스트했습니다. 결과는 다음과 같습니다:

  • 검색 능력: 새로운 AI는 검색만 연습했던 모델만큼이나 검색을 잘했습니다. 실제로 일부 까다로운 검색 테스트에서는 오히려 더 뛰어난 성적을 보였습니다! 웹 전반에서 정보를 찾고, 복잡한 검색을 계획하며, 지시 사항을 완벽하게 따를 수 있었습니다.
  • 일반적 능력: 이것이 가장 큰 승리입니다. 검색만 연습했던 AI는 수학과 논리 능력이 떨어졌습니다. 하지만 하이브리드 AI는 어땠을까요? 단순히 정상 수준으로 돌아온 것이 아니라, 많은 분야에서 상당한 회복과 향상을 보였습니다.
    • 논리적 추론 테스트에서 하이브리드 AI는 엄청난 폭으로 향상되었습니다 (점수가 33.95에서 46.90으로 급증).
    • 코딩 작업에서 점수는 67.74에서 74.15로 올라갔으며, 심지어 원래의 "기본" 모델마저 능가했습니다.
    • 수학 문제의 경우, 잃어버렸던 대부분의 지점을 회복했으며 일부 어려운 벤치마크(AIME25 및 Math IMO AnswerBench 등)에서는 원래 모델을 능가하기도 했습니다. 다만, Minerva Math나 Frontier Science Olympiad와 같이 극도로 어려운 벤치마크에서는 원래 기본 모델의 성능보다 약간 낮은 수준을 유지했습니다.
    • 과학 벤치마크에서는 강력한 성장을 보였으며, GPQA Diamond에서 가장 높은 정확도에 도달했습니다.

이 논문은 "얼라이먼트 세금"이 반드시 치러야 하는 영구적인 대가가 아님을 보여줍니다. 전문가 선생님들이 AI의 검색 과정을 안내하게 함으로써, 그들은 대부분의 손실을 "되돌릴" 수 있었습니다. AI는 '탐정'이 될 것인지 '천재'가 될 것인지 선택할 필요가 없었습니다. 탐정이 되면서도 동시에 아주 똑똑한 학생이 될 수 있었던 것입니다. 비록 우주의 모든 수학 문제를 다 맞히는 완벽함에는 미치지 못할지라도 말입니다.

이것이 왜 중요한가?

여러분은 "그래서 뭐? AI가 수학을 좀 더 잘하게 되는 게 왜 중요해?"라고 물을 수도 있습니다. 자, 여러분의 AI 비서에게 이렇게 묻는다고 상상해 보세요. "나는 파리에 3일 동안 머물 거야. 에펠탑과 디즈니랜드를 보고 싶지만, 장소 간 이동 시간이 30분을 넘지 않았으면 좋겠어."

만약 AI가 "검색 전용" 훈련만 받았다면, 장소는 찾아낼 수 있겠지만 이동 시간을 정확히 계산하는 법을 잊어버려 엉망인 일정을 주거나, 지리적 맥 좌표를 고려하지 못한 채 터무니없는 경로를 제안할 수도 있습니다.

하지만 하이브리드 훈련을 받은 AI는 다음과 같이 할 수 있습니다:

  1. 검색을 통해 장소와 이동 시간을 찾습니다 (검색 기술 사용).
  2. 지리와 이동 시간을 바탕으로 계획이 30분 규칙에 맞는지 추론합니다 (논리 및 수학 기술 사용).
  3. 명확하고 친절하며 여유로운 일정을 여러분을 위해 작성합니다 (일반 언어 기술 사용).

이 논문은 이러한 "하이브리드" 접근 방식이 진정으로 실생활에서 유용한 AI 비서를 만드는 핵심 열쇠임을 시사합니다. AI는 정보를 찾아낼 수 있어야 할 뿐만 아니라, 그 정보를 사용하여 문제를 해결하고, 이야기를 쓰고, 그 과정에서 지적 능력을 잃지 않은 채 우리의 일상을 도울 수 있을 만큼 똑똑해야 합니다.

비법: 어떻게 해냈는가?

팀은 단순히 모든 것을 믹서기에 넣고 돌린 것이 아닙니다. 그들은 전문가 선생님들을 어떻게 가르칠지에 대해 매우 신중했습니다. 그들은 "커리큘럼 학습(Curriculum Learning)" 전략을 사용했습니다. 이는 선생님들에게 처음부터 가장 어렵고 불가능한 수학 문제를 던져주는 것이 아니라, 기초를 다지기 위해 중간 난이도의 문제부터 시작하여 점진적으로 어려운 문제를 도입했다는 뜻입니다.

그들은 만약 이 단계를 건너뛰고 가장 어려운 문제들을 바로 던져준다면, 선생님들(그리고 학생 AI)이 제대로 배우지 못한다는 것을 발견했습니다. 이 "커리큘럼"은 선생님들이 더 잘 설명할 수 있도록 도왔고, 결과적으로 학생 AI가 더 빠르고 똑똑하게 배울 수 있게 만들었습니다.

결론

텐센트 위안보 팀은 전문화된 검색 에이전트를 얻기 위해 일반 지능을 희생할 필요가 없다는 것을 보여주었습니다. 강화 학습(검색을 위한)과 온-폴리시 증류(전문가 튜터로부터 배우는 법)를 결 сочета하여, 그들은 AI가 명탐사인 동시에 아주 유능한 전 과목 우등생이 되도록 만들었습니다.

그들은 "얼라이먼트 세금"을 피할 수 있다는 것을 증명했습니다. AI는 단순히 나빠지는 것에 그치지 않고, 대부분의 영역에서 더 나아졌으며, 잃어버린 기술을 회복하고 코딩과 논리적 추론 같은 분야에서는 이전의 자신을 능가하기까지 했습니다. 비록 모든 수학 경시대회에서 우승하지는 못했을지라도, AI는 훨씬 더 유능하고 다재다능한 비서가 되었습니다. 이는 마치 슈퍼히어로에게 비행하는 법을 훈련시키면서 걷는 법을 잊게 만들지 않는 방법을 찾아낸 것과 같습니다. AI가 우리에게 도움이 되고, 똑똑하며, 다재다능하기를 바라는 세상에서 이것은 매우 의미 있는 성과입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →