← 최신 논문
💬 NLP

Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests

본 논문은 DeepResearchGym 의 1444 만 건의 실제 에이전트 검색 요청을 분석하여 세션 길이 분포, 의도에 따른 탐색 전략, 그리고 쿼리 수정이 검색된 증거와 갖는 강력한 어휘적 추적 가능성과 같은 주요 행동 패턴을 규명함으로써 궁극적으로 검색 에이전트 설계 최적화를 위한 실행 가능한 신호를 제공합니다.

원저자: Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong

게시일 2026-04-30
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

수천 명의 로봇 사서가 인간 독자가 아닌 채로 일하는 거대하고 붐비는 도서관을 상상해 보세요. 이 로봇들은 첨단 AI 로 구동됩니다. 이들의 임무는 단순히 한 권의 책을 찾는 것이 아니라 복잡한 퍼즐을 푸는 것입니다. 이를 위해 그들은 한 번만 책을 요청하지 않습니다. 질문을 하고, 답변을 읽고, 방금 읽은 내용에 기반한 후속 질문을 던지며, 다시 읽고, 전체 그림을 파악했다고 생각할 때까지 이 과정을 계속합니다.

이 논문은 이러한 로봇 사서에 대한 대규모 관찰 연구입니다. 연구자들은 DeepResearchGym이라는 공개 시스템에서 나온 1,400 만 건 이상의 검색 요청(약 400 만 건의 '대화' 또는 세션)을 분석했습니다. 연구자들은 다음과 같은 점을 이해하려 했습니다: 이 로봇들은 무엇을 하려 하며, 진행 과정에서 질문을 어떻게 변화시키는가?

다음은 간단한 비유를 사용한 그들의 발견 사항 요약입니다:

1. "쇼핑 목록" 대 "탐정" (의도)

연구자들은 로봇들이 검색 방식을 결정하는 세 가지 주요 성격 유형, 즉 "의도"로 나뉜다는 사실을 발견했습니다:

  • 사실 추구자 (기술적): 이 로봇은 "이 간식 회사의 소유주는 누구인가?"와 같은 구체적인 사실 하나만 원합니다.
    • 행동: 답을 즉시 찾지 못하면 같은 질문이나 약간 변형된 버전들을 계속 반복하며 함정에 빠지는 경향이 있습니다. (문 repeatedly 두드리며 같은 질문을 외치는 사람처럼)
  • 방법 안내자 (절차적): 이 로봇은 "누수되는 수도꼭지를 고치는 법은?"과 같이 무언가를 하는 방법을 알고 싶어 합니다.
    • 행동: 더 길고 상세한 질문을 던지며 완전한 지침을 얻기 위해 '도서관 선반'(문서) 을 더 깊이 파고듭니다.
  • 탐정 (추론): 이 로봇은 "왜 가스는 비싼가?"와 같은 복잡한 퍼즐을 가지고 있습니다.
    • 행동: 가장 모험적입니다. 한 가지 관점에 머무르지 않고 점들을 연결하기 위해 다양한 주제 (면) 사이를 오갑니다. 한곳을 깊게 파는 대신 광범위하게 탐색합니다.

2. "깊이 파기" 습관

가장 큰 발견 중 하나는 이 로봇들이 **확대 **(zoom in)하는 경향이 **축소 **(zoom out)하는 경향보다 훨씬 강하다는 것입니다.

지도 한 장을 보고 있다고 상상해 보세요. 대부분의 시간, 이 로봇들은 넓은 시야를 확보한 후 즉시 세부 사항을 찾기 위해 작은 거리로 확대합니다. "잠깐, 내가 아예 다른 도시를 보고 있는 건 아닐까?"라고 뒤로 물러서서 다시 생각해보는 경우는 드뭅니다.

  • "깊이 파기" 편향: 약 36% 에서 48% 의 경우, 그들은 동일한 주제의 약간 다른 각도로만 방향을 전환합니다.
  • "축소"의 희소성: 실제로 더 큰 그림을 보기 위해 검색 범위를 넓히는 경우는 약 9% 에 불과합니다. 확대할 때면 거의 즉시 다시 축소합니다. 마치 지도 전체를 잠깐 훑어본 후 다시 즉시 한 개의 거리에 초점을 맞추는 것과 같습니다.

3. "에코 챔버" 효과 (반복)

이 연구에 따르면 로봇 대화의 90% 는 짧습니다(10 단계 이하), 그리고 매우 빠르게 진행됩니다 (질문 사이가 종종 1 분 미만).

그러나 사실 추구자들의 경우 문제가 있습니다. 대화가 진행됨에 따라 그들은 점점 더 자신을 반복하기 시작합니다. 9 단계가 되면 질문의 거의 절반이 이전 질문과 거의 동일합니다. 이미 질문한 사실을 잊어버리거나, 성공하지 못한 채 같은 답을 다른 각도에서 얻으려 함정에 빠진 사람과 같습니다.

4. "용어 수용" 테스트 (실제로 읽었는가?)

연구자들은 다음과 같은 점을 알고 싶어 했습니다: 로봇이 새로운 질문을 할 때, 방금 찾은 정보를 실제로 사용하는가?

로봇의 내부 "두뇌"(기억) 를 볼 수 없었기 때문에, 그들은 CTAR(문맥 기반 용어 수용률)이라는 교묘한 테스트를 고안했습니다.

  • 비유: 탐정이 "용의자는 빨간 모자를 썼다"는 단서를 읽었다고 상상해 보세요. 만약 탐정의 다음 질문이 "빨간 모자를 쓴 사람은 누구인가?"라면, 그들은 그 용어를 "수용"한 것입니다.
  • 결과: 연구자들은 로봇들이 다음 질문에서 사용한 새로운 단어의 **54%**가 방금 읽은 텍스트에서 직접 유래한 것을 발견했습니다.
  • 주의점: 이는 로봇이 텍스트를 완벽하게 이해했다는 뜻이 아니라, 단어들이 거기에 있었다는 뜻일 뿐입니다. 마치 인간이 깊이 생각하기보다 들은 단어를 반복하는 앵무새와 같습니다. 하지만 이는 로봇들이 적어도 검색한 증거를 보고 있다는 것을 증명합니다.

5. "고정된 예산" 문제

로봇들은 질문당 읽을 문서 수에 대한 "예산"(예: 5 페이지 또는 10 페이지 읽기) 을 부여받았습니다.

  • 발견: 대부분의 로봇은 이 예산을 하드 코딩된 설정처럼 취급했습니다. 그들은 작업에 따라 이를 변경하지 않았습니다. 간단한 사실을 찾든 복잡한 미스터리를 풀든, 그들은 대부분 같은 페이지 수에 머무릅니다. 복잡한 미스터리는 간단한 사실보다 더 많은 페이지를 읽어야 할 수도 있다는 점을 인식하지 못한 듯합니다.

요약

이 논문은 AI 검색 에이전트를 위한 교통 보고서와 같습니다. 이는 다음과 같은 사실을 알려줍니다:

  1. 대부분의 검색은 짧고 빠릅니다.
  2. 로봇들은 간단한 사실을 찾을 때 함정에 빠집니다.
  3. 그들은 세부 사항에 확대하는 것을 선호하며, 뒤로 물러서서 큰 그림을 보는 것을 꺼립니다.
  4. 그들은 읽은 내용에서 단어를 받아들이지만, 작업의 난이도와 관계없이 경직된 "읽기 예산"에 머무는 경향이 있습니다.

저자들은 이 데이터를 공개하여 다른 연구자들이 이러한 로봇들이 함정에 빠지는 것을 깨고, 더 많이 탐색하며, 읽기 예산을 더 현명하게 사용할 수 있도록 더 나은 "교통 통제관"을 구축할 수 있도록 했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →