← 최신 논문
🤖 AI

Diagnosing Search Behavior and Failure Modes in Long-Horizon Search Agents

이 논문은 검색(retrieval) 실패와 활용(utilization) 실패를 구분함으로써 장기 탐색 에이전트를 진단하며, 정답 정확도가 탐색 노력보다 검색된 증거의 품질과 더 강력하게 상관되어 있음을 밝히고, 더 나은 딥 리서치 시스템을 구축하기 위해서는 개선된 쿼리 구성, 증거 선택 및 적응형 중단 기준이 핵심임을 시사한다.

원저자: Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Qi Liu, Jiaxin Mao, Fengbin Zhu, Tat-Seng Chua

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 풀기 위해 노력하는 탐정이라고 상상해 보십시오. 인공지능의 세계에는 바로 이 일을 수행하도록 설계된 특별한 '딥 서치(deep search)' 에이전트들이 있습니다. 이들은 이미 알고 있는 정보에서 답을 단순히 추측하는 대신, 디지털 탐정처럼 행동합니다. 질문을 던지고, 답변을 읽고, 다시 질문을 던지며, 최종 해결책에 도달할 때까지 단서들을 하나씩 맞춰 나갑니다. 이 과정은 첫 번째 질문부터 최종 해결책에 이르기까지 많은 단계, 즉 '턴(turn)'을 거칠 수 있기 때문에 '롱 호라이즌 서치(long-horizon search, 장기적 탐색)'라고 불립니다. 오랫동안 사람들은 만약 에이전트가 더 열심히 노력하여 더 많은 질문을 던지고 더 많은 문서를 읽는다면, 더 똑똑해지고 더 많은 미스터리를 해결할 것이라고 가정해 왔습니다. 더 많은 노력이 더 나은 결과로 이어질 것이라는 논리는 타당해 보였습니다. 하지만 마치 첫 번째 정원에서 보물을 찾은 후에도 계속해서 엉뚱한 정원을 파헤치는 인간 탐정처럼, 이 AI 에이전트들도 에너지를 낭비하고 있을지도 모릅니다. 연구자들이 답을 얻고자 했던 핵심적인 질문은 이것이었습니다: 더 열심히 일하는 것이 실제로 AI 탐정들을 더 똑똑하게 만드는가, 아니면 그저 제자리걸음을 하는 것뿐인가?

이 논문은 여섯 가지 서로 다른 AI 에이전트의 '탐색 궤적(search trajectory)'을 깊이 파고들어, 그들이 정확히 어떻게 생각하고, 검색하고, 때로는 실패하는지를 밝혀냅니다. 연구자들은 단순히 최종 답변만을 본 것이 아니라, 마치 탐정의 수첩을 한 페이지씩 검토하듯 에이전트가 취한 모든 단계를 관찰했습니다. 그들은 모든 질문에 알려진 '골드(gold)' 정답과 진실이 담긴 특정 문서 세트가 존재하는 'BrowseComp-Plus'라는 특별한 테스트를 사용했습니다. 에이전트가 찾아낸 것과 이 알려진 진실을 비교함으로써, 그들은 놀라운 사실을 발견했습니다: 더 열심히 일한다고 해서 더 똑똑해지는 것은 아니라는 점입니다. 실제로 가장 많은 질문을 던지고 가장 많은 텍계 텍스트를 읽은 에이전트들이 종종 오답을 내놓았습니다.

연구 결과, 성공적인 검색의 비결은 업무의 '양'이 아니라 발견한 단서의 '질'에 있다는 것이 밝혀졌습니다. 연구진은 실패 사례를 '리트리벌 갭(retrieval gap, 검색 격차)'과 '유틸라이제이션 갭(utilization gap, 활용 격차)' 두 가지 유형으로 분류했습니다. 리트리벌 갭은 잘못된 질문을 던지는 바람에 결정적인 증거를 끝내 찾아내지 못하는 탐정과 같습니다. 유틸라이제이션 갭은 증거를 찾았음에도 불구하고 그것을 잘못 해석하여 오답을 내는 경우를 말합니다. 이 논문은 대부분의 에이전트에게 있어 문제가 바로 리트리벌 갭, 즉 적절한 문서를 찾아내지 못하는 데 있음을 보여줍니다.

이 발견에서 가장 생생한 부분은 다음과 같습니다: 증거는 초기에 나타나거나, 아니면 아예 나타나지 않습니다. 연구진은 만약 에이전트가 (정답의 열쇠가 되는) '골드' 증거를 찾을 예정이라면, 보통 검색의 초기 몇 단계 내에 그것을 발견한다는 사실을 발견했습니다. 만약 그 단계까지 증거를 찾지 못했다면, 이후에는 찾을 가능성이 매우 낮습니다. 그럼에도 불구하고 많은 에이전트들은 단서가 더 이상 나오지 않는데도 한참 동안 계속해서 검색을 이어갑니다. 이는 에이전트가 진전 없이 그저 똑같은 정보를 읽거나 막다른 골목을 헤매며 시간과 컴퓨터 메모리를 낭비하는, 길고 지루한 '낭비되는 꼬리(wasted tail)' 구간을 만들어냅니다.

또한 논문은 에이전트들이 질문을 어떻게 던지는지도 살펴보았습니다. 어떤 에이전트들은 마치 중국 찻잔 가게의 황소처럼, 똑같은 질문을 반복해서 던지거나 질문에 아주 미세하고 무의미한 변화만 주며 질문을 던집니다. 반면, 가장 똑똑한 에이전트들은 절제되어 있습니다. 그들은 반복하지 않습니다. 그들은 다양한 각도에서 접근(피보팅)하지만, 충분한 증거를 확보하면 즉시 멈춥니다. 그들은 퍼즐을 풀기 위해 30번을 검색할 필요가 없습니다. 10번의 검색이 제대로 적중한다면 10번만으로도 충분합니다.

요컨대, 이 연구는 더 나은 AI 탐부의 미래가 더 오래 검색하거나 더 많이 읽는 것에 있지 않음을 시사합니다. 그것은 더 나은 질문을 던지는 법, 충분한 증거를 얻었을 때 검색을 멈추는 법, 그리고 이미 실패한 질문을 다시 던지며 시간을 낭비하지 않는 법을 가르치는 데 있습니다. 승리하는 에이전트는 가장 열심히 일하는 자가 아니라, 가장 영리하게 일하는 자입니다. 즉, 건초더미 속에서 바늘을 빠르게 찾아내고, 언제 삽질을 멈춰야 할지를 정확히 아는 자들입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →