Search, Inspect, Fetch: Exploiting Boolean Retrieval for Deep-Research Agents
이 논문은 현장에 적용된 불리언 검색(Boolean retrieval)을 활용하여 관련 문서 섹션만을 필터링, 랭킹 및 추출함으로써 기존의 검색-방문 워크플로우보다 훨씬 적은 토큰으로 더 높은 정확도를 달erm하는 딥 리서치 에이전트 인터페이스인 SIEVE를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 먼지 쌓인 도서관 대신 인터넷 전체를 손에 쥐고 미스터리를 풀려는 탐정이라고 상상해 보십시오. 인공지능의 세계에서 '딥 리서치 에이전트(deep-research agents)'는 바로 이 탐정과 같습니다. 이들은 웹을 검색하고, 찾은 내용을 읽고, 답을 조립하여 까다로운 질문에 답하도록 설계된 컴퓨터 프로그램입니다. 이를 위해 그들은 보통 단순한 루틴을 따릅니다. 검색 쿼리를 입력하고, 웹 페이지의 짧은 요약본(스니펫) 목록을 살펴본 뒤, 가장 유망한 것을 골라, 그 페이지의 전체를 처음부터 끝까지 읽습니다. 이것을 "검색-방문(Search–Visit)" 워크플로라고 부릅니다. 이는 마치 책 중간에 있는 단 한 문단을 찾기 위해 도서관의 모든 책의 모든 페이지를 다 읽어야 하는 것과 같습니다. 문제는 웹 페이지가 제목, 헤딩, 섹션 등으로 구성되어 있음에도 불구하고, 대부분의 AI 탐정들은 이러한 구조를 무시한다는 점입니다. 그들은 모든 페이지를 거대하고 정리되지 않은 텍스트 덩어리로 취급하며, 이는 시간을 낭비하고 컴퓨터를 혼란스럽게 만듭니다.
이 논문은 SIEVE라고 불리는 더 똑똑한 방식의 탐정 업무를 소개합니다. 연구진은 웹 페이지를 지저분한 종이 더미가 아니라 잘 정리된 서류함처럼 다루는 시스템을 구축했습니다. SIEVE는 단순히 페이지 전체를 읽는 대신, "역사(History)"라는 헤딩이 있고 "1995"를 언급하는 섹션만 보여달라는 식의 매우 구체적인 질문을 던지기 위해 특수한 "불리언 쿼리 언어(Boolean Query Language, 아주 정밀한 검색 필터라고 생각하면 됩니다)"를 사용합니다. 그런 다음 결과 목록을 검사하여 헤딩과 짧은 스니펫을 확인하고, 정확히 필요한 섹션을 골라 그 작은 조각의 정보만을 가져옵니다. "검색-검사-가져오기(search–inspect–fetch)"라고 불리는 이 접근 방식은 에이전트가 문서의 무관한 부분을 완전히 무시할 수 있게 해줍니다. 저자들은 세 가지의 어려운 질문 세트를 통해 SIEVE를 테스트했으며, SIEVE가 더 정확하게 답을 찾아낼 뿐만 아니라 기존의 가장 뛰어난 방식들보다 20.7~50.6% 적은 "토큰"(컴퓨터가 처리하는 텍스트의 기본 단위)을 사용한다는 것을 발견했습니다. 요컨대, 웹의 구조를 존중함으로써 AI 탐정은 더 빠르고, 저렴하며, 실수를 줄이며 미스터리를 해결할 수 있습니다.
탐정의 새로운 도구 상자: SIEVE
수천 페이지에 달하는 거대한 요리책에서 특정 레시피를 찾고 있다고 상상해 보십시오. 예전 방식( "Search–Visit" 방식)은 사서에게 "초콜릿 케이크 레시피가 있나요?"라고 묻는 것입니다. 사서는 당신에게 그것이 들어있을지도 모르는 열 권의 책 목록을 건넵니다. 당신은 그중 하나를 골라 첫 페이지부터 마지막 페이지까지 책 전체를 읽으며 책 중간 어딘가에 초콜릿 케이크 레시피가 있기를 바랍니다. 만약 찾지 못한다면, 다시 돌아가 다른 책을 골라 그 책 전체를 또 읽어야 합니다. 이는 매우 지치고 느린 일이며, 결국 당신의 머릿속은 필요하지도 않은 빵과 수프에 대한 정보로 가득 차게 됩니다.
이 논문의 저자들은 이것이 인터넷을 사용하는 매우 나쁜 방법이라고 주장합니다. 웹 페이지는 단순히 텍스트 덩어리가 아닙니다. 책에 장(chapter)이 있는 것처럼 웹 페이지도 제목, 헤딩, 날짜, 섹션으로 구조화되어 있습니다. 문제는 현재의 AI 에이전트들이 이러한 "장"들을 자주 무시한다는 점입니다. 그들은 답이 페이지의 작은 한 섹션에만 있음에도 불구하고 페이지 전체를 읽어버립니다.
이를 해결하기 위해 연구팀은 search–inspect–fetch 전략인 SIEVE를 만들었습니다. SIEVE를 목차를 어떻게 사용하는지 정확히 아는 탐정이라고 생각하십시오.
1단계: 슈퍼 필터 (검색 - Search)
막연한 질문을 던지는 대신, SIEVE는 **불리언 쿼리 언어(Boolean Query Language, BQL)**라는 특수한 언어를 사용합니다. 이것은 사서에게 매우 엄격한 규칙을 주는 것과 같습니다. 단순히 "케이크를 찾아줘"라고 하는 대신, 에이전트는 "제목에 'Chocolate'이 포함되고, 섹션이 'Recipes'이며, 날짜가 2020년 이후인 문서를 찾아줘"라고 말합니다. 이는 수천 개의 무관한 페이지를 즉시 걸러냅니다. 이는 마치 알맞은 모래만 통과시키고 돌은 남겨두는 마법의 체(sieve)를 가진 것과 같습니다.
2단계: 빠른 훑어보기 (검사 - Inspect)
필터가 제 역할을 다한 후, 에이전트는 아직 전체 페이지를 읽지 않습니다. 대신 "결과 카드"를 살펴봅니다. 이 카드들은 제목, 주요 헤딩 목록, 그리고 아주 짧은 25단어 분량의 텍스트 스니펫을 보여주는 인덱스 카드와 같습니다. 에이전트는 "아, 이 책에는 '디저트'라는 장과 '아침 식사'라는 장이 있구나"라고 파악할 수 있습니다. 에이전트는 단 한 문장의 전체 텍스트도 읽지 않고도 어떤 헤딩이 유망해 보이는지 검사할 수 있습니다.
3단계: 정밀한 추출 (가져오기 - Fetch)
이것이 결정적인 차이를 만듭니다. 에이전트는 "디저트" 장이 자신에게 필요하다는 것을 알게 되면, 책 전체를 펼치지 않습니다. 대신 시스템에 오직 그 "디저트" 섹션만을 "가져오기(fetch)" 해달라고 요청합니다. 에이전트는 빵, 수프, 역사에 관한 장들을 완전히 무시하고 오직 그 특정 정보의 조각만을 얻습니다.
이것이 왜 중요한가: 속도와 영리함
연구진은 세 가지 다른 어려운 질문 컬렉션(HotpotQA, MuSiQue, BROWSECOMP-PLUS)을 사용하여 이 새로운 방식이 기존의 "페이지 전체 읽기" 방식보다 얼마나 나은지 테스트했습니다. 이 컬렉션들은 일반적인 위키피디아 질문부터 매우 깊고 복잡한 연구 과제에 이르기까지 다양한 난이도의 퀴즈 게임과 같습니다.
결과는 인상적이었습니다. SIEVE는 단순히 시간을 절약했을 뿐만 아니라, 실제로 더 나은 답을 찾아냈습니다.
- 정확도(Accuracy): 세 가지 컬렉션 모두에서 SIEVE는 기존의 가장 뛰어난 방식보다 더 정확했습니다.
- 효율성(Efficiency): SIEVE는 답을 찾는 데 20.7%에서 50.6% 더 적은 토큰을 사용했습니다. 이를 설명하자면, 전통적인 에이전트가 답을 찾기 위해 100페이지를 읽어야 했다면, SIEVE는 무관한 부분을 건너뜀으로써 50페이지(또는 그 이하)를 읽는 것과 같은 양만 소비하면 된다는 뜻입니다.
- 견고함(Robustness): 팀은 이 방식을 다양한 "두뇌"(AI 모델) 및 다양한 검색 엔진과 함께 테스트했지만, SIEVE는 계속해서 승리했습니다. 에이전트가 단순한 검색 도구를 사용하든 복잡한 도구를 사용하든 상관없이 효과적이었습니다.
논문이 말하는 것 (그리고 말하지 않는 것)
저자들은 자신들이 발견한 바를 매우 명확히 밝히고 있습니다. 그들은 단순히 추측한 것이 아니라, 동일한 질문을 사용하여 기존 방식과 SIEVE를 직접 비교하는 통제된 실험을 수행했습니다.
- 증명한 것: 그들은 웹 페이지의 구조를 무시하는 것이 실수라는 것을 증명했습니다. 구조(헤딩, 섹션)를 사용하여 필요한 것만 필터링하고 가져옴으로써, 에이전트는 더 똑똑해질 수 있고 효율적일 수 있습니다. 또한 "search–inspect–fetch" 루프가 단순히 "Search–Visit"보다 우수하다는 것을 증명했습니다.
- 배제한 것: 그들은 페이지 전체를 읽는 것(비록 여러 번 검색하더라도)이 낭비라는 것을 보여주었습니다. 또한 단순히 더 나은 "두뇌"(더 강력한 AI 모델)를 갖는 것만으로는 충분하지 않으며, 검색하고 읽는 방식이 비효리적이라면 소용없다는 것을 보여주었습니다.
- 여전히 어려울 수 있는 부분: 논문은 SIEVE가 여전히 에이전트가 좋은 "불리언" 쿼리를 작성할 수 있는지 여부에 의존한다고 언급합니다. 만약 에이전트가 잘못된 질문을 던지면, 필터가 정답을 차단할 수도 있습니다. 하지만 연구진은 시스템에 "안전망"이 있다는 것을 발견했습니다. 만약 엄격한 필터가 아무것도 찾지 못하면, 시스템은 자동으로 규칙을 완화하여 다시 시도하므로 중간에 막히지 않습니다.
큰 그림
이 논문은 AI 연구의 미래가 단순히 AI를 일반적인 의미에서 더 "똑똑하게" 만드는 것뿐만 아니라, AI에게 더 조직적으로 행동하는 법을 가르치는 것에 있다는 점을 시사합니다. 인간 연구자가 단 하나의 사실을 찾기 위해 백과사전 전체를 읽지 않듯이, AI도 그럴 필요가 없습니다. 웹에 있는 정보의 구조를 존 respect 함으로써, SIEVE는 우리가 더 빠르고, 비용이 적게 들며, 더 정확한 에이전트를 구축할 수 있음을 보여줍니다. 이는 때때로 진실을 찾는 가장 좋은 방법은 모든 것을 읽는 것이 아니라, '올바른 것'을 읽기 시작하는 것임을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.