SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
이 논문은 검색 지향적 컨텍스트 관리(Search-Oriented Context Management)를 통해 작업 진행 상황을 공유 상태로 외재화하고, 효율성을 극대화하기 위해 파이프라인 병렬 스케줄링을 채택하며, 반복적인 검색 루프를 방지하고 증거 커버리지를 개선하기 위해 계층적 기술을 갖춘 미들웨어 하네스를 활용함으로써 오픈 도메인 정보 탐색을 강화하는 강력한 멀티 에이전트 프레임워크인 SearchOS를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 거대한 미스터리를 풀기 위해 고군분투하는 탐정이라고 상상해 보세요. 하지만 당신에게는 단 하나의 수첩 대신, 주니어 탐정들로 구성된 팀이 있습니다. 인공지능의 세계에서 이 "탐정들"은 **에이전트(agents)**라고 불리는 똑똑한 컴퓨터 프로그램입니다. 이들은 인터넷과 대화하고, 웹사이트를 읽고, 정보를 수집하여 당신의 질문에 답할 수 있습니다. 오랫동안 이 에이전트들은 이미 찾아낸 것을 계속 까먹어버리는 탐정들과 같았습니다. 미스터리가 커질수록, 그들은 혼란에 빠지거나, 똑같은 질문을 반복하거나, 혹은 시간을 낭비하며 루프(loop)에 갇혀 버리곤 했습니다. 그들에게는 진행 상황을 공유하고 체계적으로 기록할 방법이 없었기 때문입니다.
이를 해결하기 위해 연구자들은 이 에이전트들이 더 잘 협력할 수 있는 더 나은 방법들을 구축하고 있습니다. 그들은 대규모 언어 모델(Large Language Models)(글을 읽고 쓸 줄 아는 초지능적인 두뇌라고 생각하세요)을 사용하고, 웹을 검색할 수 있는 도구들을 부여합니다. 큰 과제는 **장기적 과업(long-horizon tasks)**입니다. 이는 수백 개의 사실을 수집하고, 그것들이 서로 일치하는지 확인하며, 완벽하게 정리해야 하는 복잡한 작업들을 의미합니다. 만약 에이전트들이 "전체적인 그림"을 놓치게 되면, 최종 답변은 엉망이 되거나 불완전해집니다. 이 논문은 바로 이 문제를 다룹니다. 어떻게 하면 디지털 탐정들이 자신의 작업 속에서 길을 잃는 것을 막고, 그들이 잘 짜인 기계처럼 협력하도록 도울 수 있을까요?
문제점: "건망증 걸린 탐정"의 루프
당신과 친구들이 모호한 설명서를 바탕으로 거대한 레고 성을 만들려고 한다고 상상해 보세요. 여러분 모두 브릭을 집어 들기 시작하지만, 아무도 이미 무엇을 찾았는지 목록을 작성하지 않습니다. 한 친구는 다른 친구가 10분 전에 이미 찾은 빨간색 2x4 브릭을 계속 찾으러 다닙니다. 또 다른 친구는 잠겨 있는 문을 열려고 애쓰며, 다른 문을 시도하는 대신 계속해서 문을 두드리는 데 갇혀 버립니다.
이것이 현재의 AI 검색 에이전트들에게 일어나는 현상입니다. 복잡한 질문에 답하려고 할 때, 그들은 진행 상황을 놓칩니다. 그들은 반복적인 루프에 빠져, 막다른 길에서 "검색 예산"(시간과 컴퓨팅 파워)을 낭비합니다. 또한 증거가 긴 대화 기록 속에 파묻혀 중요한 사실을 놓칠 수도 있고, 공유된 지도가 없기 때문에 서로 논쟁을 벌일 수도 있습니다. 단순히 에이전트를 더 많이 추가하는 것은 해결책이 되지 않습니다. 오히려 서로 발을 밟으며 더 큰 혼란을 초래할 뿐입니다.
해결책: 검색을 위한 "운영 체제", SearchOS
저자들은 이 검색 에이전트들을 위한 중앙 통제 센터 또는 "운영 체제" 역할을 하는 새로운 프레임워크인 SearchOS를 소개합니다. 에이전트들이 희미해지는 기억에 의존하게 두는 대신, SearchOS는 그들이 결코 잃어버리지 않을 공유되고 조직화된 노트에 모든 것을 기록하도록 강제합니다.
작동 방식은 다음과 같은 재미있는 비유를 통해 설명할 수 있습니다.
1. 마스터 청사진 (관계형 스키마 - Relational Schema)
단순히 "회사들에 대해 알려줘"와 같이 모호한 질문을 던지는 대신, SearchOS는 이 과업을 거대한 구조화된 스프레드시트를 채우는 과정으로 바꿉니다. 마치 탐정 게시판에 "회사 이름", "CEO", "매출", "설립 연도"와 같은 특정 열(column)이 있는 것과 같습니다. 에이전트의 임무는 단순히 "정보를 찾는 것"이 아니라, 이 스프레드시트의 모든 빈 칸을 채우는 것입니다. 셀이 비어 있다면, 시스템은 정확히 무엇이 누락되었는지 알 수 있습니다. 이는 무질서하고 개방적인 검색을 명확하고 측정 가능한 "빈칸 채우기" 게임으로 바꿉니다.
2. 공유 지휘 본부 (SOCM)
이것이 SearchOS의 핵심입니다. 이는 전체 팀을 위한 공유된 두뇌 역할을 하는 검색 지향 컨텍스트 관리(Search-Oriented Context Management) 시스템입니다. 이 시스템은 다음 네 가지 핵심 요소를 실시간으로 업데이트합니다:
- 프런티어 태스크 리스트 (The Frontier Task List): 어떤 스프레드시트 셀이 아직 비어 있는지 보여주는 할 일 목록입니다.
- 증거 그래프 (The Evidence Graph): 발견된 모든 사실과 그것이 출처가 된 웹사이트를 직접 연결한 지도입니다. (출처를 확인할 수 있도록 합니다.)
- 커버리지 맵 (The Coverage Map): 스프레드시트의 어느 부분이 채워졌고, 어느 부분이 불확실하며, 어느 부분이 누락되었는지 보여주는 시각적 대시보드입니다.
- 실패 메모리 (Failure Memory): "다시는 시도하지 마시오" 목록입니다. 만약 한 에이전트가 검색을 시도했다가 실패하면(예: 깨진 웹사이트), 이 메모리는 다른 에이전트들에게 "그건 더 이상 시도하지 마세요. 막다른 길입니다"라고 알려줍니다.
3. 조립 라인 (파이프라인 병렬 스케줄링 - Pipeline-Parallel Scheduling)
기존 시스템은 종종 에이전트들이 서로를 기다리게 만듭니다. 마치 단 한 명의 계산원 앞에 줄을 서 있는 사람들처럼 말이죠. SearchOS는 파이프라인 병렬 스케줄링을 사용합니다. 공장의 조립 라인을 상상해 보세요. 한 에이전트가 작업을 마치고 자리를 비우는 즉시, 시스템은 가용한 다음 에이전트에게 새로운 작업을 전달합니다. 아무도 놀고 있지 않습니다. 한 에이전트가 느리더라도, 다른 에이전트들은 스프레드시트의 다른 부분들을 계속 작업합니다. 이를 통해 팀 전체가 훨씬 더 빠르고 효율적으로 움직입니다.
4. 심판 (미들웨어 하네스 - Middleware Harness)
때때로 에이전트들이 루프에 빠지거나 시간이 부족해질 수 있습니다. SearchOS에는 에이전트의 모든 움직임을 감시하는 엄격한 심판 역할을 하는 **검색 도구 미들웨어 하네스(Search Tool Middleware Harness)**가 있습니다. 만약 심판이 에이전트가 잠긴 문을 계속 두드리거나(실패한 검색) 똑같은 질문을 반복하는 것을 발견하면, 심판이 개입하여 에이전트를 멈추고 새로운 전략을 부여합니다. 또한, 에이전트가 찾는 모든 사실이 최종 보고서에 작성되기 전에 실제 출처와 연결되어 "근거가 확실한지(grounded)" 확인합니다.
5. 도구 상자 (계층적 기술 - Hierarchical Skills)
SearchOS에는 미리 만들어진 기술(skills) 라이브러리가 포함되어 있습니다. 이것을 탐정의 키트에 들어있는 전문 도구라고 생각하세요. 어떤 도구는 일반적인 검색을 위한 것이고(예: "좋은 질문을 던지는 법"), 어떤 도구는 특정 웹사이트에 특화되어 있습니다(예: "정부 데이터베이스를 탐색하는 법"). 시스템은 에이전트들이 새로운 사이트를 방문할 때마다 매번 바퀴를 다시 발명할 필요가 없도록 이 도구들을 사용하는 법을 가르칩니다.
연구 결과: 성과
연구진은 WideSearch와 GISA라는 두 가지 까다로운 벤치마크를 통해 SearchOS를 테스트했습니다. 이 테스트들은 다양한 출처에서 많은 사실을 수집해야 하는 복잡한 질문들을 포함합니다.
결과는 인상적이었습니다. SearchOS는 단일 에이전트 시스템과 다른 멀티 에이전트 팀을 포함하여 테스트된 모든 다른 방법들을 압도했습니다.
- WideSearch 테스트에서, SearchOS는 80.3의 Item-level F1 점수를 기록하며 모든 방법 중 가장 높은 성적을 거두었습니다.
- GISA 테스트에서는 Set F1 지표에서 76.5를 기록하며, 차순위 시스템을 13.4포인트라는 큰 차이로 따돌렸습니다.
이 논문은 에이전트들이 내부 기억에 의존하는 대신, 공유된 명시적 상태(스프레드시트와 지도)를 바탕으로 작업하도록 강제함으로써 시스템이 훨씬 더 신뢰할 수 있게 된다는 점을 시사합니다. 이를 통해 오류를 높이지 않으면서도(높은 정밀도 유지) 더 많은 사실을 찾아낼 수 있습니다(더 나은 재현율).
이것이 왜 중요한가
이것은 단순히 AI를 더 빠르게 만드는 것에 관한 것이 아닙니다. AI를 신뢰할 수 있게 만드는 것에 관한 것입니다. AI가 심층적인 조사를 수행할 때, 당신은 AI가 중요한 사실을 놓쳤거나 숫자를 지어내지 않았다는 것을 알아야 합니다. SearchOS는 AI가 무엇을 알고 있는지, 무엇을 모르는지, 그리고 어디에서 막혔는지를 정확히 볼 수 있는 방법을 제공합니다. 이는 인터넷 검색이라는 혼란스러운 과정을 구조화되고 관찰 가능한 협업 과정으로 탈바꿈시킵니다.
저자들은 검색을 공유된 "운영 체제"를 가진 상태 기반(stateful)의 협업 과정으로 취급하는 이 접근 방식이, AI 에이전트가 소음 속에서 길을 잃지 않고 복잡한 현실 세계의 연구 과업을 처리할 수 있도록 만드는 중요한 진전이라고 제안합니다. 그들은 단순히 더 나은 검색 엔진을 만든 것이 아니라, AI 에이전트들이 팀으로서 함께 일하는 더 나은 방법을 만든 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.