Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
본 논문은 에이전트 검색 시스템에서 grep 기반 검색이 종종 벡터 검색보다 우수한 성능을 보이지만, 기본 데이터가 동일하더라도 전체 성능은 사용된 특정 에이전트 하네스와 도구 호출 패러다임에 크게 영향을 받음을 실증적으로 입증하는 연구를 제시한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 미스터리를 해결하려는 형사라고 상상해 보세요. 하지만 단일 파일 폴더 대신 수백만 페이지의 대화 로그가 담긴 거대한 도서관을 가지고 있습니다. 고객의 질문에 답하기 위해 "회의는 몇 시에 시작되었나요?"나 "사용자의 좋아하는 색상은 무엇인가요?"와 같은 특정 사실을 찾아야 합니다.
이 논문은 PwC 소속 팀이 AI "형사"(대형 언어 모델) 가 이 도서관을 검색하는 두 가지 다른 방식을 테스트한 보고서입니다. 그들은 AI 가 "의미 기반의 지능형 검색"(예: "빨간 차에 대한 이야기"를 사서에게 요청하는 것) 을 사용해야 하는지, 아니면 "문자 그대로의 키워드 검색"(예: "빨간 차!"라고 외치며 해당 단어가 정확히 포함된 모든 페이지를 스캔하는 것) 을 사용해야 하는지 확인하고자 했습니다.
다음은 그들의 발견을 간단한 비유로 정리한 내용입니다:
두 가지 검색 방식
- 벡터 검색 (지능형 사서): 이 방식은 질문의 의미를 이해합니다. "빠른 차량"에 대해 질문하면, "차량"이라는 단어가 없더라도 "속도를 내는 스포츠카"가 언급된 페이지를 찾을 수 있습니다. 개념을 이해하는 데는 훌륭하지만, 정확한 답변은 없으면서도 주제와 관련된 페이지에 혼동될 수도 있습니다.
- 그립 (Grep) 검색 (키워드 스캐너): 이는 blunt 한 도구입니다. 정확한 단어나 패턴을 찾습니다. "빠른 차량"을 요청하면 정확히 그 단어가 포함된 페이지만 찾습니다. 의미를 이해하지는 못하지만, 필요한 정확한 문장을 찾는 데는 놀라울 정도로 정밀합니다.
실험: "하네스 (Harness)"가 중요합니다
연구자들은 검색 방식만 테스트한 것이 아니라, 서로 다른 "작업 공간"(하네스라고 함) 내에서 이를 테스트했습니다.
- 커스텀 하네스 (Chronos): 이는 맞춤형 형사 사무소라고 생각하세요. AI 에게 파일을 정리하고, 질문하는 방법을 정확히 지시하며, 답변을 완벽하게 포맷하는 관리자가 있습니다.
- 공급자 CLI 하네스 (Claude Code, Codex, Gemini CLI): 이는 기술 대기업에서 제공하는 기성 툴킷과 같습니다. AI 에게 터미널과 같은 명령줄이 주어지고,
grep과 같은 표준 도구를 스스로 어떻게 사용할지 찾아내야 합니다.
큰 놀라움
1. "문자 그대로"의 스캐너가 종종 승리합니다
"지능형" 의미 기반 검색이 항상 더 좋다는 일반적인 믿음과 달리, 이 연구는 문자 그대로의 키워드 스캐너 (그립) 가 특히 날짜, 이름, 숫자와 같은 구체적인 사실에 대한 답변일 때 더 정확한 경우가 많았음을 발견했습니다.
- 비유: 책에서 특정 전화번호를 찾을 때, 사서에게 "연락처 정보"를 찾아달라고 요청하는 것 (벡터) 보다 정확한 숫자를 외치는 것 (그립) 이 더 신뢰할 수 있는 경우가 많습니다. 왜냐하면 사서가 주제와 관련된 다른 전화번호가 있는 페이지를 가져올 수도 있기 때문입니다.
2. 검색 결과를 AI 에게 전달하는 방식이 모든 것을 바꿉니다
연구자들은 검색 결과를 AI 에게 제공하는 두 가지 방식을 테스트했습니다:
- 인라인 (열린 책): 검색 결과가 채팅 창에 직접 붙여넣어집니다. AI 는 즉시 읽습니다.
- 결과: 그립이 압도했습니다. 정확한 단어가 AI 바로 앞에 붙여넣어지면, AI 는 답변을 정확히 맞췄습니다.
- 파일 기반 (문서 캐비닛): 검색 결과가 파일로 저장되고, AI 는 그 파일을 열고 읽기 위해 두 번째 단계를 수행해야 합니다.
- 결과: 우위가 뒤집혔습니다. 때로는 파일을 여는 추가 단계에 AI 가 혼란을 겪었습니다. 이러한 경우, 더 작고 관련성 높은 결과를 가져와 읽기 쉬운 "지능형" 벡터 검색이 더 잘 작동하기도 했습니다. 그러나 일부 AI 모델의 경우 파일 기반 방식이 그립의 우위를 사라지게 하거나 심지어 반전시키기도 했습니다.
3. "작업장"이 "도구"보다 더 중요합니다
가장 놀라운 발견은 검색 도구 자체보다 환경 (하네스) 이 더 중요했다는 점입니다.
- 비유: 마치 명장에게 칼을 주는 것과 같습니다. 부주방장이 있는 전문 주방 (커스텀 하네스) 에 두면 완벽한 요리를 하지만, 지시사항이 없는 지저분하고 낯선 주방 (공급자 CLI) 에 두면 같은 칼을 가지고도 고군분투할 수 있습니다.
- 동일한 AI 모델 (예: Claude Opus) 이도 커스텀 하네스에서는 93% 점수를 받았지만, 공급자의 CLI 에서는 동일한 검색 데이터를 사용했음에도 76% 점수에 그쳤습니다. "관리자"와 "지시사항"이 검색 방법보다 결과를 더 크게 변화시켰습니다.
4. "노이즈" 테스트
연구자들은 검색 방식이 어떻게 견디는지 보기 위해 도서관에 점점 더 많은 관련 없는 대화 (노이즈) 를 추가했습니다.
- 그들은 도서관이 더 지저분해질수록 결과가 예측 불가능하다는 것을 발견했습니다. 때로는 "지능형 사서 (벡터)"가 초기에 노이즈를 필터링하는 데 더 좋았고, 다른 때는 "키워드 스캐너 (그립)"가 AI 가 올바른 패턴을 찾은 후 노이즈를 무시하는 데 더 좋았습니다.
- 모든 상황에 작동하는 단일 "최고" 방식은 없었습니다. 이는 사용된 AI 모델과 어떤 "작업장" 설정이 사용되었는지에 전적으로 달려 있었습니다.
결론
이 논문은 AI 검색을 위한 단일 "만병통치약"은 없다고 결론 내립니다.
- "의미 기반 검색"이 미래라고 단순히 가정하지 마세요. 정확한 사실이 필요한 작업의 경우, 간단한 키워드 검색이 종종 더 우수합니다.
- 설정이 모든 것입니다. 검색 결과를 AI 에게 제시하는 방식 (채팅에 직접 vs 파일에) 과 AI 의 워크플로우를 관리하는 방식 (커스텀 지시사항 vs 원시 도구) 은 검색 알고리즘 자체보다 결과를 더 크게 변화시킵니다.
간단히 말해: AI 가 무엇을 검색하는지뿐만 아니라, AI 가 검색을 수행하도록 어떻게 설정되어 있는지, 그리고 결과가 어떻게 전달되는지가 중요합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.