← 최신 논문
💬 NLP

Equal Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents

이 논문은 상업용 검색 API가 단순히 답변의 정확도뿐만 아니라, 최종 답변 성능이 제공자 간에 유사하더라도 에이전트의 검색 예산과 탐색 전략에 상당한 영향을 미치는 고유한 스니펫 및 랭킹 특성을 가진 "의사결정 표면(decision surfaces)"으로서 평가되어야 한다고 주장한다.

원저자: Sriram Selvam, Anneswa Ghosh

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Sriram Selvam, Anneswa Ghosh

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 탐정이 되어 미스터리를 해결하려고 한다고 상상해 보십시오. 하지만 당신은 직접 범죄 현장을 볼 수 없습니다. 대신 당신은 '검색 엔진'이 당신에게 인덱스 카드 한 더미를 건네주기를 기다려야 합니다. 각 카드에는 URL(주소), 제목, 그리고 아주 작은 텍스트 조각(스니펫)이 적혀 있습니다. 오직 이 카드들에만 의존해서 당신은 결정해야 합니다: "지금 이 정보만으로 문제를 해결할 수 있는가?" 아니면 "그 주소에 있는 전체 기사를 읽기 위해 추가적인 시간과 비용을 들여야 하는가?"

이 논문은 이러한 인덱스 카드의 설계가, 비록 당신이 결국 같은 수의 미스터리를 해결하게 되더라도, 당신의 탐정 업무를 어떻게 변화시키는지에 관한 것입니다.

거대한 오해

오랫동안 사람들은 만약 두 검색 엔진이 동일한 수의 정답을 제공한다면, 그 두 도구는 기본적으로 동일한 것이라고 생각했습니다. 이 논문은 그것이 마치 두 개의 서로 다른 지도가 결국 같은 목적지에 도달하게 해준다는 이유만으로 두 지도가 동일하다고 말하는 것과 같다고 주장합니다. 그것은 '여정'을 놓치고 있는 것입니다.

저자들은 검색 엔진이 단순히 링크의 목록이 아니라, **"결정 표면(decision surface)"**이라고 제안합니다. 그것은 당신의 AI 에이전트에게 선택을 강요하는 특정한 단서들의 집합(스니펫, 제목, 순위)입니다: 여기서 멈추고 답할 것인가, 아니면 계속 파헤칠 것인가?

실험: 통제된 탐정 게임

이를 테스트하기 위해, 연구진은 엄격한 게임을 설정했습니다. 탐정(AI 에이전트), 규칙, 그리고 도구를 고정했습니다. 유일하게 바꾼 것은 카드를 건네주는 검색 엔진 제공자였습니다. 연구진은 세 가지를 테스트했습니다: Brave, Tavily, 그리고 Firecrawl.

연구진은 100개의 매우 어려운 질문(SEALQA-HARD라는 데이터셋에서 추출)을 던졌습니다. 여기서 반전이 있습니다: 세 검색 엔진 모두 최종 정답을 거의 동일한 횟수로 맞혔습니다 (100개 중 각각 25, 25, 26회). 만약 점수판만 본다면, 당신은 이들이 완전히 동일하다고 생각할 것입니다.

하지만 연구진이 내부를 들여다보며 탐정이 어떻게 작동했는지 조사했을 때, 이야기는 완전히 달라졌습니다.

세 가지 다른 "카드 덱"

최종 점수는 동점이었음에도 불구하고, 각 제공자마다 증거의 "경제성"은 완전히 달랐습니다:

  1. Brave ("금이 풍부한" 덱):
    Brave는 정답이 아주 작은 스니펫 텍스트 안에 숨겨져 있는 카드를 건네주었습니다. 탐정은 카드를 읽는 것만으로도 금빛 정답을 볼 수 있었습니다. 하지만 카드가 너무 유용했기 때문에, 탐정은 때때로 너무 많은 정보 때문에 혼란을 겪거나 정작 중요한 특정 카드를 놓치기도 했습니다.

    • 통계: Brave는 30개의 질문에서 프리페치(pre-fetch) 지원(전체 페이지를 읽기 전에 보이는 단서)을 제공했습니다.
    • 함정: 단서가 존재했음에도 불구하고, 에이전트가 이를 사용하여 즉시 사건을 해결한 경우는 101개의 "골드 지원" 행 중 단 13개(약 13%)뿐이었습니다.
  2. Tavily ("상단 집중형" 덱):
    Tavily는 달랐습니다. 스니펫 안에 정답을 많이 담고 있지는 않았지만, 정답을 가지고 있을 때는 그 카드를 순위 1위(맨 위)에 배치했습니다.

    • 통계: 스니펫에 정답이 노출된 질문들 중 **34개 중 17개(50%)**가 맨 위 자리에 있었습니다.
    • 시사점: 만약 당신의 탐정이 "항상 첫 번째 카드를 읽는다"라는 규칙을 가지고 있다면, Tavily는 매우 효율적인 파트너가 될 것입니다.
  3. Firecrawl ("탐험가형" 덱):
    Firecrawl의 카드는 앞면에 정답이 있을 확률이 더 낮았습니다. 이는 탐정을 더 모험적으로 만들었습니다. 동일한 규칙 하에서, Firecrawl를 사용하는 에이전트는 "전체 페이지 가져오기(fetch full page)"를 더 자주 클릭했습니다.

    • 통계: 에이전트는 Brave를 사용할 때(65%)보다 더 많은 질문인 **81%**의 경우에 페이지를 가져왔습니다.
    • 함정: 이는 최종 정확도는 같았음에도 불구하고, 에이전트가 더 많은 토큰(디지털 돈)과 시간을 들여 탐색했음을 의미합니다.

"모순"의 함정

논문은 또한 무서운 사실을 발견했습니다: 때때로 카드가 거짓말을 한다는 것입니다. 연구진은 스니펫이 실제 정답과 모순되는 빈도를 측정했습니다.

  • Brave: 정답 단서 1개당 0.92개의 모순 발생.
  • Firecrawl: 정답 단서 1개당 2.59개의 모순 발생.
    이는 Firecrawl를 사용할 때, 탐정이 진실을 찾기 전까지 더 많은 혼란스럽거나 상충하는 노이즈를 헤쳐 나가야 함을 의미합니다.

결론

이 논문은 검색 엔진을 선택하는 것은 품질의 문제가 아니라 정책적 결정이라고 결론짓습니다.

만약 Brave를 선택한다면, 초기에 많은 정보를 얻겠지만 정보를 필터링하는 전략이 필요할 수 있습니다.
만약 Tavily를 선택한다면, 좋은 정보가 숨어 있는 곳이 바로 그곳이므로 첫 번째 결과를 신뢰해야 합니다.
만 만약 Firecrawl를 선택한다면, 더 깊이 파고들 준비(더 많은 리소스 소모)가 되어 있어야 합니다.

저자들은 우리가 검색 API를 단순한 "목록 생성기"로 취급하는 것을 멈추고, **"결정 표면"**으로 취급해야 한다고 제안합니다. 올바른 선택은 당신의 에이전트가 어떻게 행동하도록 프로그래밍되었는지에 달려 있습니다. "원 사이즈(one-size-fits-all)" 방식은 통하지 않습니다. 왜냐하면 이 연구가 시사하듯, 동일한 정확도는 매우 다르고, 때로는 매우 비용이 많이 드는 내부 여정을 숨길 수 있기 때문입니다.

그러니 다음에 두 AI 에이전트가 같은 답을 내놓는 것을 보더라도, 그들이 같은 경로를 거쳤다고 가정하지 마십시오. 한 명은 첫 번째 지도에서 보물을 발견했을 수도 있고, 다른 한 명은 보물을 찾기 위해 산더미 같은 흙을 파헤쳐야 했을 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →