← 최신 논문
🤖 AI

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

이 논문은 신뢰도 기반 투표가 검색된 문서로부터 발생하는 "복사 팽창(copy inflation)"으로 인해 멀티 턴 검색 에이전트에서 실패한다는 점을 식별하고, 검색된 소스와의 어휘적 중첩을 바탕으로 롤아웃의 점수를 매겨 여러 벤치마크에서 상당한 정확도 향상을 달성하는 방법론인 검색 근거 투표(Retrieval-Grounded Voting, RGV)를 제안한다.

원저자: Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능이 급격히 발전하는 세상에서, 거대 언어 모델은 복잡한 문제를 추론하는 데 능숙해졌습니다. 이러한 시스템을 더 신뢰할 수 있게 만들기 위해, 연구자들은 종종 모델에게 동일한 질문에 대해 여러 가지 가능한 답을 생성하게 한 뒤 그중 가장 좋은 것에 투표하도록 요청합니다. 단순한 작업의 경우, 영리한 기법이 등장했습니다. 시스템은 모델이 글을 쓰는 동안 얼마나 '확신'을 느끼는지에 따라 각 답변에 가중치를 부여합니다. 모델이 높은 확실성을 가지고 단어를 생성하고 있다면, 그 답변에는 더 무거운 투표권이 주어집니다. 이 방식은 모델이 자신의 내부 학습 내용에만 의존하여 진공 상태에서 작업할 때는 잘 작동합니다. 그러나 새로운 세대의 AI 에이전트들이 게임의 판도를 바꾸고 있습니다. 이 에이전트들은 단순히 생각만 하는 것이 아니라 검색을 합니다. 이들은 디지털 연구자처럼 행동하며, 질문에 답하기 위해 인터넷에서 외부 문서를 가져오고, 이를 읽고, 그 새로운 정보에 기반하여 최종 응답을 작성합니다. 이러한 고독한 사고에서 능동적인 검색으로의 전환은, 그들의 답변 품질을 판단하는 방식에 있어 사각지대를 만들어냈습니다.

미국과 아시아의 대학 연구진은 기존의 확신 측정 방식이 이 새로운 환경에서는 처참하게 실패한다는 것을 발견했습니다. 그들은 AI 에이전트가 방금 검색한 문서의 텍스트를 복사할 때, 모델의 내부 확신 측정기가 통제 불능 상태가 된다는 것을 발견했습니다. 시스템은 복사된 단어들을 보게 되고, 그 단어들이 자신의 즉각적인 메모리에 존재하기 때문에, 자신이 옳은 일을 하고 있다고 인위적으로 확신하게 됩니다. 이는 가짜 안도감을 만들어냅니다. 모델은 오해의 소지가 있는 기사에서 잘못된 사실을 복사할 수도 있지만, 모델의 내부 신호는 그것이 옳다고 외칩니다. 연구자들은 이 현상을 "복사 팽창(copy inflation)"이라고 부릅니다. 이는 마치 학생이 에세이를 쓰는 동안 정답지를 볼 수 있도록 허용된 것과 같습니다. 정답을 복사하는 행위 자체가 그들을 엄청나게 자신감 있게 만들지만, 설령 그들이 보고 있는 정답지가 틀렸더라도 말입니다. 이러한 팽창은 좋은 답변과 나쁜 답변 사이의 차이를 무력화시켜, 투표 시스템을 가장 신뢰할 수 있는 것을 선택하는 스마트한 방식이 아닌, 단순히 답변이 몇 번 나타나는지를 세는 방식으로 붕괴시킵니다.

이를 해결하기 위해, 연구자들은 모델의 마음 밖을 내다보는 새로운 투표 방식을 제안했습니다. 모델에게 얼마나 확신하는지 묻는 대신, 최종 답변이 에이전트가 찾은 실제 문서와 얼마나 잘 일치하는지 확인하는 것을 제안했습니다. 그들은 이를 "검색 근거 기반 투표(Retrieval-Grounded Voting)"라고 부릅니다. 과정은 간단합니다. 에이전트가 작업을 마친 후, 시스템은 최종 답변의 단어들을 에이전트가 검색한 문서의 텍스트와 비교합니다. 만약 답변이 찾아낸 증거로부터 직접 구축되었다면 높은 점수를 받습니다. 만약 답변이 모호하거나 출처 자료에 나타나지 않는 단어들에 의존한다면 낮은 점수를 받습니다. 이 접근 방식은 모델의 오염된 내부 신호를 우회합니다. 이는 모델이 스스로를 재평가할 필요도 없고, 새로운 생각을 생성하기 위해 추가적인 계산 능력을 필요로 하지도 않습니다. 그것은 단순히 답변과 증거 사이의 관계를 확인할 뿐이며, 이 연결 고리는 모델의 확신과는 독립적으로 존재합니다.

연구팀은 복잡한 검색 작업이 포함된 네 가지 서로 다른 벤치마크와 다섯 가지 서로 다른 거대 언어 모델을 대상으로 이 아이디어를 테스트했습니다. 결과는 일관적이었으며 유의미했습니다. 새로운 방식은 전통적인 확신 기반 투표보다 지속적으로 우수한 성능을 보였으며, 정확도를 최대 5.4 퍼센트 포인트 향상시켰습니다. 개선 효과는 정답이 시도 횟수 중 아주 적은 부분에만 존재하는 가장 어려운 사례에서 더욱 극적이었습니다. 이러한 어려운 시나리오에서 새로운 방식은 기존 방식보다 35% 더 정확했습니다. 이는 매우 중요한데, 왜냐하면 대부분의 시도가 틀리더라도, 그 정답이 검색된 증거에 제대로 근거하고 있다면 시스템이 정답을 찾아낼 수 있음을 의미하기 때문입니다. 연구진은 또한 이 새로운 방식이 믿기지 않을 정도로 효율적이라는 것을 발견했습니다. 이 방식은 표준 컴퓨터 프로세서에서 답변당 1밀리초도 걸리지 않아 비용이 거의 들지 않는 반면, 확신 문제를 해결하려는 다른 방식들은 종가 비싼 추가 계산이나 추가적인 모델 호출을 요구합니다.

연구는 또한 복사 팽창 문제가 드문 오류가 아니라, 이러한 검색 에이전트가 작동하는 방식의 근본적인 특징임을 밝혔습니다. 연구진은 에이전트가 쓰는 단어의 대다수가 검색한 문서에서 직접 복사된다는 것을 측정했습니다. 이러한 높은 복사율이 내부 확신 신호를 신뢰할 수 없게 만드는 원인입니다. 외부 증거로 초점을 전환함으로써, 연구진은 답변의 품질이 모델의 내부적인 확신감이 아니라, 소스 자료와의 연결성에 의해 가장 잘 판단된다는 것을 보여주었습니다. 이 발견은 이 분야에 더 넓은 교훈을 시사합니다. 즉, AI 에이전트가 외부 정보에 의존할 때, 그들이 생성하는 자기 확신 신호는 오해의 소지가 있을 수 있다는 것입니다. 그들의 작업을 검증하는 가장 신뢰할 수 있는 방법은 그들이 표현하는 감정이 아니라, 그들이 사용한 증거를 보는 것입니다.

이 연구는 AI 에이전트의 모든 문제를 해결했다고 주장하지 않습니다. 새로운 방식은 여전히 검색 결과의 품질에 의존합니다. 즉, 에이전트가 나쁜 문서를 찾는다면 이 방식이 마법처럼 답을 고칠 수는 없습니다. 또한, 이 방식은 답변이 텍스트에 얼마나 잘 근거하고 있는지를 측정하는 것이지, 그 텍스트 자체가 참인지 거짓인지를 측정하는 것이 아닙니다. 만약 검색된 문서에 거짓이 포함되어 있다면, 시스템은 여전히 그 답변이 근거가 높다고 평가할 수 있습니다. 그러나 이 연구는 여러 AI 시도의 결과물을 어떻게 결합할 것인가를 개선하는 명확하고 실용적인 경로를 제공합니다. 모델의 내부 맥락 밖으로 나와서 그들이 수집한 구체적인 증거를 살펴봄으로써, 연구자들은 더 견고하고, 더 정확하며, 기계가 찾은 것을 읽고 반복할 때 발생하는 확신의 환상에 덜 휘둘리는 시스템을 구축할 수 있습니다. 이 작업은 검색 기반 AI의 시대에 가장 신뢰할 수 있는 신호는 모델의 목소리가 아니라, 그 모델이 쥐고 있는 문서라는 것을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →