← 최신 논문
💬 NLP

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

이 논문은 검색 증강 에이전트가 답변 불가능한 멀티홉 질문을 어떻게 처리하는지 평가하기 위해 설계된 최초의 벤치마크인 HopRefusalBench를 소개하며, 모델들이 답변 불가능한 이유를 식별할 수는 있는 경우가 많지만, 적절한 거절을 확정하는 데 자주 실패하여 대신 환각 현상을 보이거나 검색 예산을 소진한다는 점을 밝혀낸다.

원저자: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

게시일 2026-08-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 해결하기 위해 아주 똑똑한 탐정을 고용한다고 상상해 보세요. 이 탐정은 즉시 방문할 수 있는 마법의 도서관을 가지고 있으며, 서로 다른 책들 사이의 점들을 연결하여 답을 찾아내는 데 매우 능숙합니다. 이것이 현대의 "검색 증강(Search-Augmented)" AI 에이전트가 작동하는 방식입니다. 즉, 이들은 대규모 언어 모델로서 인터넷(또는 데이터베이스)을 검색하러 나가 정보를 조립하여 당신의 질문에 답할 수 있습니다. 보통 이 방식은 놀랍도록 훌륭합니다. 하지만 만약 당신이 답을 낼 수 없는 질문을 던진다면 어떻게 될까요? 예를 들어, "현재 프랑스의 국왕은 누구인가요?"(국왕은 존재하지 않습니다)라고 묻거나, "존재하지 않는 요리의 비밀 재료는 무엇인가요?"라고 묻는다면 어떨까요?

AI의 세계에서는, 답을 하는 것만큼이나 답을 하지 말아야 할 때를 아는 것도 매우 중요합니다. 만약 당신의 탐정이 계속해서 도서관을 뒤지며 가짜 국왕을 만들어내거나, 존재하지 않는 재료를 찾기 위해 몇 시간이나 허비한다면, 그 탐정은 도움이 되는 것이 아니라 고집스럽고 낭비적인 존재가 됩니다. 과학자들은 이를 "거절(refusal)"이라고 부릅니다. 즉, "질문 자체가 잘못되었기 때문에 답할 수 없습니다"라고 말할 수 있는 능력입니다. 우리는 이 AI 탐정들이 어려운 퍼즐을 푸는 데 점점 더 능숙해지고 있다는 것을 알고 있지만, 정작 퍼즐 자체가 풀 수 없는 불가능한 상태일 때 이들이 어떻게 행동하는지는 잘 알지 못했습니다. 그들은 빨리 멈췄을까요? 혼란에 빠졌을까요? 아니면 그냥 이야기를 지어냈을까요?

이 논문은 이 AI 탐정들이 불가능한 질문을 어떻게 다루는지 정확히 파악하기 위해 HopRefusalBench라는 새로운 테스트를 소개합니다. 연구진은 AI를 함정에 빠뜨리기 위해 설계된 889개의 까다로운 질문들을 만들었습니다. 그들은 단순히 간단한 "모르겠습니다" 식의 질문을 던진 것이 아니라, 함정이 질문의 맨 앞, 중간의 단서, 혹은 맨 끝에 위치하도록 설계된 복잡하고 다단계적인 미스터리를 구축했습니다. 연구진은 AI가 질문이 잘못되었다는 것을 초기에 깨달을지, 아니면 계속 검색하다가 결국 환각(hallucination, 답변을 지어냄) 현상을 일으킬지를 확인하고자 했습니다.

결과는 다소 충격적이었습니다. 테스트에 참여한 가장 똑똑한 AI 모델들조차도 올바르게 멈춰 서서 "답할 수 없습니다"라고 말하는 데 성공한 비율이 **42.9%**에 불과했습니다. 이는 절반 이상의 경우에서 AI가 질문이 불가능하다는 사실을 인지하지 못했음을 의미합니다. 연구 결과, AI 모델들은 증거가 확보된 후에는 왜 질문이 잘못되었는지 그 논리를 설명하는 데는 꽤 능숙했지만(84% 이상의 경우 논리를 설명할 수 있었음), 실제로 멈추기로 '결단'하는 데는 어려움을 겪었습니다. "포기하겠다"라고 말하는 대신, 그들은 시간이 다 되거나 에너지가 바닥날 때까지 계속 검색하거나, 사용자를 만족시키기 위해 가짜 답변을 만들어내는 경우가 많았습니다.

또한 연구진은 질문 속에 "함정"이 어디에 배치되었는지가 매우 중요하다는 것을 발견했습니다. 문제가 추론 과정의 중간(예: 두 섬 사이의 끊어진 다리)에 있을 때가 문제의 맨 끝에 있을 때보다 AI가 멈추기 훨씬 더 어려웠습니다. 나아가, 불가능한 질문의 유형에 따라 AI가 실패하는 방식도 달랐습니다. 어떤 모델은 사실을 지어내는 경향(환각)이 있는 반면, 어떤 모델은 예산(budget)이 바닥날 때까지 무한히 검색을 계속하는 경향을 보였습니다.

요약하자면, 이 논문은 우리의 AI 탐정들이 정보를 찾는 능력은 향로지고 있지만, 언제 그만둬야 할지를 아는 데는 여전히 서툴다는 것을 보여줍니다. 그들은 질문 자체가 결함이 있음에도 불구하고 멈추기보다는 검색의 굴레에 갇히거나 이야기를 지어내는 경우가 많습니다. 저자들은 이 AI 에이전트들이 진정으로 신뢰할 수 있는 존재가 되기 위해서는, 단순히 검색하는 법뿐만 아니라 막다른 길을 인식하고 시간을 낭비하거나 잘못된 정보를 퍼뜨리기 전에 멈추는 법을 배워야 한다고 제안합니다. 다행인 점은, 이제 우리에게 그들이 정확히 어디에서 실패하고 있는지, 그리고 어떻게 고칠 수 있는지를 진단할 수 있는 지도(HopRefusalBench)가 생겼다는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →