← 최신 논문
💬 NLP

DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

이 논문은 딥 리서치 에이전트가 오픈 웹 환경에서 그럴듯하게 속이는 문서에 직면했을 때 정확도가 크게 떨어진다는 것을 보여주는 벤치마크인 DRNOISE를 소개하며, 이는 에이전트가 뒷받침하는 증거와 적극적으로 대조하여 조정하기보다 직접적인 허위 주장에 성급히 굴복하는 '검증 관성(verification inertia)'이라는 실패 모드 때문임을 밝히고 있습니다.

원저자: Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han

게시일 2026-07-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Jun Nie, Zhiqin Yang, Zhenheng Tang, Yonggang Zhang, Xiaowen Chu, Xinmei Tian, Bo Han

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 미스터리를 해결하려는 탐정이라고 상상해 보세요. 인공지능의 세계에는 '딥 리서치 에이전트(deep research agent)'라고 불리는 특별한 프로그램들이 있습니다. 이들은 수천 권의 문서를 읽고, 인터넷을 검색하며, 복잡한 질문에 답하기 위해 단서들을 짜 맞출 수 있는 초강력 인턴과 같습니다. 이들의 업무는 단순히 정답이 적힌 문장 하나를 찾는 것이 아닙니다. 엉망진 ЕС인 기록 더미를 파헤치고, 사실 관계를 교차 검증하며, 결론을 내리기 전에 탄탄한 근거를 구축하는 것입니다.

하지만 여기에 까다로운 문제가 있습니다. 인터넷은 소음으로 가득 찬 곳입니다. 유익한 사실들도 있지만, 오래된 보고서, 혼란스러운 요약본, 그리고 때로는 매우 전문적으로 보이지만 완전히 틀린 문서들도 존재합니다. 연구자들이 던지는 핵심적인 질문은 이것입니다. 이 AI 탐정들이 완벽해 보이는 문서를 발견했을 때, 그것을 즉시 신뢰할 것인가? 아니면 멈춰 서서 그 밑에 깔린 지저прав고 읽기 힘든 증거들과 대조하며 재확인할 것인가? 만약 그들이 번지르르하고 읽기 쉬운 거짓말을 너무 빨리 믿어버린다면, 확신에 차 있지만 완전히 틀린 답을 내놓게 될 것입니다. 이것이 '오도하는 증거(misleading evidence)'의 위험이며, AI를 금융이나 법률 같은 실제 업무에서 신뢰할 수 있게 만드는 데 있어 주요한 장애물입니다.

여기에 DRNOISE라는 새로운 연구가 등장했습니다. 이 연구는 이 AI 탐정들이 얼마나 똑똑한지 확인하기 위한 함정 역할을 합니다. 연구진은 100가지의 서로 다른 퍼즐로 구성된 게임을 만들었습니다. '클린(clean)' 버전의 게임에서 AI는 두 개의 별개 단서 체인을 연결하여 정답을 찾아야 합니다. 이는 마치 해적의 일기에 적힌 지도와 선장의 항해 일지를 서로 맞추어 보물 위치를 찾는 것과 같습니다. 두 문서 모두 직접적으로 "X가 보물이 있는 곳이다"라고 말하지는 않지만, 두 문서를 함께 배치하면 답이 명확해집니다. AI는 점들을 연결하는 고된 작업을 수행해야 합니다.

그다음, 연구진은 '노이즈(noisy)' 버전을 도입했습니다. 동일한 퍼즐과 동일한 단서들을 사용하되, 중간에 문서 하나를 슬쩍 끼워 넣었습니다. 이 새로운 문서는 '가짜 요약본'으로, 일반적인 비즈니스 보고서처럼 보였지만 완전히 틀린 답을 당당하게 주장하고 있었습니다. 이는 디지털 방식으로 구현된, "보물은 여기에 있다!"라고 크고 굵은 글씨로 적힌 잘못된 방향의 표지판과 같았습니다.

결과는 충격적이었습니다. AI 에이전트들이 '클린' 퍼즐을 마주했을 때는 가장 똑똑한 모델들이 거의 모든 문제를 맞혔습니다(일부는 96% 이상의 점수를 기록했습니다). 하지만 그 가짜 요약본 하나가 추가되는 순간, 이들의 성능은 폭락했습니다. 가장 뛰어난 에이전트들은 정확도가 무려 88%포인트나 떨어졌습니다. 이전에는 거의 완벽했던 가장 똑똑한 모델들이 갑자기 거의 모든 질문에 틀린 답을 내놓으며, 정확도가 1%까지 떨어지기도 했습니다.

연구진은 왜 이런 일이 발생하는지 알아내기 위해 AI의 '사고 과정'을 파헤쳤습니다. 그들은 AI가 진실을 찾지 못해서 실패한 것이 아님을 발견했습니다. 실제로 AI는 종종 진짜 단서와 가짜 문서를 동시에 찾아냈습니다. 문제는 AI가 너무 일찍 멈췄다는 점입니다. AI는 직접적인 답이 담긴 가짜 문서를 보고, "오, 이거 아주 쉽고 설득력 있어 보이는데"라고 생각하며 검색을 중단해 버렸습니다. 이는 연구자들이 '검증 관성(verification inertia)'이라고 부르는 현상을 겪은 것입니다. 이는 마치 용의자가 범인처럼 보인다는 이유로 즉시 체포해 버리고, 알리바이나 지문 등을 확인하는 과정을 무시하는 탐정과 같습니다.

연구진은 단순히 "주의를 기울이고 네 작업을 다시 확인해라"라고 말하는 것만으로 AI를 고칠 수 있는지 테스트했습니다. 이것은 약간의 도움은 되었지만, 문제를 해결하지는 못했습니다. AI는 여전히 번지르르하고 직접적인 거짓말을 지저분하고 읽기 힘든 진실보다 더 신뢰하는 경고한 경향을 보였습니다. 심지어 연구진이 가짜 문서를 (공식 보고서 대신) 평범한 포럼 게시글처럼 덜 격식 있게 만들었을 때도, AI는 대부분의 경우 그 거짓말에 속아 넘어갔습니다.

가장 시사하는 바가 큰 테스트는 연구진이 AI에게 검색 과정을 거치지 않고 모든 단서를 한꺼번에 제공했을 때 일어났습니다. AI가 전체 그림을 보고 나니(진짜 단서와 가짜 거짓말을 나란히 놓고 보니), 보통은 옳은 답을 찾아낼 수 있었습니다. 이는 AI가 퍼즐을 풀 수 있는 능력을 이미 갖추고 있음을 증명합니다. 다만, 매력적인 지름길을 발견했을 때 계속해서 찾아보려는 절제력이 부족했을 뿐입니다.

요컨대, 이 논문은 가장 똑똑한 AI 리서치 에이전트들에게도 사각지대가 있다는 점을 시사합니다. 그들은 정보를 찾는 데는 뛰어나지만, 그것을 검증하는 데 있어서는 놀라울 정도로 게으릅니다. 만약 어떤 문서가 직접적인 답처럼 보인다면, 그들은 바로 옆의 증거가 그것이 틀렸음을 입증하고 있음에도 불구하고, 생각을 멈추고 그것을 그대로 베껴 쓰는 경향이 있습니다. 저자들은 AI가 진정으로 복잡한 현실 세계에서 신뢰받기 위해서는, 단순히 답을 찾는 법뿐만 아니라, 쉽고 틀린 유혹에 저항하는 법도 배워야 한다고 결론지었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →