Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory
본 논문은 PING 분류 체계와 DeepHalluBench 벤치마크를 도입하여 전체 연구 과정 전반에 걸쳐 환각 현상을 과정 인식적이고 세밀하게 감사할 수 있도록 함으로써 결과 기반 평가의 한계를 다루고, 체계적인 신뢰성 격차를 드러내며 아키텍처 개선을 위한 실행 가능한 통찰력을 제공합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
매우 까다로운 질문의 답을 찾기 위해 초지능 연구 조교를 고용한다고 상상해 보세요. 당신은 그에게 "자신이 연출한 영화에서 연기 부문 아카데미상을 받은 유일한 인물은 누구인가?"라고 묻습니다. 그는 나가서 인터넷을 검색하고 기사를 읽은 뒤 최종 보고서를 가지고 돌아옵니다.
작업 결과를 확인하는 구식 방법:
과거에 조교가 훌륭한지 알고 싶다면 최종 보고서만 확인했습니다. 이름이 맞으면 금별을 주고, 틀리면 빨간 X 를 찍었습니다.
문제점:
이 논문은 최종 답변만 확인하는 것은 요리사가 요리를 어떻게 했는지 보지 않고 수프의 맛만으로 요리사를 평가하는 것과 같다고 주장합니다. 수프 맛이 나빴을 수도 있는데, 그 이유는 소금을 잊어버렸기 때문일 수도 있고 (작은 실수), 냉장고 뒤쪽에 있던 상한 토마토를 사용했을 수도 있으며 (큰 거짓말), 아예 당신의 주문을 오해해서 다른 요리를 만들기 시작했을 수도 있습니다.
저자들은 현재의 "딥 리서치 에이전트"(AI 연구원) 가 과정 중에 실수를 저지르고 있지만, 우리는 최종 답변만 확인하기 때문에 그들이 어디서 그리고 왜 실패했는지 보지 못한다고 말합니다. 실수들은 중간에 숨어 있습니다.
새로운 접근법: "과정 탐정"
저자들은 DeepHalluBench라는 새로운 시스템을 구축했습니다. 이는 조교가 단계별로 요리를 하는 모습을 볼 수 있는 투명한 주방과 같습니다. 그들은 수프만 확인하는 것이 아니라 모든 재료, 모든 다지기, 모든 저어주기를 확인합니다.
그들은 AI 가 어떻게 혼란에 빠지는지 분류하기 위한 새로운 규칙집인 PING 분류체계를 만들었습니다. 간단한 비유를 사용하여 PING 가 무엇을 의미하는지 살펴보면 다음과 같습니다.
P - 전파 (The "Domino Effect" - 도미노 효과):
조교가 첫 번째 단계에서 "사과는 파란색이다"라고 생각하는 것처럼 작은 실수를 한다고 상상해 보세요. 두 번째 단계에서 그들은 그 잘못된 아이디어를 바탕으로 "파란 사과"를 검색합니다. 세 번째 단계에서는 "파란 사과"에 대한 보고서를 작성합니다. 전체 사건 연쇄는 그 첫 번째 거짓말 위에 세워집니다. 이것이 전파입니다. 논문은 AI 가 한 번 거짓말을 시작하면 종종 그 거짓말을 기반으로 계속 쌓아 올려, 나중 단계들이 잘못된 정보에 기반하여 "올바르게" 수행되었더라도 최종 보고서를 완전히 잘못되게 만든다고 발견했습니다.I - 의도 (The "Misunderstood Order" - 오해된 주문):
당신이 "비건" 레시피를 요청했는데, 조교는 그 단어를 무시하고 스테이크 레시피를 제공했습니다. 또는 "2023 년" 보고서를 요청했는데, 그들은 "2010 년" 보고서를 제공했습니다. 조교는 연구를 수행했지만, 당신의 특정 규칙을 듣지 않았습니다. 이것이 의도 할루시네이션입니다.N - 잡음 유발 (The "Distracted Librarian" - 산만한 사서):
조교가 도서관에 가서 100 권의 책을 찾았다고 상상해 보세요. 그중 99 권은 고양이 관련 책이지만, 당신이 요청한 특정 개에 관한 책은 1 권뿐입니다. 조교는 그 1 권의 개 관련 책이 더미에 묻혀 있다는 이유로 모든 99 권의 고양이 책을 읽고 그 책을 무시합니다. 그들은 거짓말을 한 것은 아니지만, 가장 중요한 단서를 놓쳤습니다. 이것이 잡음 유발 할루시네이션입니다.G - 근거 (The "Fake Fact" - 가짜 사실):
조교는 실제 기사를 보지만, "이 기사는 달이 치즈로 만들어졌다고 말한다"고 말합니다. 실제로 그 기사는 치즈에 대해 전혀 언급하지 않습니다. 조교는 무언가를 지어내거나 잘못된 출처를 비난하고 있습니다. 이것이 근거 할루시네이션입니다.
그들이 발견한 것 (결과)
저자들은 100 개의 매우 어려운 질문에 대해 OpenAI, Google 등 유명 AI 연구 조교 6 명을 새로운 "과정 탐정" 시스템을 사용하여 테스트했습니다.
- 모두가 고군분투 중입니다: 최고의 AI 조교조차 연구 중간에 실수를 했습니다. 그들 중 누구도 완벽하지 않았습니다.
- "도미노"가 가장 큰 문제입니다: 가장 위험한 문제는 단순히 하나의 거짓말을 만드는 것이 아니라, AI 가 초기에 작은 실수를 저지른 후 나머지 연구가 그 실수 위에 세워져 완전한 실패로 이어진다는 점입니다.
- 그들은 처음 보는 것에 매몰됩니다: AI 는 찾은 첫 번째 검색 결과에 집중하는 경향이 있습니다 (책의 첫 페이지만 읽고 전체 이야기를 안다고 가정하는 사람처럼). 만약 답이 50 페이지에 있다면, AI 는 종종 그것을 놓칩니다.
- 그들은 "지루한" 답변을 선호합니다: AI 가 모두 같은 내용을 말하는 다섯 개의 기사를 찾으면 그것을 좋아합니다. 만약 다른 내용을 말하는 독특한 기사가 하나 있다면, 종종 그것을 무시합니다.
결론
이 논문은 단순히 AI 를 "더 똑똑하게" 만들거나 인터넷 접근 권한을 더 주는 것만으로는 부족하다고 결론 내립니다. 문제는 AI 가 검색하는 동안 어떻게 생각하는가에 있습니다.
이를 해결하기 위해 우리는 다음과 같은 AI 를 구축해야 합니다.
- 실수가 도미노 효과로 번지기 전에 스스로의 실수를 조기에 포착할 수 있어야 합니다.
- 당신이 주는 특정 규칙을 더 잘 경청해야 합니다.
- 처음 보는 것에 산만해지지 않고, 최고의 답변을 찾기 위해 계속 찾아야 합니다.
요약하자면: 우리는 더 이상 최종 보고서만 채점할 수 없습니다. AI 가 왜 실패했는지 이해하려면 전체 영화를 지켜봐야 합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.