Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents
본 논문은 링크 유효성, 관련성 및 사실적 정확성을 평가하기 위해 AST 파서를 활용하여 LLM 이 생성한 연구 보고서를 평가하는 새로운 평가 프레임워크를 제시하며, 최첨단 모델조차도 인용 접근성과 관련성은 높게 유지하지만 사실적 일관성에는 어려움을 겪는 중요한 괴리를 드러내는데, 이 문제는 검색 깊이가 깊어질수록 더욱 심화됩니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 복잡한 주제에 대한 보고서를 작성하도록 초지능 연구 보조원 (AI 모델) 팀을 고용했다고 가정해 봅시다. 당신은 그들에게 "인터넷에서 진실을 찾아보고, 보고서를 작성하며, 모든 사실을 찾은 정확한 출처를 반드시 나열하세요"라고 지시합니다.
공유된 논문은 바로 이 AI 보조원들이 제출한 숙제를 점검하기로 결정한 품질 관리 검사관과 같습니다. 검사관은 단순히 보고서를 읽고 고개를 끄덕이는 대신, AI 가 작성한 모든 각주를 확인하기 위한 특수 로봇을 구축했습니다.
그들이 발견한 바를 간단히 설명해 드리겠습니다.
3 단계 점검
연구자들은 AI 의 인용문을 세 가지 구체적인 방식으로 점검하는 시스템을 구축했는데, 이는 3 단계 보안 검색과 같습니다.
- "문이 열려 있는가?" 점검 (링크 작동 여부): 링크가 실제로 작동합니까? 클릭했을 때 웹페이지로 이동합니까, 아니면 끊긴 404 오류입니까?
- "이것이 같은 것에 관한 것인가?" 점검 (관련성): 링크가 작동한다면, 해당 웹페이지가 AI 가 주장한 주제에 대해 실제로 이야기합니까? (예: AI 는 "이 링크는 고양이가 개임을 증명한다"고 하지만, 링크는 실제로는 라자냐 레시피입니다.)
- "그것이 사실인가?" 점검 (사실 확인): 이것이 가장 어려운 부분입니다. 웹페이지에 AI 가 말한 대로 구체적인 사실, 숫자, 날짜가 실제로 포함되어 있습니까?
큰 놀라움: "반짝이는 포장" 문제
가장 충격적인 발견은 AI 보조원들이 앞의 두 가지 점검에서는 뛰어나지만, 세 번째 점검에서는 형편없다는 것입니다.
- 비유: 참고문헌을 포함한 논문을 작성하는 학생을 상상해 보세요.
- 94% 의 경우, 참고문헌에 나열된 책들이 실제로 도서관 선반에 존재합니다 (링크 작동).
- 80% 의 경우, 그 책들은 실제로 학생이 작성 중인 주제에 관한 것입니다 (관련성).
- 하지만, 실제로 책을 열어 학생이 인용한 특정 페이지를 읽어보면, 약 40% 에서 77% 의 경우에만 그 책이 학생이 주장한 대로 실제로 말하고 있습니다.
핵심 요약: AI 는 관련 웹사이트로 작동하는 링크를 찾는 데 매우 능숙하지만, 그 웹사이트에 무엇이 쓰여 있는지에 대해서는 종종 거짓말을 합니다. 이는 항상 올바른 박물관으로 안내하는 가이드이지만, 내부 전시에 대한 이야기를 잘못 전달하는 것과 같습니다.
"더 많을수록 더 적다"는 역설
연구자들은 AI 에게 더 깊이 검색하고 더 많은 웹사이트를 보라고 지시하면 어떻게 되는지도 테스트했습니다. "AI 에게 2 개가 아니라 150 개의 웹사이트를 읽게 하면 더 정확해지겠지?"라고 생각할 수 있습니다.
틀렸습니다.
- 비유: 퍼즐을 푸는 상황을 상상해 보세요. 퍼즐 조각이 2 개라면 그림을 쉽게 볼 수 있습니다. 하지만 누군가 당신 앞에 150 개의 퍼즐 조각을 쏟아부으면 압도당하게 됩니다. 그림을 완성하기 위해 맞지 않는 조각들을 억지로 맞추기 시작할지도 모릅니다.
- 결과: AI 가 점점 더 많은 출처 (2 개에서 150 개까지) 를 보도록 강요됨에 따라, 진실을 말하는 능력은 실제로 약 42% 하락했습니다. 링크는 여전히 작동했고 주제도 여전히 관련성이 있었지만, 구체적인 사실들은 엉망이 되었습니다. AI 는 "정보 과부하"를 겪고 세부 사항을 착각하기 시작했습니다.
누가 잘했고 누가 못했는가?
- "최첨단 (Frontier)" 모델 (빅테크 AI 들): 이 모델들 (OpenAI, Anthropic, Google 의 모델 등) 은 완벽해 보이는 보고서 생성에 매우 능했습니다. 거의 항상 작동하는 링크와 관련 주제를 찾았습니다. 그러나 가장 똑똑한 모델들조차 사실을 정확히 전달한 비율은 약 39% 에서 77% 에 불과했습니다.
- 오픈소스 모델: 이 모델들은 더 큰 어려움을 겪었습니다. 많은 모델들이 인용문이 포함된 보고서 작성이라는 임무 자체를 완수하지 못했습니다. 시도했을 때, 작동하는 링크를 찾거나 사실을 정확히 전달하는 데 훨씬 더 못했습니다.
결론
이 논문은 하단에 링크 목록이 있다는 이유만으로 AI 연구 결과를 신뢰할 수 없다고 결론지었습니다. 작동하는 링크가 긴 목록을 만드는 것은 "거짓된 신뢰감"을 조성합니다. 문이 열려 있고 방이 올바른 방이라고 해서, AI 가 그 방 안에 있는 것에 대해 들려주는 이야기가 진실이라는 뜻은 아닙니다.
연구자들은 겉보기에 좋아 보이는 인용문과 실제로 진실인 인용문 사이의 간극을 우리가 볼 수 있도록 돕기 위해 이 "점검 로봇"을 구축했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.