BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation
본 논문은 과학 출판 에이전트에서 LLM 이 생성하는 BibTeX 인용의 할루시네이션 문제를 931 개 논문으로 구성된 벤치마크를 통해 평가하고, 검색 기반 생성 후 clibib 도구를 활용한 2 단계 검증 방식을 도입하여 정확도를 50.9% 에서 78.3% 로 획기적으로 개선하는 완화 전략을 제시합니다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
이 논문은 **"인공지능 (AI) 이 과학 논문을 쓸 때, 참고문헌 (BibTeX) 을 어떻게 엉망으로 만들어내는지"**와 **"그걸 어떻게 고칠 수 있는지"**에 대한 이야기입니다.
마치 유능해 보이는 AI 비서가 과학 논문 초안을 작성해 주는 상황을 상상해 보세요. 비서는 글은 잘 쓰지만, 마지막에 "이 글에 참고한 책과 논문 목록"을 적어달라고 하면, 완전히 엉뚱한 책 제목이나 존재하지 않는 페이지 번호를 지어내곤 합니다.
이 논문은 그 문제를 해결하기 위해 3 가지 핵심 이야기를 합니다.
1. 문제: AI 는 '기억'에 너무 의존합니다 (마치 시험지 외운 학생처럼)
연구자들은 최신 AI 모델 (GPT-5, Claude, Gemini 등) 이 웹 검색 기능을 켜고도 참고문헌을 잘 못 쓴다는 사실을 발견했습니다.
- 유명한 논문 (인기 있는 책): AI 는 이걸 기억하고 있어서 잘 맞춥니다. 마치 시험 전에 유명 인사들의 이름을 외운 학생처럼요.
- 최근 논문 (오늘 나온 신간): AI 는 이걸 기억하지 못합니다. 웹 검색을 하긴 하지만, 검색 결과를 보고도 잘못된 정보를 조합하거나 페이지 번호를 지어내는 실수를 합니다.
비유:
AI 는 기억력이 좋은 도서관 사서 같지만, 새로 들어온 책을 찾을 때는 검색창을 쓰면서도 이전 기억과 섞어서 엉뚱한 책 표지를 그려내는 실수를 저지릅니다. 특히 "저자", "출판 연도", "저널 이름" 같은 핵심 정보는 같이 틀리는 경향이 있습니다. (한 번 틀리면 다 틀림)
2. 해결책 1: "클립 (clibib)"이라는 자동 정렬기 개발
연구진은 AI 가 직접 정보를 지어내는 대신, 공식 데이터베이스 (Zotero, CrossRef 등) 에서 정확한 정보를 가져와 주는 도구를 만들었습니다. 이름은 **clibib**입니다.
- 원리: AI 가 "이 논문 BibTeX 만들어줘"라고 하면,
clibib가 공식 도서관 (데이터베이스) 에 가서 정확한 카드를 가져와서 AI 에게 보여줍니다. - 효과: AI 가 직접 쓴 것보다 훨씬 정확해졌습니다. 하지만 여전히 AI 가 "이게 맞는 책인가?"를 판단하는 과정에서 실수가 조금 남았습니다.
3. 해결책 2: "검색"과 "수정"을 분리하는 두 단계 방식 (가장 중요!)
가장 흥미로운 발견은 도구를 어떻게 사용하는지에 따라 결과가 완전히 달라진다는 것입니다.
- 한 번에 다 하기 (단일 단계): AI 가 검색도 하고, 정리도 하고, BibTeX 를 작성도 하려고 하면 실수가 많습니다. (마치 요리사가 재료를 사러 나갔다가, 씻고, 다지고, 요리하는 걸 한 번에 하려다 실수하는 것)
- 두 단계로 나누기 (이중 단계):
- 1 단계: AI 가 먼저 검색해서 초안을 만듭니다.
- 2 단계:
clibib가 정확한 정보를 가져오고, AI 는 그 정보를 비교해서 틀린 부분만 고칩니다. (요리사가 재료를 다 준비해 놓으면, 요리사는 맛만 보고 고치는 역할만 함)
결과: 두 단계로 나누자 정확도가 **83.6% 에서 91.5%**로 크게 올랐고, 완전히 틀린 문서는 절반 이상 줄었습니다.
📝 핵심 요약 (일상적인 비유로)
- AI 의 버릇: AI 는 과학 논문 참고문헌을 쓸 때, 기억에 의존하거나 검색 결과를 잘못 해석해서 엉뚱한 정보를 지어냅니다. 특히 최근에 나온 논문일수록 더 심합니다.
- 두 가지 실수 유형:
- 완전 교체: "이 논문은 A 가 쓴 2020 년 책이야"라고 했는데, 실제로는 "B 가 쓴 2019 년 책"을 가져옴. (가장 위험함)
- 부분 실수: 책 제목은 맞는데, 페이지 번호만 틀림.
- 해결책: AI 가 직접 정보를 찾아서 쓰는 것보다, 공식 데이터베이스에서 정확한 정보를 가져와서 AI 가 "비교하고 수정"하게 하는 것이 훨씬 좋습니다.
- 교훈: AI 를 믿고 바로 쓰지 말고, 공식 기록 (데이터베이스) 과 비교하는 과정을 거쳐야 합니다. 특히 검색 (찾기) 과 수정 (고치기) 을 분리해서 진행하면 실수가 훨씬 줄어듭니다.
결론적으로, 이 논문은 "AI 가 과학 논문을 쓸 때 참고문헌을 믿지 말고, 공식 도서관 (데이터베이스) 에서 확인하는 절차를 반드시 거쳐야 한다"고 경고하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.