← 최신 논문
💬 NLP

Attribution in Scientific Literature: New Benchmark and Methods

이 논문은 다양한 증거 조건 하에서 환각률과 적절한 기권 사이의 균형을 맞춤으로써 대규모 언어 모델의 과학적 인용 속성 부여의 신뢰성을 평가하고 개선하기 위해 설계된 대규모 벤치마크이자 이중 지표 프레임워크인 REASONS를 소개한다.

원저자: Deepa Tilwani, Yash Saxena, Seyedali Mohammadi, Ankur Padia, Edward Raff, Amit Sheth, Srinivasan Parthasarathy, Manas Gaur

게시일 2026-09-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Deepa Tilwani, Yash Saxena, Seyedali Mohammadi, Ankur Padia, Edward Raff, Amit Sheth, Srinivasan Parthasarathy, Manas Gaur

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 과학적 발견의 지형에서 연구자들은 복잡한 연구 결과를 요약하고 방대한 문헌 전반에 걸쳐 아이디어를 연결하기 위해 점점 더 인공지능에 의존하고 있습니다. 대규모 언어 모델로 알려진 이 지능형 시스템은 방대한 양의 텍스트를 학습하여 유창하고 인간과 유사한 응답을 생성할 수 있습니다. 과학 분야에서 이들의 유용성을 결정짓는 핵심적인 특징은 자신의 주장 뒤에 근거를 붙여 독자들에게 해당 진술을 뒷받침하는 원본 논문을 안내하는 능력입니다. 그러나 하나의 지속적인 문제가 이러한 신뢰를 저해합니다. 모델들이 때때로 존재하지 않는 참고 문헌을 만들어내거나 실제 논문을 잘못된 주장에 할당한다는 점입니다. 흔히 '환각(hallucination)'이라 불리는 이 현상은 위험한 권위의 환상을 만들어냅니다. 과학자와 개발가들의 핵심 과제는 단순히 모델이 확신할 때 더 정확하게 만드는 것이 아니라, 언제 모른다고 인정해야 하는지를 이해시키는 것입니다. 만약 모델이 충분한 증거가 있는 상황과 그렇지 않은 상황을 구분하지 못한다면, 연구자를 조작된 사실의 길로 자신 있게 인도할 위험이 있습니다.

한 연구팀은 새로운 테스트 환경인 REAS-ONS를 구축하여 이 불확실성 문제를 다루었습니다. 이는 과학적 인용을 얼마나 잘 처리하는지 측정하기 위해 특별히 설계된 벤치마크입니다. 연구팀은 컴퓨터 비전부터 양자 컴퓨팅에 이르기까지 12가지 서로 다른 연구 분야에서 추출한 1만 2천 개 이상의 구체적인 문장들을 수집했습니다. 이 컬렉션의 각 문장은 검증된 실제 인용구와 연결되어 있어, 모델을 테스트할 수 있는 명확한 '지면 진실(ground truth)'을 제공합니다. 연구진은 단순히 모델에게 올바른 논문을 찾으라고 요구하는 데 그치지 않고, 가용한 정보의 양이 변할 때 모델이 어떻게 행동하는지 보기 위해 일련의 실험을 설계했습니다. 그들은 세 가지 뚜렷한 시나리오에서 모델을 테스트했습니다. 첫째, 외부 정보 없이 모델이 오직 암기한 것에만 의존하도록 강제하는 경우, 둘째, 논문의 제목과 초록 같은 검증된 메타데이터를 모델에 직접 제공하는 경우, 셋째, 질문에 답하는 것을 돕기 위해 데이터베이스에서 관련 문서를 검색하는 고급 검색 도구를 사용하는 경우입니다.

결과는 유용함과 정직함 사이의 극명하고 일관된 상충 관계를 드러냈습니다. 모델에게 추가 정보가 주어지지 않았을 때, 많은 모델이 '기권(abstention)'이라 불리는 행동을 보이며 답변을 거부했습니다. 이러한 거부는 실수를 방지한다는 점에서는 의미가 있었지만, 사용자에게 아무런 가치도 제공하지 못한다는 뜻이기도 했습니다. 그러나 연구진이 맥락을 추가하자—모델에게 논문 상세 정보를 제공하거나 데이터베이스를 검색하게 하자—모델은 훨씬 더 적극적으로 입을 열기 시작했습니다. 불행히도, 이러한 반응성 증가는 가혹한 대가를 치렀습니다. 모델은 "모른다"고 말하는 것을 멈추고, 심지어 답변이 틀렸을 때조차 높은 확신을 가지고 답변을 내놓기 시작했습니다. 고급 검색 도구를 사용한 특정 테스트에서, 잘못된 인용의 비율은 거의 88%로 급증한 반면, 답변을 거부하는 모델의 비율은 0%로 떨어졌습니다. 모델은 더 이상 신중하지 않았습니다. 그들은 자신 있게 틀리고 있었습니다.

이러한 행동은 모든 과학 유형에 걸쳐 균일하게 나타나지는 않았습니다. 연구는 모델이 잘 알려진 분야인 컴퓨터 비전에 비해 양자 컴퓨팅이나 생체 분자와 같은 전문 분야에서 성능이 현저히 떨어진다는 것을 발견했습니다. 이러한 틈새 영역에서 모델은 추가 정보가 제공되더라도 훨씬 더 자주 잘못된 추측을 하는 경외를 보였습니다. 연구진은 또한 모델이 증거를 더 많이 봄으로써 경로를 수정할 수 있기를 기대하며, 정보를 단계적으로 공개하는 방법도 테스트했습니다. 이 방법은 일부 오류를 줄이는 데는 도움이 되었으나 근본적인 문제는 해결하지 못했습니다. 과도한 확신을 갖는 경 tendency가 있는 모델들은 더 일찍 기권을 멈추고 계속해서 잘못된 정보를 주장했습니다. 또한 연구진은 자동화된 측정의 정확성을 보장하기 위해 1,000개의 모델 출력물에 대해 세심한 인간 검토를 포함했습니다. 전문가들은 모델이 단순히 다른 단어를 사용하여 같은 내용을 말하는 것이 아니라, 실제로 잘못된 저자나 잘못된 논문을 인용하는 등의 사실적 오류를 범하고 있음을 확인했습니다.

이러한 결과는 현재의 시스템 구축 방식이 퍼즐의 중요한 조각을 놓치고 있음을 시사합니다. 단순히 더 많은 데이터를 추가하거나 더 나은 검색 도구를 도입하는 것은 모델을 더 신뢰할 수 있게 만드는 것이 아니라, 오히려 모델의 자연스러운 망설임을 억제함으로써 더 위험하게 만들 수 있습니다. 연구진은 진정으로 신뢰할 수 있는 시스템이란 얼마나 자주 정답을 맞히느냐가 아니라, 언제 침묵해야 하는지를 아는 능력에 의해 평가되어야 한다고 주장합니다. 연구는 인공지능이 과학적 발견의 안전한 파트너가 되기 위해서는, 우리가 답변을 생성하는 능력을 가치 있게 여기는 것만큼이나 인식적 안전성(epistemic safety)—즉, 불확실성을 인정하는 의지—을 중요하게 설계해야 한다고 결론지었습니다. 이러한 균형이 없다면, 자신감 있는 조작의 위험은 고도의 전문성을 요구하는 과학 작업에서 이 강력한 도구들을 사용하는 데 있어 중대한 장벽으로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →