Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs
이 논문은 과학적 미세 조정이 대규모 언어 모델의 환각과 확신을 역설적으로 증가시키는 동시에 내부적 신뢰도는 감소시킨다는 점을 밝혀냄으로써, 사실성을 개선하기 위한 현재의 도메인 특화 미세 조정 방식에 의문을 제기하는 다중 도메인 벤치마크인 SciFactCheck를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 당신에게는 모든 것에 대해 조금씩은 다 아는, 박학다식하고 독서량이 풍부한 사서가 한 명 있습니다. 이 사서는 바로 여러분의 표준 대규모 언어 모델(LLM)입니다. 이들은 대화는 잘하지만, 사실 관계가 확실하지 않을 때는 때때로 말을 지어내곤 합니다. 이를 "환각(hallucination)"이라고 부릅니다.
이제, 이 사서를 과학만을 전문적으로 공부하는 특수 대학교로 보내는 것을 상상해 보세요. 당신은 그에게 수천 권의 교과서, 연구 논문, 학술지를 제공합니다. 당신은 그가 이전보다 훨씬 더 신뢰할 수 있는 "과학 전문가"가 되어 돌아오기를 기대합니다.
이 논문은 그 실험에 대한 성적표이며, 그 소식은 놀랍게도 좋지 않습니다.
연구진이 사용한 결과는 다음과 같습니다. 이해를 돕기 위해 쉬운 비유를 사용했습니다.
1. "전문가"가 오히려 더 나빠졌다
연구진은 SCIFACTCHECK라는 거대한 테스트를 만들었습니다. 그들은 18개의 서로 다른 AI 모델(일반 모델과 "과학적으로 훈련된" 모델 포함)에게 공학에서 철학에 이르기까지 2,500개의 다양한 과학적 주제에 대해 짧은 단락을 쓰도록 요청했습니다.
결과: "과학적" 모델들이 일반 모델들보다 오히려 더 많은 실수를 저질렀습니다.
- 비유: 이것은 일반 요리사를 향신료에 대해서만 배우라고 요리 학교에 보내는 것과 같습니다. 당신은 그가 요리를 더 잘하게 될 것이라 기대하겠지만, 대신 그는 물 끓이는 법을 잊어버리고 모든 음식에 향신료를 과하게 넣기 시작했습니다. 전문적인 훈련이 모델을 혼란스럽게 만들어, 일반 목적의 모델들보다 기본적인 사실에 대해 덜 신뢰할 수 있게 만든 것처럼 보였습니다.
2. 세 가지 유형의 "거짓말"
연구진은 단순히 "틀린" 답을 보는 데 그치지 않고, 모델들이 어떻게 틀렸는지를 살펴보았습니다. 그들은 모델이 환각을 일으키는 세 가지 구체적인 방식을 발견했습니다.
- "검증 불가능한" 거짓말 (Unverifiability): 모델이 실제처럼 들리지만 어떤 책이나 논문에서도 찾을 수 없는 사실을 지어냅니다.
- 비유: 사서가 "1995년에 비밀스러운 고양이 사회가 인터넷을 통치했다"라고 말합니다. 매우 구체적으로 들리지만, 이에 대한 기록은 어디에도 존재하지 않습니다.
- "과도하게 확신하는" 거짓말 (Overclaim): 모델이 작은 진실을 가져와서 그것을 거대하고 절대적인 확신으로 부풀립니다.
- 비유: 한 연구가 "이 약이 일부 환자에게 도움이 될 수도 있다"라고 말합니다. 모델은 "이 약은 모든 사람을 치료한다"라고 말합니다. 범위와 확실성을 과장하는 것입니다.
- "가짜 인용" 거짓말 (Attribution): 모델이 자신의 주장을 뒷받침하기 위해 출처를 지어냅니다.
- 비비: 사서가 "스미스 박사가 쓴 '우주 물리학 저널'의 기사에 따르면..."이라고 말하지만, 그 기사와 그 박사는 존재하지도 않았습니다.
3. "자신감 넘치는 무지"의 역설
가장 기이한 발견 중 하나는 모델들이 자신의 답변에 대해 어떻게 "느끼는지"에 관한 것이었습니다.
- 발견: 과학적으로 훈련된 모델들은 더 자신감 있는 언어(예: "확실히", "증명된", "항상")를 사용했지만, 실제로는 내부적인 확신(컴퓨터의 "직관")이 더 낮았습니다.
- 비유: 수학 문제를 풀지 못하는 학생을 상상해 보세요. "잘 모르겠습니다"라고 말하는 대신, 그 학생은 손을 들고 서서 100%의 확신을 가지고 정답을 외칩니다. 그들은 자신감 있는 과학자의 스타일은 배웠지만, 실체는 배우지 못한 것입니다. 그들은 "시끄럽게 틀리고 있는 것"입니다.
4. "팩트 체크"의 문제
마지막으로, 연구진은 컴퓨터를 사용하여 모델을 채점하도록 했고, 그다음 인간 전문가들에게도 채점을 요청했습니다.
- 결과: 컴퓨터 채점단과 인간 전문가들은 항상 일치하지는 않았습니다. 심지어 인간들조차 무엇이 검증 가능한 "과학적 사실"인지에 대해 합의하는 데 어려움을 겪었습니다.
- 비유: 이것은 심판들이 체조 경기를 채점하려고 하는데, 규칙 자체에 대해 서로 동의하지 못하는 것과 같습니다. 수학 같은 분야에서는 모두가 규칙에 동의합니다. 하지만 철학이나 사회 과학 같은 다른 분야에서는, 무엇이 "검증 가능한지" 정의하기가 매우 어렵습니다.
결론
이 논문은 단순히 AI를 과학 서적으로 훈련시키는 것만으로는 신뢰할 수 있는 과학 전문가를 만들 수 없다고 결론짓습니다. 사실, 그것은 모델이 더 정확해지는 대신 더 자신감 있게 들리면서 덜 정확해지게 만들기 때문에 더 위험할 수 있습니다. 우리는 과학적 주장을 검증할 더 나은 도구가 필요하며, "특화된" AI가 자동으로 "일반적인" AI보다 더 나을 것이라고 가정해서는 안 됩니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.