A multilingual hallucination benchmark: MultiWikiQHalluA
본 논문은 306 개 언어를 포괄하는 다국어 환각 벤치마크인 MultiWikiQHalluA 를 소개하고, 이를 활용하여 환각 발생률이 저자원 언어와 작은 모델에서 현저히 높으며 평가된 유럽어 전반에서 가장 큰 모델이 최상의 성능을 보임을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하고 다국어에 능통한 로봇이 있어 위키피디아 기사를 읽고 그 내용에 대한 질문에 답하는 것을 좋아한다고 가정해 봅시다. 당신이 "아이슬란드의 수도는 어디인가요?"라고 묻자, 로봇이 "레이캬비크"라고 답합니다. 훌륭하죠! 하지만 때때로 이 로봇은 조금 지나치게 창의적이 됩니다. "레이캬비크는 달에 위치해 있다"거나 "수도라는 이름은 '아이스버그'라는 도시다"라고 말할 수도 있습니다. 문장이 매끄럽고 자신감 있게 들리더라도, 그것은 완전히 지어낸 말입니다. AI 세계에서는 이를 **환각 (hallucination)**이라고 부릅니다.
이 논문은 로봇을 위한 새로운 "거짓말 탐지기" 테스트와 같습니다. 하지만 영어만 확인하는 대신, 연구진들은 아이슬란드어처럼 컴퓨터가 거의 접하지 않는 언어를 포함해 306 개 언어에서 작동하는 테스트를 구축했습니다.
그들이 어떻게 이를 수행했는지 간단히 설명해 드리겠습니다:
1. 문제: "유창한 거짓말쟁이"
로봇의 정직성을 검증하는 대부분의 테스트는 영어만 확인합니다. 이는 한 도시에서만 운전 면허 시험을 보고 나머지 모든 지역에서 안전하게 운전할 수 있다고 가정하는 것과 같습니다. 연구진들은 다음과 같은 궁금증을 가졌습니다: 로봇이 잘 모르는 언어로 말할 때 거짓말을 더 자주 할까요?
그들은 "환각"을 **충실도 (faithfulness)**로 구체적으로 정의했습니다. 즉, 로봇이 당신이 들려준 이야기에 충실했을까요?
- 좋은 로봇: 고양이에 대한 이야기를 읽은 후, "고양이는 주황색이다"라고 말합니다.
- 환각을 일으키는 로봇: 고양이에 대한 이야기를 읽은 후, "사실 그 고양이는 용입니다"라고 말합니다. (그럴듯하게 들리지만, 이야기에는 없습니다.)
2. 해결책: "가짜 뉴스" 공장 건설
연구진들은 거짓말 탐지기를 가르치기 위해 로봇이 거짓말을 한 방대한 예제 더미가 필요했습니다. 하지만 로봇이 자연스럽게 거짓말을 하기를 기다리길 원하지 않았습니다. 그건 너무 오래 걸리기 때문입니다.
그래서 그들은 합성 공장을 구축했습니다:
- 306 개 언어를 아우르는 실제 질문과 답변의 거대한 데이터셋 (MultiWikiQA) 을 가져왔습니다.
- 정답을 사실적으로 들리게 하지만 원본 텍스트에 기반한 사실과 다르게 고의로 다시 쓰도록 초지능 AI(GPT-5) 를 사용했습니다.
- 이를 306 개 언어로 수행하여 거대한 "가짜 답변" 라이브러리를 만들었습니다.
- 그런 다음, 이러한 거짓말을 찾아낼 수 있도록 더 작고 전문화된 AI("토큰 수준 분류기") 를 훈련시켰습니다. 이 분류기를 진실을 위한 맞춤법 검사기라고 생각하세요. 단어가 올바르게 철자되었는지 확인하는 대신, 문장의 특정 단어가 원래 이야기에 속하는지 아니면 지어낸 발명품인지 확인합니다.
이들 "진실 맞춤법 검사기"를 30 개 유럽 언어로 훈련시키고 영어, 독일어, 덴마크어, 아이슬란드어 네 가지 언어로 테스트했습니다.
3. 실험: 로봇 테스트
연구진들은 다섯 가지 다른 AI 모델 (작은 것부터 거대한 것까지) 을 가져와 해당 네 가지 언어로 질문에 답하게 한 후, 답변을 새로운 "진실 맞춤법 검사기"에 통과시켜 텍스트에 숨겨진 거짓말이 얼마나 많은지 확인했습니다.
4. 결과: 크기가 중요하지만, 언어가 더 중요합니다
다음은 그들이 발견한 바를 몇 가지 간단한 비유로 설명한 것입니다:
- "작은 로봇"의 고군분투: 가장 작은 AI 모델 (Qwen3-0.6B) 이 가장 나쁜 거짓말쟁이였습니다. 이는 충분히 공부하지 않고 그냥 추측한 학생과 같았습니다. 아이슬란드어에서는 **답변의 60%**가 적어도 하나의 거짓말을 포함하고 있었습니다.
- "큰 로봇"은 더 낫습니다: 더 크고 강력한 모델들 (700 억 파라미터 모델 등) 은 사실에 충실하는 데 훨씬 더 능했습니다. 그들은 그룹 내 "우등생"이었습니다.
- "언어 격차": 이것이 가장 중요한 발견입니다. 로봇들은 자신이 덜 아는 언어에서 훨씬 더 자주 거짓말을 했습니다.
- 영어와 독일어(로봇이 매우 잘 아는 언어): 거짓말이 매우 적었습니다.
- 덴마크어와 아이슬란드어(로봇이 덜 아는 언어): 거짓말이 훨씬 더 많았습니다.
- 아이슬란드어가 가장 어려웠습니다. 최고의 로봇조차도 영어보다 이곳에서 더 많이 거짓말을 했습니다. 이는 셰프가 본 적 없는 요리를 만들도록 요청하는 것과 같습니다. 그들은 재료를 잘못 추측할 가능성이 더 높습니다.
5. 놀라운 반전
"로봇이 클수록 거짓말을 덜 한다"고 생각할 수 있습니다. 하지만 그렇게 단순하지 않습니다. 때로는 언어에 따라 중간 크기의 로봇이 거대한 로봇보다 더 나을 수도 있습니다. 이는 로봇이 어떻게 훈련되었는지 (어떤 언어를 공부했는지) 가 로봇이 얼마나 큰지만큼이나 중요함을 시사합니다.
6. 함정 ("토큰" 문제)
연구진들은 또한 기술적인 기이함을 지적했습니다. 아이슬란드어와 같은 언어에서는 컴퓨터가 단어를 이해하기 위해 단어를 많은 작은 조각 (토큰) 으로 나눕니다. 영어에서는 하나의 단어를 하나의 조각으로 볼 수 있지만, 아이슬란드어에서는 같은 단어가 다섯 조각일 수 있습니다.
- 비유: 문장의 오류를 검사한다고 상상해 보세요. 단어별로 검사하면 1 개의 오류를 찾을 수 있지만, 글자별로 검사하면 단어가 더 길기 때문에 같은 이유로 5 개의 오류를 찾을 수 있습니다.
- 연구진들은 아이슬란드어에 대한 "거짓말 수"가 부분적으로는 단어가 더 많은 조각으로 잘려서 탐지기가 거짓말을 찾을 기회가 더 많기 때문에 더 높게 보일 수 있다고 경고합니다. 비록 의미가 동일하더라도요.
요약
이 논문은 306 개 언어에서 AI 모델이 사실을 지어낼 때 이를 탐지할 수 있는 새로운 오픈 소스 도구를 소개합니다. 그들은 더 큰 모델이 일반적으로 더 정직하지만, 로봇은 아이슬란드어와 같이 덜 익숙한 언어에서 환각을 일으킬 가능성이 훨씬 더 높다는 사실을 발견했습니다. 그들은 누구나 사용할 수 있도록 "가짜 뉴스" 데이터셋과 "진실 탐지기"를 공개했습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.