← 최신 논문
💻 computer science

Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks

이 연구는 UzHistQA 데이터셋을 소개하며, 검색 증강 생성이 우즈베크어 역사 질의응답에서 환각 현상을 유의미하게 감소시키지만, 조작된 답변을 완전히 제거하기 위해서는 인용 및 기권 메커니즘을 강제하는 것이 필요함을 입증함으로써, 자원이 부족한 언어에서 검색 품질과 생성 충실도를 별도로 평가해야 할 필요성을 강조한다.

원저자: Ruzimboy Azimjonovich Kholmurotov

게시일 2026-09-23
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruzimboy Azimjonovich Kholmurotov

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 교실에서 학생들은 어려운 개념을 설명하거나, 단원을 요약하거나, 시험을 준비하기 위해 점점 더 인공지능에 의존하고 있습니다. 이러한 디지털 비서들은 방대한 양의 텍스트로 학습되어 유창하고 자신감 있으며, 종종 설득력 있는 답변을 생성할 수 있는 거대 언 언어 모델을 기반으로 구축되었습니다. 그러나 학생이 아직 답을 알지 못하는 질문을 던질 때 뚜렷한 위험이 발생합니다. 즉, 학생은 답변을 검증할 지식이 없다는 점입니다. 만약 시스템이 사실을 지어낸다면, 그 오류는 눈에 띄지 않을 것이며 학생은 잘못된 내용을 배우게 됩니다. 이를 해결하기 위해 연구자들은 검색 증강 생성(retrieval-augmented generation)이라는 방법을 개발했습니다. 모델의 내부 기억에만 의존하는 대신, 시스템은 답변을 하기 전에 먼저 학교 교과서와 같은 신뢰할 수 있는 특정 문서를 검색하여 관련 구절을 찾습니다. 이는 응답을 현실에 근거하게 만들지만, 완벽함을 보장하지는 않습니다. 시스템은 여전히 적절한 구절을 찾는 데 실패할 수도 있고, 적절한 구절을 찾아놓고도 이를 무시하거나, 찾은 내용을 잘못 해석할 수도 있습니다.

이러한 불확실성은 수백만 명이 사용하지만 인공지능 세계에서는 "저자원(low-resource)" 언어로 간주되는 우즈베크어에서 특히 심각합니다. 이 모델들을 학습시키는 데 사용되는 데이터가 지배적인 영어와 달리, 우즈베크어는 사용할 수 있는 디지털 텍스트가 더 적습니다. 게다가 우즈베크어는 교착어로서, 하나의 어근에 다양한 어미가 붙어 매우 다양한 표층형을 만들어낼 수 있습니다. 예를 들어 "독립"에 대해 묻는 학생이 사용하는 단어 형태가 교과서에 사용된 형태와 완전히 다르게 보일 수 있으며, 이로 인해 검색 시스템이 정답을 놓치게 만들 수 있습니다. 지금까지는 이러한 시스템이 우즈베크 역사를 얼마나 잘 수행하는지 테스트하거나, 얼마나 자주 사실을 지어내는지 측정하는 표준적인 방법이 없었습니다.

독립 연구자인 루짐보이 쿨무로토프(Ruzimboy Kholmurotov)의 최근 연구는 1917년부터 1991년까지를 다루는 공식 10학년 역사 교과서를 바탕으로 UzHistQA라는 특정 테스트 세트를 구축함으로써 이 격차를 해결했습니다. 연구자는 교과서를 분석하여 중요한 언어적 장애물을 발견했습니다. 책에 담긴 약 31,000개의 단어 중 절반 이상이 단 한 번만 나타나는 고유한 단어 형태였습니다. 이러한 극단적인 다양성은 단순한 단어 일치 검색으로는 실패할 가능성이 높음을 의미합니다. 이를 극복하는 방법을 테스트하기 위해, 연구는 교과서가 답할 수 없는 질문들을 포함하여 56개의 질문을 만들었고, 이를 통해 시스템이 자신의 무지를 인정할 것인지 아니면 응답을 지어낼 것인지를 확인했습니다. 그런 다음 연구자는 네 가지 다른 방식의 시스템 실행을 비교했습니다. 하나는 오직 내부 기억에만 의존하는 방식, 하나는 표준적인 의미론적 검색을 사용하여 교과서를 검색하는 방식, 하나는 이를 키워드 검색과 결합한 방식, 그리고 마지막은 출처를 반드시 인용하고 근거가 없을 경우 답변을 거부하도록 엄격하게 지시받은 버전입니다.

결과는 극명했습니다. 시스템이 교과서를 보지 않고 오직 내부 기억에만 의존했을 때, 응답의 91퍼센트에서 근거가 없거나 지어낸 주장이 나타났습니다. 교과서가 다루지 않는 질문에 대해서도 날짜, 이름, 목록 등을 자신 있게 꾸며냈습니다. 시스템이 교과서를 먼저 보도록 강제했을 때, 이러한 근거 없는 주장의 비율은 9퍼센트로 급격히 떨어졌습니다. 이는 답변을 실제 텍스트에 근거하게 만드는 것이 신뢰성에 필수적임을 확인시켜 주었습니다. 그러나 연구는 놀라운 복잡성을 드러냈습니다. 의미론적 이해와 키워드 매칭을 결합한 가장 정교한 검색 방법을 사용한 버전이 단순한 검색보다 적절한 구절을 더 자주 찾아냈음에도 불구하고, 이 고급 시스템이 오히려 단순한 시스템보다 더 많은 근거 없는 주장을 생성했습니다. 시스템이 더 크고 다양한 구절을 검색했을 때, 추가된 정보가 모델을 혼란스럽게 하여 사실이 바로 그곳에 있음에도 불구하고 잘못된 추론이나 계산을 하게 만든 것으로 보입니다.

안전성을 위한 가장 효과적인 구성은 엄격한 규칙을 강제하는 것이었습니다. 시스템은 모든 주장에 대해 특정 페이지를 인용해야 했으며, 교과서에 답이 없는 경우 "모릅니다"라고 말하도록 지시받았습니다. 이 접근 방식은 교과서가 답할 수 없는 질문에 대한 모든 조작된 답변을 제거했습니다. 그 대가는 시스템이 답변할 수 있었던 질문의 14퍼센트를 거부했다는 점인데, 때로는 검색된 텍스트 안에 답이 있는 경우에도 그러했습니다. 연구자는 교육 환경에서 이러한 거부는 필요한 기능이라고 결론지었습니다. "모릅니다"라는 답변을 받은 학생은 교사에게 도움을 요청할 수 있지만, 자신만만하게 지어낸 답변을 받은 학생은 거짓을 배우게 되며 그것이 틀렸다는 사실조차 알 방법이 없기 때문입니다. 이 연구는 검색 증강 생성이 우즈베크 교육을 가능하게 만들지만, 시스템이 환각을 일으키는 것을 방지하기 위해 세심한 설계가 필요하며, 적절한 정보를 찾는 것과 올바른 답변을 쓰는 것은 독립적으로 측정되어야 하는 두 가지 별개의 과제임을 강조합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →