Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations
이 논문은 인증된 종교 텍스트를 바탕으로 인용과 함께 질문에 엄격히 답변함으로써 사실적 왜곡과 가치 불일치를 완화하는, 배포된 검색 기반 이슬람 AI 어시스턴트인 Ansari를 소개하며, 이는 이슬람 벤치마크에서 우수한 성능을 입증하고 신앙에 민감한 LLM 배포를 위한 중요한 교훈을 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 사회에서 사람들은 복잡한 아이디어를 설명하거나 문제를 해결하고, 혹은 조언을 구하기 위해 인공지능에 의지하며 기계에게 답을 찾곤 합니다. 대규모 언어 모델이라고 알려진 이 시스템들은 인터넷의 방대한 텍스트 데이터를 학습하여 문장에서 다음에 올 단어가 무엇인지 예측하는 법을 배웁니다. 이들은 놀라울 정도로 유창하며 매우 설득력 있게 들릴 수 있습니다. 그러나 이러한 유창함에는 숨겨진 위험이 따릅니다. 바로 사실을 지어내는 경향입니다. 기계가 답을 모를 때, 스스로 확신을 가지고 이야기를 만들어내어 실제로는 완전히 거짓이지만 마치 사실인 것처럼 들리는 이야기를 창조할 수 있습니다. 이는 의학이나 법률처럼 정확성이 매우 중요한 분야에서 심각한 문제가 되지만, 종교적 신념의 영역에서는 더욱 섬세한 문제가 됩니다. 수백만 명의 무슬림에게 꾸란과 예언자 무함마드의 언행록(하디스) 같은 종교 텍스트는 신성하며 변하지 않는 것으로 간-주됩니다. 단 하나의 지어낸 구절이나 잘못 인용된 언행은 한 사람이 신앙생활을 잘못하게 하여 영적인 해를 끼칠 수 있습니다. 따라서 과제는 인간의 대화처럼 편안하게 말하면서도, 출처 없이는 결코 말하지 않는 절제력을 갖춘 기계를 구축하는 것입니다.
한 연구팀은 바로 이 문제를 해결하기 위해 '안사리(Ansari)'라고 불리는 시스템을 구축했습니다. 그 이름은 메디나 시에서 예언자 무함마드를 도왔던 조력자들을 뜻하는 역사적 용어에서 유래되었으며, 이는 공동체를 돕는 도구가 되고자 하는 시스템의 목표를 반영합니다. 2023년 6월 이후, 이 어시스턴트는 25개 이상의 다양한 언어를 사용하는 사람들과 14만 건 이상의 대화를 나누었습니다. 내부 기억에 의존하여 답변을 생성하는 일반적인 챗봇과 달리, 안사리는 엄격한 규칙에 따라 작동합니다. 즉, 신뢰할 수 있는 서적에서 먼저 찾아내지 못한다면 아무것도 말할 수 없다는 규칙입니다. 이 시스템은 성실한 연구자처럼 작동합니다. 사용자가 질문을 하면, 컴퓨터는 즉시 답변을 작성하려고 시도하는 대신, 먼저 꾸란, 종교적 언행록, 그리고 이슬람 법에 관한 상세한 백과사전이 포함된 인증된 디지털 라이브러리를 검색하는 특수 도구들을 사용합니다. 시스템은 검색 결과를 읽고, 그 찾아낸 텍스트만을 바탕으로 답변을 구성하며, 사용자가 출처를 확인할 수 있도록 구체적인 참조를 첨부합니다. 이 과정은 기계가 종교적 규칙이나 신성한 이야기를 지어낼 수 없도록 보장하며, 오직 주어진 신뢰할 수 있는 출처에 이미 기록된 내용만을 보고할 수 있게 합니다.
연구진은 사람들이 이 도구를 단순한 사실 확인 이상의 용도로 사용한다는 것을 발견했습니다. 10,000건의 대화 중 무작위 표본을 분석한 결과, 가장 흔한 요청은 역사나 신학을 배우는 것이 아니라 일상생활을 어떻게 살아가야 하는지에 관한 것이라는 점을 발견했습니다. 거의 40%의 질문은 특정 음식이 허용되는지, 단식 중에 특정 의료 상황을 어떻게 다루어야 하는지, 혹은 현대 생활의 윤리적 딜레마를 어떻게 헤쳐 나가야 하는지와 같은 실질적인 문제들에 관한 것이었습니다. 또 다른 상당 부분의 질문은 슬픔, 불안, 또는 가족의 위기 상황에서 도움을 구하는 사람들에게서 나왔습니다. 시스템은 이러한 고통의 순간을 인식하고 따뜻하게 반응하도록 설계되었으며, 사용자에게 지역 사회 지도자와 상담할 것을 권고하고 도움을 받을 수 있는 핫라인을 제공합니다. 또한 연구는 종교 지도자와 교사들이 이 어시스턴트를 단순한 검색 엔진이 아닌, 콘텐츠 초안을 작성하는 파트너로서 활용하여 설교와 수업 계획을 준비하는 데 자주 사용한다는 사실을 밝혀냈습니다.
시스템이 제대로 작동하는지 확인하기 위해 연구팀은 몇 가지 엄격한 기준을 통해 테스트를 진행했습니다. 그들은 이 어시스턴트를 이슬람 법과 종교 텍스트에 대한 지식을 측정하는 독립적인 시험에 투입했으며, 여기서 안사리는 시중에 공개된 다른 선도적인 인공지능 모델들보다 더 나은 성과를 보였습니다. 기계가 단순히 예의를 차리기 위해 틀린 주장에 동조하는지를 확인하기 위해 설계된 특정 테스트에서, 안사리는 오류에 이의를 제기하는 데 96% 이상의 성공률을 보인 반면, 다른 모델들은 흔히 실수에 동조하는 함정에 빠졌습니다. 라마단 기간 동안 실시된 인간 평가에서, 이 어시스턴트는 높은 정확도로 질문에 답했으며, 무엇보다도 테스트된 표본 내에서 단 하나의 거짓 출처도 지어내지 않았습니다. 연구진은 시스템이 매우 효과적이긴 하지만 완벽하지는 않다는 점에 주목했습니다. 때때로 명확한 답을 찾지 못한 채 정보를 계속 검색하는 루프에 빠지기도 하며, 날짜나 시간 민감한 사실에 대해 가끔 실수를 저지르기도 합니다. 이러한 오류는 이 시스템이 인간의 이해를 돕기 위한 도구이지, 자격을 갖춘 학자의 판단이나 공동체의 지혜를 대체하는 것이 아님을 상기시켜 줍니다.
이 프로젝트는 깊은 가치관이나 민감한 주제를 다루는 인공지능을 구축하려는 모든 이들에게 명확한 교훈을 줍니다. 연구진은 단순히 더 많은 데이터로 기계를 학습시키는 것만으로는 충분하지 않다고 주장합니다. 대신, 기계를 규정하는 규칙은 명시적으로 작성되어야 하며 검토가 가능하도록 공개되어야 합니다. 안사리의 경우, 서로 다른 학파 간의 이견을 처리하는 방법, 출처를 인용하는 방법, 그리고 위기 상황에서 행동하는 방법에 대한 지침은 누구나 읽을 수 있는 문서에 저장되어 있습니다. 이러한 투명성은 시스템 프롬프트를 숨겨진 기술적 설정이 아닌 공공의 정책 선언으로 바꿉니다. 또한 연구팀은 답변을 실제 텍스트에 근거하게 만드는 것이 기계가 허구의 내용을 만드는 것은 방지해주지만, 모든 문제를 해결해주지는 않는다는 점을 발견했습니다. 근본적인 컴퓨터 모델은 여전히 원래 학습되었던 데이터의 편향성과 한계를 지니고 있는데, 그 데이터는 현재 서비스를 제공하는 종교 공동체에 의해 만들어진 것이 아니기 때문입니다. 이러한 격차는 시스템이 수 세기 동안 전통을 정교하게 다듬어 온 인간 공동체를 결코 완전히 대체할 수 없음을 의미합니다. 궁극적으로 안사리의 성공은, 설계 단계에서 속도와 편의성보다 진실과 책임감을 우선시한다면, 출처의 신성함을 존중하면서 도움을 줄 수 있는 종교적 어시스턴트를 구축하는 것이 가능하다는 것을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.