← 최신 논문
💻 computer science

Hallucinations in AI Chatbots: A Comparative Analysis

이 논문은 문헌 검토와 설문 조사를 통해 GPT-4, Gemini, Claude, Copilot과 같은 저명한 AI 챗봇의 환각 현상을 조사하며, 학술적 맥락에서 허위 정보를 생성하고 인용 오류를 범하는 이들의 경향을 강조하는 동시에 수동 검토 및 사실 확인과 같은 완화 전략을 제안한다.

원저자: Hamna Waseem, Syed Muhammad Shahzim, Syed Azam Ali, Muhammad Bilal Khan

게시일 2026-09-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hamna Waseem, Syed Muhammad Shahzim, Syed Azam Ali, Muhammad Bilal Khan

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

지난 몇 년 동안, 새로운 종류의 컴퓨터 프로그램이 글쓰기, 코딩, 정보 검색을 위한 흔한 도구가 되었습니다. 대규모 언어 모델(large language models)로 알려진 이 프로그램들은 인터넷의 방대한 텍스트를 학습합니다. 이들은 문장에서 다음에 올 단어가 무엇인지 예측하도록 설계되어, 질문에 대해 인간과 유사한 응답을 생성할 수 있습니다. 이들은 매우 유용하지만, 기묘한 결함이 하나 있습니다. 때때로 완전히 틀린 사실을 아주 자신만만하게 말한다는 점입니다. 연구자들은 이러한 오류를 "환각(hallucinations)"이라고 부릅니다. 환각은 실제 사실, 책의 진짜 인용구, 또는 작동하는 코드 한 줄처럼 보일 수 있지만, 실제로는 꾸며낸 것입니다. 이는 단순한 작은 오류가 아닙니다. 이 프로그램들이 학업, 의료 조언, 또는 전문적인 연구에 사용될 때, 지어낸 사실은 실제 세상의 혼란이나 위험으로 이어질 수 있습니다. 과학자들과 사용자 모두가 직면한 질문은 이러한 오류가 발생하는지 여부가 아니라, 얼마나 자주 발생하는지, 어떤 프로그램이 이러한 오류에 더 취약한지, 그리고 사람들이 문제를 일으키기 전에 어떻게 이를 발견할 수 있는지입니다.

우스만 기술 연구소(Usman Institute of Technology)의 연구팀은 오늘날 가장 인기 있는 네 가지 AI 챗봇인 GPT-4, Gemini, Claude, Microsoft Copilot을 조사함으로써 이 문제를 이해하고자 했습니다. 연구진은 단순히 실험실에서 기계를 테스트하는 대신, 80명의 실제 사용자에게 그들의 현실 세계 경험에 대해 물었습니다. 그들은 사용자들이 얼마나 자주 잘못된 정보를 접하는지, 어떻게 그 오류를 알아차리는지, 그리고 그것을 해결하기 위해 무엇을 하는지 알고 싶어 했습니다. 연구는 학술 논문 작성, 컴퓨터 코드 작성, 연구 수행과 같이 높은 정확도를 요구하는 작업에 초점을 맞췄습니다. 목표는 기술적 벤치마크를 넘어, 이 도구들이 중요한 업무를 수행하는 일반 사람들의 손에서 어떻게 작동하는지 살펴보는 것이었습니다.

설문 조사 결과, 가장 진보된 시스템에서도 환각은 지속적인 문제임이 드러났습니다. 설문에 참여한 대부분의 사람들은 이 AI 도구들을 매일 또는 하루에 여러 번 사용한다고 답했습니다. 그들은 코딩, 연구, 글쓰기를 위해 이 도구들에 의존합니다. 그러나 대다수는 또한 가짜 정보나 가짜 참조를 빈번하게 접한다고 보고했습니다. 연구진은 이러한 오류가 무작위로 발생하는 것이 아니라, 대화가 길어질수록 더 자주 나타난다는 것을 발견했습니다. 사용자가 봇과 5회에서 20회 사이의 메시지를 주고받고 나면, 프로그램이 실수를 하여 일관성이 없거나 틀린 세부 정보를 제공할 가능성이 높아집니다. 이는 기계와 더 오래 대화할수록, 기계가 진실에 대한 통제력을 잃을 가능성이 높다는 것을 시사합니다.

사용자들이 무언가 잘못되었다는 것을 깨달았을 때, 그들은 컴퓨터가 알려주기를 기다리지 않았습니다. 대신, 그들은 자신의 지식을 활용했습니다. 사람들이 환각을 발견하는 가장 흔한 방법은 AI의 답변이 자신이 이미 사실이라고 알고 있는 것과 모순될 때였습니다. 또 다른 주요한 적신호는 가짜 인용의 존재였습니다. 만약 프로그램이 찾을 수 없거나 존재하지 않는 책, 연구, 또는 웹사이트를 나열한다면, 사용자들은 즉시 그 정보가 조작되었음을 알았습니다. 연구는 이러한 오류를 탐지하는 것이 여전히 주로 인간의 몫임을 보여주었습니다. 그것은 소프트웨어 자체에 내장된 자동 안전 장치보다는, 사실을 검증하는 사용자의 능력과 기계에 의문을 제기하려는 의지에 달려 있습니다.

연구진은 또한 네 가지 챗봇을 비교하여 어떤 것이 더 안전하거나 신뢰할 수 있는지 확인했습니다. 그들은 각 시스템이 고유한 강점과 약점을 가지고 있다는 것을 발견했습니다. GPT-4는 복잡한 문제를 추론하는 능력으로 찬사를 받았으며, Gemini는 검색 결과로부터 정보를 가져오는 강력한 능력이 주목받았는데, 이는 답변이 현실에 근거하도록 돕습니다. Claude는 특히 건강과 같은 민감한 분야에서 높은 정확도를 보이며 안전과 정직성에 집중하는 점이 돋보였습니다. Microsoft Copilot은 다른 소프트웨어 도구들과의 긴밀한 통합으로 인해 생산성에 유용하다는 인정을 받았습니다. 그러나 네 가지 모델 중 완벽한 것은 없었습니다. 모든 모델이 여전히 때때로 가짜 인용과 신뢰할 수 없는 코드를 만들어냈습니다. 연구는 이 도구들이 강력하지만, 특히 의학이나 학술 연구와 같은 이해관계가 걸린 분야에서는 인간의 감독 없이 사용하기에는 아직 충분히 신뢰할 수 없다고 결론지었습니다.

그렇다면 이를 해결하기 위해 무엇을 할 수 있을까요? 설문 참가자들은 명확한 답을 제시했습니다. 그들은 해결책이 단지 AI를 더 똑똑하게 만드는 데만 있다고 믿지 않았습니다. 대신, 그들은 가장 효과적인 방법은 AI가 자신의 작업 과정을 보여주도록 요구하는 것이라고 말했습니다. 사용자들은 검증된 인용을 포함하는 응답을 압도적으로 선호했는데, 이는 프로그램이 주장하는 모든 사실에 대해 실제 존재하는 출처를 반드시 제시해야 함을 의미합니다. 인간의 검토가 두 번째로 인기 있는 해결책이었으며, 자동 사실 확인 시스템이 그 뒤를 이었습니다. 이 도구들을 사용하는 사람들은 투명성을 원합니다. 그들은 정보가 어디에서 왔는지 보고 스스로 확인할 수 있기를 원합니다. 연구진은 향-후 개선 사항이 단순히 더 많은 텍스트를 생성하는 것이 아니라, AI가 자신의 출처를 설명하고 불확실할 때 이를 인정하도록 만드는 데 집중해야 한다고 제안합니다.

궁극적으로, 이 연구는 현재 인공지능의 상태에 대한 중요한 현실을 강조합니다. 이 도구들은 더욱 정교해지고 있으며 더 복잡한 작업에 사용되고 있지만, 무언가를 지어내는 문제는 사라지지 않았습니다. 연구진은 사용자들이 위험을 인지하고 있으며, 사실을 재확인하고 증거를 요구함으로써 이에 능동적으로 대처하고 있다는 것을 발견했습니다. 이 시스템들이 특히 의료나 교육과 같은 중요한 분야에서 진정으로 신뢰할 수 있게 되려면, 답변에 대해 명확하고 검증 가능한 출처를 제공하도록 진화해야 합니다. 그때까지 정확성에 대한 책임은 AI가 최종 권위자가 아닌 유용한 보조자 역할을 하는 동안에도 여전히 인간의 손에 남아 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →