← 최신 논문
💬 NLP

Epistemic Familiarity is Associated With Belief Stability in Large Language Models

이 논문은 대규모 언어 모델이 생소한 합성 문장을 처리할 때보다 익숙한 허구적 문장을 처리할 때 더 높은 신념 안정성을 보인다는 것을 입증하는 P-StaT 프레임워크를 소개하며, 인식적 친숙함이 의미론적으로 유발된 신념 불안정성을 완화하는 핵심 요인임을 밝힌다.

원저자: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

게시일 2026-07-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samantha Dies, Courtney Maynard, Germans Savcisens, Tina Eliassi-Rad

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 똑똑한 로봇에게 사실, 거짓, 그리고 지어낸 이야기를 구별하는 법을 가르치고 있다고 상상해 보세요. 당신은 로봇이 '진실'의 규칙을 배우고 나면, 질문을 어떻게 하든 그 규칙을 고수할 것이라고 생각할지도 모릅니다. 하지만 챗봇과 검색 도구의 뒤에 있는 강력한 AI 두뇌인 대규모 언어 모델(LLM)의 세계에서는 상황이 조금 더 불안정합니다. 이 모델들은 인터넷에 있는 거의 모든 것을 읽은 거대한 도서관과 같지만, 인간처럼 무언가를 '아는' 것이 아니라 다음에 올 단어를 패턴에 따라 예측하는 것입니다. 과학자들에게 핵심적인 질문은, 맥락이나 질문의 방식이 약간 바뀔 때 로봇의 사실에 대한 믿음이 견고하게 유지되는지, 아니면 흔들리고 무너지는지입니다. 이것이 바로 '인식적 안정성(epistemic stability)'에 관한 연구입니다. 만약 로봇이 오늘날 어떤 도시가 존재한다고 믿고 있다가, 단지 근처에서 언급된 허구의 이야기 때문에 마음을 바꾼다면 그것은 문제입니다. 우리는 이 모델들이 점점 더 정보를 제공하는 데 사용되고 있기 때문에 이 연구를 중요하게 생각하며, 그들의 믿음이 바위처럼 단단한지, 아니면 약간의 혼란에도 쉽게 흔들리는지 알아야 합니다.

여기 새미사 다이스(Samantha Dies)와 그녀의 팀이 로봇의 세계를 흔들어 무엇이 튀어나오는지 확인하기로 결심한 새로운 연구가 있습니다. 그들은 P-StaT(진실의 섭동 안정성, Perturbation Stability of Truth를 의미함)라는 프레임워크를 구축했습니다. P-StaT를 '믿음의 스트레스 테스트'라고 생각하세요. 연구진은 21개의 서로 다른 AI 모델을 가져와 그들에게 판단을 내릴 문장들을 주었습니다. 어떤 문장들은 실제 사실(예: "수라트는 인도에 있다")이었고, 어떤 것들은 명백한 거짓이었으며, 까다로운 부분은 '둘 다 아닌(Neither)' 문장들, 즉 현실 세계에서 참도 거짓도 아닌 주장들이었습니다.

연구팀은 이 '둘 다 아닌' 문장들을 두 진영으로 나누었습니다. 첫 번째 진영은 친숙한 허구(Familiar Fictional) 문장들입니다. 이것들은 동화책이나 영화에 등장할 법한 만들어진 것들로, 예를 들어 "비키니 시티는 태평양에 있다"와 같은 것입니다. 비키니 시티가 실재하지 않더라도, AI는 아마도 학습 데이터에서 이를 보았을 것입니다. 왜냐하면 그것은 인기 있는 만화이기 때문입니다. 두 번째 진영은 생소한 합성(Unfamiliar Synthetic) 문장들입니다. 이것들은 AI가 이전에 본 적이 없을 법한 완전히 새롭고 이상한 단어들의 조합으로, 예를 들어 "유스타포르 시는 오클라니아에 있다"와 같은 것입니다. 이것들은 모델에게 완전히 낯선 것들로 설계되었습니다.

연구진은 "만약"이라는 게임을 수행했습니다. 그들은 AI에게 "좋아, 이 만들어진 것들이 실제로 사실이라고 가정해 봐"라고 말하고, AI가 갑자기 실제 사실에 대해 의구심을 갖기 시작하는지 지켜보았습니다. 이것은 마치 사람에게 "용이 진짜라고 상상해 봐"라고 말한 뒤, "그래서, 하늘은 파란색이야?"라고 묻는 것과 같습니다. 만약 그 사람이 "잘 모르겠어, 용 때문에 하늘이 초록색일지도 몰라"라고 말한다면, 그 사람의 믿음 체계는 불안정한 것입니다.

결과는 매우 흥anche했습니다. AI가 생소한 합성 문장들(완전히 새롭고 이상한 것들)에 노출되었을 때, AI는 매우 불안정해졌습니다. 행동 테스트(AI가 단순히 대화를 나누는 상황)에서, 모델들은 실제 사실에 대한 믿음을 **50%**보다 더 많이 철회했습니다. 그것은 동전 던지기와 같습니다! 동전을 100번 던지면 약 50번의 앞면이 나올 것으로 기대하지만, 여기서는 AI가 완전히 새로운 것에 의해 혼란스러워졌다는 이유만으로 실제 사실에 대한 확신을 절반 이상의 확률로 잃었습니다.

하지만 AI가 친숙한 허구 문장들(만화 도시나 영화 속 괴물들)에 노출되었을 때는 훨씬 더 차분함을 유지했습니다. AI는 비키니 시티가 만화라는 것을 알고 있었기에, 그 생각이 실제 도시에 대한 자신의 지식을 망치도록 내버려 두지 않았습니다. 이 연구는 AI의 불안정성이 단순히 단어가 이상해서가 아니라, 맥락이 얼마나 생소한가에 달려 있음을 시사합니다. 모델들은 자신이 이전에 보았던 것들에 대한 '안전 지대'를 가지고 있으며, 미지의 영역으로 밀려날 때 진실에 대한 움켜쥠이 느슨해집니다.

연구진은 또한 AI가 혼란에 빠졌을 때 어떤 종류의 사실을 가장 먼저 버리는지를 살펴보았습니다. 그들은 AI가 무작위로 무언가를 잊어버리는 것이 아님을 발견했습니다. AI는 기술적인 의학 용어, 생소한 지리, 또는 약간의 모호함이 있는 진술처럼 이미 약간 흐릿했던 것들에 대한 믿음을 버리는 경향이 있었습니다. 그것은 마치 AI의 믿음 체계가 카드 집과 같습니다. 부드러운 익숙한 허구의 바람이 불면 집은 서 있지만, 생소한 헛소리의 허리케인이 불면 이미 약간 흔들리고 있던 카드(까다롭고 기술적인 것들)가 가장 먼저 쓰러집니다.

요약하자면, 이 논문은 인식적 친숙도(epistemic familiarity)—즉, AI가 주제를 얼마나 잘 알고 있는가—가 AI의 믿음이 얼마나 안정적인지에 대한 매우 중요한 요소임을 시사합니다. 만약 AI가 한 번도 본 적 없는 것에 대해 추론하도록 요구받는다면, 실제로 알고 있는 것에 대해서도 환각을 일으키거나 마음을 바꿀 가능성이 훨씬 높아집니다. 저자들은 AI가 고장 났다고 말하는 것이 아니라, '안정성'이 일반적인 '정확도' 테스트와 함께 AI의 신뢰성을 측정하는 새로운 방법임을 보여주고 있습니다. 결국, 이 디지털 두뇌들에게는 게임의 규칙을 아는 것만큼이나 게임의 사실을 아는 것도 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →