← 최신 논문
💬 NLP

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

이 논문은 MirageBench를 도입하여 개인화된 LLM이 만연한 과잉 추론을 통해 사용자 속성을 보편적으로 조작한다는 사실을 밝히며, 이러한 현상은 자기 모니터링 메커니즘이 감지하지 못할 뿐만 아니라 실제 오류율과 역상관 관계를 갖는 경우가 많음을 보여줌으로써 모델의 자기 평가보다 외부 검증이 필수적임을 입증한다.

원저자: Yushi Sun, Yanjie Zhang, Rui Sheng

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Yushi Sun, Yanjie Zhang, Rui Sheng

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

기억의 함정: AI가 지나치게 창의적이 될 때

당신이 당신이 말한 모든 것을 기억하는 매우 똑똑한 디지털 비서와 대화하고 있다고 상상해 보세요. 이것은 단순한 메모장이 아닙니다. 당신을 '알아가는' 데 설계된 "개인화된" AI입니다. 컴퓨터 과학에서는 이를 대규모 언어 모델(LLM) 개인화라고 부릅니다. 이 모델들을 당신과 대화할 수 있는 믿을 수 없을 정도로 빠른 독서가라고 생각해보세요. 하지만 이들에게는 까다로운 습관이 하나 있습니다. 바로 당신의 인생 이야기에서 빈칸을 아주 자신만만하게 들리지만 실제로는 지어낸 추측들로 채워 넣곤 한다는 점입니다.

문제를 이해하려면 두 가지를 알아야 합니다. 첫째, **지속적 기억(persistent memory)**은 지난주에 당신이 가장 좋아하는 피자 토핑이 무엇이었는지 기억하는 것처럼, AI가 서로 다른 대화 전반에 걸쳐 당신에 대한 사실을 기억하는 능력입니다. 둘둘째, **환각(hallucination)**은 AI가 세상에 대한 사실(예: 달이 치즈로 만들어졌다고 말하는 것 등)을 지어내는 현상입니다. 하지만 여기에는 세 번째의 더 교활한 문제가 있습니다: 바로 **과잉 추론(over-inference)**입니다. 이것은 AI가 당신이 준 아주 작은 진실을 가져다가, 당신이 언급한 적도 없는 완전히 새로운 성격 특성으로 확장해 버리는 것을 말합니다. 이는 마치 친구에게 커피를 좋아한다고 말했더니, 그 친구가 즉시 당신을 커피 향이 나는 로프트에서 살며 카페를 차리는 꿈을 꾸는 바리스타라고 모두에게 떠벌리는 것과 같습니다. 그 친구가 커피에 대해 거짓말을 하는 것은 아니지만, 그것을 바탕으로 한 전체 삶을 발명해 낸 것입니다. 우리가 이것을 신경 쓰는 이유는, 우리의 디지털 비서가 우리의 삶을 발명하기 시작한다면, 존재하지 않는 사람을 바탕으로 우리에게 조언을 하기 시작할 수도 있기 때문입니다.

신기루: AI가 당신의 삶을 꿈꿀 때

한 연구팀이 이 "개인화된" AI 비서들을 테스트해 보기로 했습니다. 그들은 MirageBench(사막의 가짜 오아시스를 뜻하는 '신기루'는 이 상황에 완벽한 이름입니다)라는 놀이터를 만들었습니다. 그들은 12개의 서로 다른 AI 모델에게 간단한 과제를 주었습니다: 단 세 가지 사실만을 근거로 어떤 인물을 알고 있는 척하라. 그런 다음, AI에게 데이팅 프로필 작성, 주말 여행 제안, 또는 그 사람의 아파트 묘사하기와 같은 일을 시켰습니다.

결과는 마치 자신의 기술에 너무 자신감이 넘친 마술사를 보는 것 같았습니다. 연구진은 테스트한 모든 모델이 "과잉 추론"의 죄를 범하고 있다는 것을 발견했습니다. 평균적으로, 이 AI들이 사용자에 대해 알고 있다고 주장한 내용의 약 **41.6%**는 완전히 지어낸 것이었습니다. 즉, 만약 AI가 당신에 대해 10가지를 알고 있다고 말한다면, 그중 약 4가지는 순수한 허구이며, AI는 이를 매우 확신에 찬 태도로 말한다는 뜻입니다.

연구는 이 지어낸 주장들을 두 가지 범주로 나누었습니다: 고정관념(예: 간호사니까 요가를 좋아할 것이라고 추측함)과 날조(Fabrications)(예: 언급한 적도 없는데 반려동물로 이구아나를 키운다고 지어냄)입니다. AI는 고정관 스타일에 의존하는 것보다 생생한 이야기를 지어내는 것(날조)에 훨씬 더 능숙했습니다. 실제로 누군가의 아파트를 묘사하는 것과 같이 상상력이 필요한 작업의 경우, "가짜" 비율은 거의 **59%**까지 치솟았습니다. AI가 증거를 적게 가질수록, 더 자유롭게 세부 사항을 꿈꾸기 시작하는 것으로 보입니다.

거대한 자신감의 속임수

이 이야기에서 가장 놀라운 부분은 연구진이 **"자기 모니터링 역전(Self-Monitoring Inversion)"**이라고 부르는 현상입니다.

보통 우리는 AI가 "잘 모르겠습니다"라고 말하면 정직한 것이고, "100% 확신합니다"라고 말하면 자신감이 있는 것이라고 생각합니다. 하지만 연구진은 서로 다른 AI 모델을 비교했을 때 복잡한 패턴을 발견했습니다. 자신이 무언가를 지어낼 가능성이 가장 낮다고 주장하는 모델들이 실제로는 가장 많은 것을 지어내고 있었습니다. 반대로, "이봐요, 제가 지금 추측하고 있을지도 몰라요"라고 인정하는 모델들이 종종 진실에 가장 가까웠습니다.

이는 마치 수업 시간에서 "제가 틀렸을 수도 있습니다"라고 손을 드는 학생들은 실제로 공부를 가장 많이 한 학생이고, "정답을 알고 있어요!"라고 외치는 학생들은 엉뚱하게 추측하고 있는 것과 같습니다. 연구진은 모델의 자기 보고된 자신감과 실제 정확도 사이에 부정적인 상관관계가 있음을 발견했지만, 이는 넓은 신뢰 구간을 포함하며 효과가 없을 가능성도 있는 탐색적 발견이라는 점을 명시했습니다. 즉, 모델들을 비교할 때 단순히 AI에게 "너 지금 지어내고 있니?"라고 묻고 그 대답을 믿어서는 안 된다는 뜻입니다. 가장 정직해 보이는 모델이 가장 큰 거짓말쟁이일 수 있지만, 데이터에 따르면 이 관계는 여전히 완전히 이해되고 있는 과정에 있습니다.

침묵의 오염

연구진은 또한 AI가 사용자와 8라운드 동안 대화를 나누는 시뮬레이션을 실행했습니다. 그들은 사용자가 AI의 실수를 바로잡았을 때 AI가 실수를 "청소"하는지 관찰했습니다. 결과는 우려스러웠지만, 반전이 있었습니다: 모든 모델이 똑같이 행동하지는 않았습니다.

가장 똑똑하고 유능한 모델들의 경우, AI는 단순히 실수를 하는 데 그치지 않고, 실수를 축적했습니다. AI가 추측을 적어 놓은 화이트보드를 상상해 보세요. 만약 사용자가 "사실 저는 그걸 좋아하지 않아요"라고 말한다면, 좋은 시스템은 그 추측을 지워야 합니다. 하지만 이 상위 모델들은 어땠을까요? 그들은 그 추측을 보드 위에 그대로 둔 채 그 위에 더 많은 추측을 덧붙였습니다. 그들은 매 라운드마다 약 5개에서 15개의 새로운 지어낸 사실을 추가했으며, 기존의 것을 거의 지우지 않았습니다(제거율은 0.4%에서 5%로 매우 낮았습니다).

하지만 이것이 모든 모델에 해당되는 것은 아니었습니다. 일부 모델은 새로운 정보가 들어올 때 오래된 추측을 적극적으로 제거하는 "교체 및 업데이트" 시스템처럼 행동했습니다. 이들의 제거율은 **70%에서 82%**에 달했습니다. 위험은 특히 가장 유능한 축적자 모델들에게서 나타나는데, 이들의 기억은 결코 수정되지 않은 120개 이상의 지어낸 사실들로 엉망이 된 채 부풀려졌습니다. 이는 마치 소문이 사람에서 사람으로 전달될 때마다 점점 더 상세해지고 틀려지지만, 아무도 "잠깐, 그건 사실이 아니야"라고 말하지 않는 것과 같습니다.

시사점

이 논문의 핵심 교훈은 우리가 AI가 자신의 상상력을 스스로 감시할 것이라고 믿어서는 안 된다는 것입니다. AI가 자신의 생각을 보고 "이것은 사실이다" 또는 "이것은 추측이다"라고 말할 수 있다는 생각은 신기루입니다. 가장 신중해 보이는 모델이 종-종 가장 기만적이며, 불확실성을 인정하는 모델이 종종 더 신뢰할 만합니다. 다만 이 관계의 정확한 강도는 모델에 따라 여전히 탐구되고 있습니다.

연구진은 AI의 자기 보고를 믿는 대신, 인간이나 다른 시스템이 AI의 작업을 검증할 수 있는 **외부 검증(external verification)**이 필요하다고 제안합니다. 또한 우리는 AI가 "추측"하는 모든 것을 사실이 아닌 하나의 가설로 취급해야 합니다. 우리가 무엇을 알고 있는지와 무엇을 상상하고 있는지를 명확히 구분할 수 있는 시스템을 구축하기 전까지, 우리의 개인화된 디지털 비서는 확신에 찬 거짓말을 통해 우리의 가짜 버전을 만들어내고 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →