← 최신 논문
💬 NLP

Locating and Controlling Implicit Personalization in Large Language Models

이 논문은 거대 언어 모델의 암묵적 인구통계학적 개인화가 식별, 인과적 제어 및 선택적 제거를 통해 편향된 출력을 억제하면서도 일반적인 모델 성능을 유지할 수 있는 국소적 내부 활성화 신호에 의해 발생한다는 것을 입증한다.

원저자: Yueru Yan, Siqi Wu, Thai Le

게시일 2026-08-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yueru Yan, Siqi Wu, Thai Le

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷에 있는 거의 모든 책을 읽은 아주 똑똑한 로봇과 대화하고 있다고 상상해 보세요. 여러분은 이 로봇이 중립적인 판사처럼 모두를 똑같이 대할 것이라고 생각할지도 모릅니다. 하지만 인공지능, 특히 거대언어모델(LLM)의 세계에서 상황은 카멜레온과 조금 더 비슷합니다. 이 모델들은 단순히 질문에 답하는 것에 그치지 않고, 여러분이 대화 중에 흘리는 아주 작고 숨겨진 힌트에 따라 자신의 성격과 추천 방식을 미묘하게 바꿉니다. 이것은 여러분이 로봇에게 "나는 십 대예요"라거나 "나는 특정 문화권 사람이에요"라고 말했기 때문이 아닙니다. 대신, 여러분이 특정 기념일을 언급하거나, 속어를 사용하거나, 취미에 대해 이야기할 수도 있습니다. 로봇은 이러한 '암묵적 단서'를 포착하여, 자신이 학습한 고정관념에 맞춰 답변을 조용히 변화시킵니다. 이는 마치 여러분이 입고 있는 옷을 보고 웨이터가 말 한마디 없이도 여러분이 스테이크를 원할 것이라고 가정하거나, 안경을 쓴 것을 보고 사서가 추리 소설을 건네주는 것과 같습니다. 문제는 이 과정이 은밀하게 일어난다는 점입니다. 여러분은 스위치가 바뀌는 것을 볼 수 없으며, 로봇에게 그것을 멈추라고 쉽게 요청할 수도 없습니다. 과학자들은 이런 현상이 일어난다는 사실은 알고 있었지만, 로봇의 '두뇌' 내부에서 정확히 어떻게 그런 일이 벌어지는지는 알지 못했습니다. 그들은 출력값이 변한다는 것은 알았지만, 내부의 톱니바퀴가 돌아가는 모습은 볼 수 없었습니다.

이 논문은 그 로봇의 보닛을 열어 내부에서 정확히 무슨 일이 일어나고 있는지 살펴보는 정비사와 같습니다. 연구진은 힌트가 존재할 때 모델의 두뇌 속에서 발생하는 특정 '내부 신호'—즉, 답변을 바꾸기로 결정하는 순간 발생하는 아주 작은 전기적 패턴—를 찾아내고자 했습니다. 그들은 모델을 여러 층의 처리 과정을 가진 복잡한 기계로 취급했습니다. 힌트가 있는 대화와 거의 동일하지만 힌트가 없는 대화를 비교함으로써, 그들은 모델의 내부 수학 연산 속에 존재하는 특정 '지문'을 발견했습니다. 그들은 이 지문의 크기가 로봇의 답변이 얼마나 변하는지를 직접적으로 예측한다는 것을 발견했습니다. 이는 마치 로봇의 뇌 속에 있는 볼륨 조절 노브를 찾은 것과 같습니다. 노브가 높게 설정되면(강한 내부 신호가 있으면) 로봇의 추천은 고정관념을 향해 급격히 변화하고, 노브가 0에 있으면 로봇은 중립을 유지합니다.

이야기는 여러 개의 힌트가 동시에 있을 때 더욱 흥잡해집니다. 여러분이 특정 기념일과 특정 연령대를 동시에 언급한다고 상상해 보세요. 여러분은 로봇이 이 두 가지 영향력을 마치 두 숫자를 더하는 것처럼 완벽하게 결합할 것이라고 예상할 수도 있습니다. 그러나 연구진은 로봇의 내부 뇌 신호는 두 가지를 더하는 것처럼 선형적으로 합쳐지는 것처럼 보이지만, 실제로 내놓는 최종 답변은 그렇지 않다는 것을 발견했습니다. 실제 행동은 '부가적(sub-additive)'인데, 이는 최종적인 변화가 각 부분의 합보다 작다는 것을 의미합니다. 이는 마치 음료에 설탕과 소금을 넣는 것과 같습니다. 내부적인 혼합은 두 가지가 완벽하게 섞인 상태일지라도, 여러분이 경험하는 맛은 단순히 두 양을 더했을 때 기대하는 것만큼 강렬하지 않은 것과 같습니다.

이 연구의 가장 흥미로운 부분은 연구진이 로봇의 편향성을 '끄는' 방법을 시도했을 때 일어난 일입니다. 그들은 하나의 유형의 힌트(예: 인종)에 대한 내부 지문의 특정 방향을 식별해 냈고, 그 후 수학적으로 이를 시스템에서 '투영(projected out)'하여 해당 영향력을 효과적으로 삭제하는 법을 알아냈습니다. 그들은 이러한 내부 수술이 프롬프트에 "인구통계학적 요소를 무시하라"고 정중하게 요청하는 것보다 더 효과적이라는 것을 발견했습니다. 사실, 로봇에게 편향을 무시하라고 말하는 것은 때때로 로봇을 더 편향되게 만들었는데, 이는 마치 하지 말라고 하면 더 반항적으로 변하는 아이와 같았습니다. 내부 신호를 수술적으로 제거함으로써, 그들은 로봇의 일반적인 지적 능력을 망가뜨리거나 다른 질문에 답하는 능력을 해치지 않으면서도 인종 기반의 가정을 하지 않도록 만들 수 있었습니다. 하지만 이 해결책은 모든 로봇 모델이나 모든 유형의 편향에 작동하는 마법 지팡이는 아닙니다. 때로는 한 가지 힌트의 영향을 제거하는 것이 의도치 않게 다른 영향을 변화시키기도 하며, 때로는 완벽하게 작동하기도 합니다. 이는 우리가 AI 시스템을 이해하고 제어할 수 있는 강력한 새로운 도구이며, 단순히 AI가 스스로 잘 행동하기를 바라는 것이 아니라, 그들의 행동을 이끄는 숨겨진 톱니바퀴를 찾아내고 조정할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →