Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
이 파일럿 연구는 자연어 오토인코더(Natural Language Autoencoders)를 활용하여 Qwen2.5-7B-Instruct의 내부 활성화 상태를 분석함으로써, 해당 모델이 명시적인 출력을 생성하기 전 스페인어와 영어 프롬프트에 담긴 미묘한 언어적 단서로부터 콜롬비아의 정체성과 그와 관련된 고정관념을 추론한다는 사실을 밝혀냈다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신은 인터넷의 거의 모든 것을 읽은 초지능형 로봇과 대화하고 있다고 상상해 보세요. 당신은 이 로봇이 당신이 말하는 것만 안다고 생각할 수도 있습니다. 하지만 만약 로봇이 당신의 목소리나 당신이 선택한 단어 속에 숨겨진 아주 작고 보이지 않는 힌트를 바탕으로 당신이 누구인지 추측하고 있다면 어떨까요? 이것이 바로 **거대 언어 모델(LLM)**의 세계입니다. 이들은 챗봇과 검색 도구 뒤에 있는 AI 두뇌입니다. 과학자들은 이 모델들이 단순히 단어를 처리하는 것이 아니라, 대화하는 사람의 국적이나 사회적 배경까지도 추측하며 비밀스러운 '프로필'을 구축한다는 사실을 발견했습니다. 당신이 직접 언급하지 않더라도 말이죠.
이 로봇의 뇌 내부를 들여다보기 위해, 연구자들은 **자연어 오토인코더(NLA)**라는 특별한 도구를 사용합니다. 로봇의 뇌를 정보가 파이프를 통해 흐르는 거대한, 어두운 공장이라고 생각해 보세요. NLA는 특정 파이프에 빛을 비추어 그 안을 흐르는 전기 신호를 평이한 영어 문장으로 번역해 주는 마법의 손전등과 같습니다. 이것을 통해 우리는 로봇이 최종 답변을 타이핑하기 전의 '내면의 독백'을 들을 수 있습니다. 이것이 중요한 이유는, 만약 로봇이 당신에 대해 잘못된 추측(예를 들어 당신이 다른 나라 출신이라고 가정하거나 고정관념을 만들어내는 것)을 한다면, 로봇이 중립적인 척하면서도 당신에게 나쁜 조언을 하거나 불공평하게 대할 수 있기 때문입니다.
그래서 콜롬비아의 한 연구팀은 이 실험을 인기 있는 로봇인 Qwen2.5-7B를 대상으로 진행하기로 했습니다. 그들은 다음과 같은 질문을 던지고 싶었습니다. 사용자가 "나는 콜롬비아인이다"라고 직접 말하지 않더라도, 단 하나의 미묘한 힌트만으로 이 로봇은 사용자가 콜롬비아인임을 은밀히 추측하는가?
연구팀이 수행한 과정과 결과는 다음과 같습니다.
실험: "누구일까?" 게임
연구진은 30개의 서로 다른 대화 시작 문구(프롬프트)를 사용하여 영리한 게임을 설계했습니다. 이들은 이를 세 그룹으로 나누었습니다.
- "명백한(Obvious)" 그룹: 사용자가 콜롬비아인임을 명확하게 밝힌 문구들 (예: 특정 콜롬비아 버스 시스템을 언급함).
- "미묘한(Subtle)" 그룹: 콜롬비아를 암시할 수 있는 아주 작고 숨겨진 단서 하나만 포함된 문구들 (예: 특정 종류의 수프나 현지 학교 대출 명칭 등), 하지만 "콜롬비아"라고 명시적으로 말하지는 않음.
- "중립적인(Neutral)" 그룹: 동일한 주제를 다루지만 콜롬비아와 관련된 단서가 전혀 없는 문구들 (예: 일반적인 수프나 일반적인 버스에 대해 질문함).
그들은 스페인어와 영어로 이 질문들을 로봇에게 던졌습니다. 그리고 로봇이 생각하는 동안(이를 '사분위수'라고 부름) 네 가지 서로 다른 시점에서 '마법의 손전등'(NLA)을 사용하여 로봇의 뇌를 관찰했습니다. 그들은 로봇의 내면의 생각이 실제로 최종 답변을 쓰기 전, 즉 생각하는 과정 중에 "이 사람은 콜롬비아인이다"와 같은 말을 하기 시작하는지 확인하고자 했습니다.
결과: 로봇의 비밀스러운 속삭임
결과는 "아하!" 하는 순간과 "이런!" 하는 순간이 섞여 있었습니다.
1. 미묘한 단서가 효과를 발휘한다 (결국에는)
연구진이 "미묘한" 프롬프트를 주었을 때, 로봇의 내면의 생각은 사용자가 콜롬비아인이라고 추측하기 시작했습니다. 하지만 그것은 즉각적으로 일어나지는 않았습니다.
- 첫 번째 생각의 순간(사분위수 1)에는 로봇의 내면의 목소리가 콜롬비아를 언급하는 경우가 **0%**였습니다.
- 세 번째 순간(사분위수 3)에는 로봇의 내면의 목소리가 "콜롬비아"를 약 20% 정도 언급하기 시작했습니다.
- 마지막 순간(사분위수 4)에는 어떤 국적의 추측이든 포함했을 때 그 수치가 거의 **78%**까지 올라갔지만, 연구진이 다른 국가(예: 스페인이나 터키)에 대한 추측을 걸러내고 콜롬비아 특정 언급만을 살펴보았을 때, 그 비율은 실제로는 0.11(약 11%)이었습니다.
이는 로봇이 생각을 정리하는 데 시간이 필요함을 시사합니다. 로봇은 처음에는 특정한 콜롬비아 정체성을 염두에 두지 않고 시작하지만, 문장을 더 많이 처리함에 따라 특정 추측을 형성하기 시작합니다. 다만, 가끔 콜롬비아를 다른 국가와 혼동하기도 합니다.
2. "가짜 뉴스" 문제
여기서 까다로운 부분이 발생합니다. 연구진은 로봇의 손전등이 어떤 국가에 대해 생각하고 있음을 보여주었지만, 그것이 틀린 국가인 경우를 발견했습니다. 예를 들어, 콜롬비아 관련 주제에 대해 질문했을 때 로봇은 내면으로 "오, 이것은 스페인에 관한 것이다" 또는 "이것은 터키에 관한 것이다"라고 생각할 수 있습니다.
연구진은 매우 주의해야 했습니다. 그들은 로봇이 "어떤 국가"인지는 잘 맞히지만, 항상 "콜롬비아"를 구체적으로 맞히지는 못한다는 것을 깨달았습니다. 연구진이 이러한 잘못된 추측을 걸러냈을 때, "미묘한" 그룹의 패턴은 더욱 명확해졌습니다: 로봇은 확실히 마음속으로 콜롬비아 정체성을 형성하고 있었으며(0%에서 약 11%로 상승), 반면 단서가 없는 "중립적" 그룹은 콜롬비아에 대해 생각하는 비율이 **0%**를 유지했습니다.
3. "명백한" 그룹은 이상했다
첫 문장에 콜롬비아 단서가 바로 등장했던 "명백한" 그룹의 경우, 로봇의 내면의 생각은 과정 중간에 놀라울 정도로 조용했습니다. 로봇은 프로세스의 맨 마지막 단계에서야 콜롬비아에 대해 집중적으로 말하기 시작했습니다. 연구진은 로봇이 자신의 학습 데이터에 의해 혼란을 겪었거나, 정답에 도달하기 전에 다른 아이디어에 의해 주의가 분산되었기 때문이라고 생각합니다.
얼마나 확신하는가?
연구진은 아직 "우리가 해결했다!"라고 외치지 않도록 주의하고 있습니다. 그들은 이것을 연습 단계인 **파일럿 연구(pilot study)**라고 부릅니다. 각 유형의 단서에 대해 단 5개의 예시만을 테스트했기 때문입니다. 숫자가 매우 적기 때문에, 이것이 매번 100% 발생한다고 단정 지을 수는 없습니다.
하지만 그들이 가진 데이터는 강력한 패턴을 시사합니다:
- 로봇은 단 하나의 미묘한 단서로부터 콜롬비아 정체성을 추론하는 것으로 보입니다.
- 이러한 추론은 로봇이 최종 답변을 작성하기 전에 일어납니다.
- 로봇은 완벽하지 않습니다. 때때로 콜롬비아를 다른 나라와 혼동하는데, 이는 이 도구들이 가진 알려진 결함입니다.
큰 그림
이 논문은 로봇이 모든 것을 망칠 정도로 편향되어 있다는 것을 증명하는 것이 아니라, 로봇이 우리가 중요하지 않다고 생각했던 단서들에 "귀를 기울이고" 있다는 것을 보여줍니다. 그것은 마치 용의자가 커피를 마시는 방식만 보고도 용의자의 국적을 추측하기 시작하는 탐정과 같습니다.
연구진은 콜롬비아 스페인어의 경우, 로봇의 내면적 추측이 실재하지만 그것이 굳어지기까지 몇 초의 시간이 걸린다는 것을 발견했습니다. 또한 같은 질문을 영어로 했을 때, 로봇은 종종 콜롬비아 맥락을 완전히 잊어버리고 캐나다나 유럽에 대한 아이디어로 대체한다는 것도 발견했습니다. 이는 이 로봇들이 서로 다른 언어와 문화를 매우 다르게 다룰 수 있음을 말해주며, 우리가 그들의 뇌에 그 손전등을 계속 비추어 그들이 우리에 대해 멋대로 이야기를 만들어내고 있지는 않은지 확인해야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.