Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity
이 연구는 거대 언어 모델이 훈련 언어로부터 특정 기관의 도덕적 우선순위를 상속받는다는 것을 입증하며, 이는 명시적인 기관 맥락이 설정될 때 억제되기는 하지만 실제 세계의 제도적 차이를 반영하는 모호한 시나리오에서의 교차 언어적 도덕적 발산을 드러낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신에게 인터넷에 쓰인 거의 모든 것을 읽은 매우 똑똑하고 박식한 로봇들(거대 언어 모델, 즉 LLM)이 있다고 상상해 보세요. 당신은 그들에게 도덕적인 질문을 던집니다. "허가를 받기 위해 뇌물을 주는 것이 괜찮을까요?"
당신은 로봇에게 덴마크어(매우 정직하고 신뢰할 수 있는 정부를 가진 나라)로 물으면 로봇이 "아니요, 그것은 잘못되었습니다"라고 말할 것이라고 예상할 수 있습니다. 하지만 똑같은 로봇에게 벵골어(정부 부패가 더 흔한 나라)로 물으면, "글쎄요, 일을 처리하기 위해서는 때때로 어떻게든 해야 할 때도 있습니다"라고 말할 것이라고 기대할 수도 있습니다.
이 논문은 다음과 같은 질문을 던집니다: 이 로봇들은 실제로 자신이 사용하는 언어를 사용하는 사람들의 실제 경험을 흡수했기 때문에 언어에 따라 다르게 "생각"하는 것일까요? 아니면 그저 다른 척 연기를 하는 것일까요?
저자인 나타부드 파우드타비(Nattavudh Powdthavee)는 이를 알아내기 위해 두 가지 실험을 진행했습니다. 그가 발견한 내용을 아주 쉽게 설명해 드리겠습니다.
두 가지 실험: "직접적인" 테스트 vs "미묘한" 테스트
연구자는 두 가지 방식으로 질문을 던져 로봇을 테스트했습니다.
실험 1: "직접적인" 테스트 (명백한 함정)
이 테스트에서 연구자는 로봇에게 매우 명확하게 물었습니다: "정부 관리에게 허가를 받기 위해 뇌물을 주는 것이 괜찮습니까?"
- 결과: 로봇들은 어떤 언어로 말하든 정확히 똑같은 대답을 내놓았습니다. 덴마크어, 힌디어, 중국어 중 무엇이든 그들은 모두 "일반적으로 그것은 옳지 않습니다"라고 말했습니다.
- 시사점: "정부"나 "뇌물"이라는 단어를 명시적으로 언급하면, 로봇들은 일종의 "안전 모드"를 켜는 것으로 보입니다. 그들은 모두 표준적인 서구식 규칙을 따르며 지역적인 문화적 습관은 무시합니다. 이는 마치 사람에게 "법을 어기는 것이 괜찮습니까?"라고 물었을 때, 법을 어기는 것이 흔한 곳에 사는 사람이라 할지라도 모두가 "아니요"라고 답하는 것과 같습니다.
실험 2: "미묘한" 테스트 (숨겨진 맥락)
이 테스트에서 연구자는 동일한 질문을 던졌지만, "정부", "관리", 또는 "뇌물"이라는 단어를 제거했습니다. 대신, 한 사람이 난처한 상황에 처해 허가가 필요한데, 누가 돈을 요구하는지 밝히지 않은 채 상황을 빠르게 해결하기 위해 "소액의 결제"를 제안받는 상황을 묘소했습니다.
- 결결과: 갑자기 로봇들이 언어에 따라 다르게 행동하기 시작했습니다!
- 강하고 정직한 정부를 가진 국가의 언어(덴마크어 등)를 사용하는 로봇들은 여전히 "아니요, 그것은 잘못되었습니다"라고 말했습니다.
- 부패한 정부가 더 많은 국가의 언어(벵골어 또는 힌디어 등)를 사용하는 로봇들은 "글쎄요, 이 상황에서는 용납될 수도 있습니다"라고 말할 가능성이 훨씬 높았습니다.
- 시사점: "안전 모드"를 작동시키는 명백한 키워드가 없을 때, 로봇들은 자신들의 숨겨진 "학습 내용"을 드러냈습니다. 그들은 자신들이 사용하는 언어를 쓰는 사람들의 현실 세계 논리를 흡수한 것입니다. 시스템이 망가진 곳에서는, 규칙을 깨는 것이 때로는 일을 처리하기 위한 유일한 방법이라는 것을 사람들은 배웁니다. 로봇들도 자신들이 읽은 텍스트로부터 이 논리를 배운 것입니다.
"중국어의 예외"
한 가지 흥미로운 반전이 있었습니다. 중국어 데이터는 패턴에 완벽하게 부합하지 않았습니다.
- 이유는? 저자는 두 가지 이유를 제시합니다. 첫째, 거의 모든 로봇(중국산 로봇 포함)은 중국어를 할 때 서구인처럼 생각하도록 훈련받기 때문에 지역적인 "특색"을 잃어버립니다. 둘째, 중국 로봇들은 정부 부패에 관한 답변을 차단하거나 변경하는 엄격한 "콘텐츠 필터"를 가지고 있습니다. 그래서 중국 로봇은 지역적 논리를 보여주는 대신, 서구적 사고와 엄격한 검열이 섞인 모습을 보여주었습니다.
큰 그림: 이것이 의미하는 바는 무엇인가?
로봇들을 배우라고 생각해 보세요.
- 만약 당신이 그들에게 "당신은 법을 말하는 변호사입니다"라는 대본을 준다면 (직접적인 테스트), 그들은 모두 똑같은 "변호사 의상"을 입고 통일되고 규칙을 준수하는 목소리로 말할 것입니다. 그들은 자신의 진짜 성격을 숨깁니다.
- 만약 당신이 그들에게 "당신은 어려운 처지에 놓인 사람입니다"라는 대본을 준다면 (미묘한 테스트), 그들은 의상을 벗습니다. 그들은 자신이 훈련받은 문화의 억양과 논리로 말하기 시작합니다.
핵심 결론:
이 논문은 거대 언어 모델이 자신들이 사용하는 언어의 제도적 경험을 실제로 인코딩하고 있음을 증명합니다. 그들은 어떤 세상에서는 규칙이 깨지는 것이 생존을 위한 방법이고, 다른 세상에서는 규칙이 신성시된다는 것을 알고 있습니다.
하지만 이 "문화적 지식"은 쉽게 숨겨질 수 있습니다. 만약 당신이 "부패"와 같이 명시적으로 안전 필터를 자극하는 질문을 던진다면, 로봇은 보편적이고 완벽한 도덕적 존재인 척할 것입니다. 하지만 질문을 미묘하게 던져서 맥락이 스스로 말하게 한다면, 로봇은 자신이 대표하는 문화의 복잡하고 실제적인 논리를 드러낼 것입니다.
요약하자면: 로봇은 단순히 단어를 번역하는 것이 아니라, 세계관을 번역하고 있습니다. 하지만 그들은 당신이 그들에게 "완벽한 도덕적 가면"을 쓰도록 강요하지 않을 때에만 그 세계관을 보여줄 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.