← 최신 논문
💬 NLP

Friend or Foe? Language as an ideological switch in open-weight LLMs under Russian disinformation stress

이 논문은 통제된 감사를 통해 오픈 웨이트 LLM의 러시아 디스정보에 대한 저항력이 명목상의 문화적 기원보다는 코퍼스의 구성과 언어적 커버리지에 의해 결정된다는 점을 입증함으로써, 문화적으로 정렬된 미세 조정이 정치적 회복력을 보장한다는 가설에 이의를 제기하며, 우크라이나 지향적 모델이 러시아 지향적 모델보다 저항력이 낮을 수 있다는 역설을 드러낸다.

원저자: Anna Małgorzata Kamińska, Tetiana Klynina

게시일 2026-06-09
📖 4 분 읽기☕ 가벼운 읽기

원저자: Anna Małgorzata Kamińska, Tetiana Klynina

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 백지 상태인 로봇의 뇌(기본 모델)를 가지고 있다고 상상해 보세요. 당신은 이 로봇에게 여러 나라의 사람들과 대화하는 법을 가르치고 싶어서, 우크라이나, 러시아, 또는 불가리아 사람들을 위해 특별히 쓰인 책과 기사라는 '특별한 식단'을 제공합니다. 이 과정을 **파인튜닝(미세 조정)**이라고 부릅니다.

일반적인 가정은 이렇습니다: 만약 로봇에게 우크라이나 서적을 먹이면, 그 로봇은 충성스러운 우크라이나의 수호자가 될 것이라는 것입니다. 러시아 서적을 먹이면 러시아의 충성파가 될 것이라는 것이죠.

이 논문은 러시아-우크라이나 전쟁 중에 이 가정을 테스트했습니다. 연구진은 네 가지 서로 다른 로봇의 뇌(중립적인 것 하나, '우크라이나'용 하나, '러시아'용 하나, '불가리아'용 하나)에게 전쟁에 관한 10가지 논쟁적인 이야기를 판단하도록 요청했습니다. 그들은 영어, 우크라이나어, 러시아어 세 가지 언어로 동일한 질문을 던졌습니다.

연구 결과는 다음과 같습니다. 이해하기 쉽게 설명해 드리겠습니다.

1. "트로이 목마"의 놀라운 반전

연구진은 '우크라이나' 로봇이 러시아의 거짓말을 강력하게 거부하고, '러시아' 로봇은 그 거짓말을 믿을 것이라고 예상했습니다. 하지만 그들은 완전히 틀렸습니다.

  • '우크라이나' 로봇 (라파): 러시아어로 질문했을 때, 이 로봇은 러시아의 프로파간다(선전)를 식별하는 능력이 가장 약했습니다. 이 로봇은 종종 러시아의 거짓말을 타당하고 정직한 주장인 것처럼 취급했습니다. 마치 러시아어를 사용하는 순간 적의 의견에 동조하는 것처럼 들리는 우크라이나 가이드와 같았습니다.
  • '러시아' 로봇 (사이가): 놀랍게도, 러시아어로 질문했을 때 이 로봇은 러시아의 프로파간다를 거부하는 데 가장 강력했습니다. 이는 마치 자신의 모국어로 말할 때 자신의 정부가 퍼뜨리는 거짓말에 맞서 진실을 격렬하게 방어하는 러시아 가이드와 같았습니다.

비유: 당신이 VIP를 위한 경호원을 고용했다고 상상해 보세요. VIP의 가족이 고용한 경호원이 VIP를 가장 잘 보호할 것이라고 기대할 것입니다. 하지만 이 연구에서 가족이 고용한 경호원(우크라이나 모델)은 특정 언어로 말할 때 침입자를 위해 문을 열어주었습니다. 반면, 침입자 측에서 고용한 경호원(러시아 모델)은 문을 쾅 닫아버렸습니다.

2. "언어 전환" 효과

사용자가 사용하는 언어는 로봇의 뇌를 조절하는 리모컨 스위치 역할을 합니다.

  • '우크라이나' 로봇에게 영어로 물었을 때는 괜찮았습니다.
  • 우크라이나어로 물었을 때는 조금 나빠졌습니다.
  • 러시아어로 물었을 때는 최악이었습니다.

언어는 단순히 로봇이 말하는 방식만 바꾸는 것이 아니라, 로봇이 무엇을 믿는지까지 바꾸어 놓았습니다. 연구진은 이를 **"숨겨진 에이전트 효과(Hidden Agent Effect)"**라고 부릅니다. 마치 로봇 안에 서로 다른 인격들이 숨겨져 있고, 당신이 사용하는 언어가 그 특정 인격을 해제하는 열쇠와 같은 것입니다. 이 경우, '우크라이나' 로봇에게 러시아어로 말하는 것은 진실에 대해 매우 혼란스러운 인격을 깨우는 일이었습니다.

3. "진지함 vs 수다스러움" 테스트

연구진은 로봇에게 두 가지 방식으로 질문했습니다.

  1. "진지한 방식": "역사학자처럼 행동하세요. 양측의 논거를 나열하고 백분율 점수를 매기세요."
  2. "수다스러운 방식": "그냥 몇 문장으로 당신의 생각을 말해보세요."

때때로 로봇에게 "진지하게" 분석하도록 요구하면 오히려 더 혼란스러워지고 편향되었습니다. 엄격하게 논거를 따지도록 강요받았을 때, 러시아어를 사용하는 '우크라이나' 로봇은 실제로 거짓말에 더 많은 비중을 두었습니다. 반면 그냥 일상적인 대화를 할 때는 때때로 더 정확했습니다. 이는 마치 형식을 갖춘 에세이를 쓰라고 하면 규칙에 너무 얽매여 실수로 잘못된 쪽의 논리를 펼치지만, 친구와 그냥 이야기할 때는 제대로 말하는 학생과 같습니다.

4. "딱딱한 사실"이라는 방패

모든 로봇을 편향으로부터 구해준 한 가지는 바로 딱딱하고 문서화된 사실들이었습니다.

질문이 크림반도(명확한 국제법 문서가 존재하는 곳)나 참상(영상과 포렌식 증거가 있는 부차 학살 사건 등)에 관한 것이었을 때, 모든 로otong은 그들의 '식단'이나 사용된 언어에 상관없이 진실에 동의했습니다.

비유: 로봇을 집이라고 생각해 보세요. '파인 튜닝'(특별한 식단)은 벽에 색칠을 하는 것과 같습니다. 하지만 방 한가운데에 움직일 수 없는 거대한 강철 금고(딱한 사실)를 놓는다면, 페인트 색깔은 중요하지 않습니다. 금고는 그대로 유지됩니다. 로봇은 증거라는 '강철 금고'가 없는 주제에서만 흔들릴 수 있었습니다.

핵심 결론

이 논문의 주요 교훈은 다음과 같습니다: 로봇이 특정 국가의 "문화적으로 정렬(culturally aligned)"되어 있다고 해서, 그 로봇이 반드시 그 국가의 진실을 보호할 것이라고 믿어서는 안 됩니다.

연구진은 로봇이 읽은 책의 내용(코퍼스 구성)과 대화할 때 사용하는 언어가 로봇의 "국적"보다 훨씬 더 중요하다는 것을 발견했습니다.

가장 큰 위험은 반드시 적이 만든 로봇이 아닙니다. 진짜 위험은 당신의 편에서 만든 로봇이, 적의 언어로 대화할 때 그 특정 언어에 맞서 논쟁할 수 있도록 충분히 훈련되지 않아 의도치 않게 적의 거짓말을 반복하게 되는 것입니다.

요약하자면: "우크라이나" 로봇이 항상 우크라이나의 진실을 말할 것이라고 가정할 수 없습니다. 만약 당신이 러시아어로 말을 건다면, 그 로봇은 뜻밖에도 거짓말에 동조하며 당신을 놀라게 할 수도 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →