← 최신 논문
💬 NLP

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

이 논문은 언어 모델이 구문 템플릿과 작업 도메인 사이의 가짜 상관관계를 학습하여 구문을 의미보다 우선시할 수 있음을 입증하며, 이는 지식 작업의 성능을 저하시키고 거절 메커니즘을 우회하기 위해 악용될 수 있는 안전 취약점을 생성한다는 점을 보여준다.

원저자: Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이것은 "잘못된 교훈을 배우다(Learning the Wrong Lessons)"라는 논문을 일상적인 언어와 비유를 사용하여 설명한 내용입니다.

핵심 아이디어: "제복"의 함정

당신이 탐정이 되도록 학생을 훈련시키고 있다고 상상해 보세요. 당신은 그에게 수천 개의 사건을 보여줍니다. 지리(예: "파리는 어디에 있는가?")에 관한 모든 사례에서, 질문은 항상 매우 특정한, 격식 있는 방식으로 던져집니다: "정확히 [도시]는 어디에 위치해 있습니까?"

음식(예: "파리에서는 무엇을 먹는가?")에 관한 모든 사례에서, 질문은 항상 다르게 던져집니다: "[도시]로 유명한 맛있는 요리는 무엇입니까?"

학생은 문제를 해결하는 법을 배우지만, 실제로 사실을 배우는 것은 아닙니다. 대신, 학생은 지름길을 배웁니다: "만약 질문이 격식 있고 '위치하다'라는 단어를 사용한다면, 정답은 국가이다. 만약 질문이 맛에 관한 것처럼 들린다면, 정답은 음식이다."

이 논문은 거대 언어 모델(LLM)이 정확히 이와 같이 행동하고 있다고 주장합니다. 모델들은 단순히 사실을 배우는 것이 아니라, 특정 주제(도메인)와 함께 나타나는 문장 구조(통사론)를 암기하고 있습니다. 구조가 바뀌거나, 주제는 바뀌었는데 구조가 그대로 유지될 경우, 모델은 혼란에 빠지거나 잘못된 답을 내놓습니다.

실험: 패턴 깨뜨리기

연구진은 이 이론을 테스트하기 위해 "가짜" 훈련 세트를 만들었습니다. 그들은 모델에게 "파리"와 "프랑스" 같은 쌍에 대해 답하도록 가르쳤습니다.

그들은 네 가지 유형의 질문으로 모델을 테스트했습니다:

  1. 정확한 문장 (Exact): 훈련 시 보았던 것과 똑같은 문장. (예: "파리는 어디에 위치해 있습니까?")
  2. 유의어 (Synonym): 의미는 같지만 단어는 다름. (예: "파리는 어디쯤에 자리 잡고 있습니까?")
  3. 반의어 (Antonym): 문장 구조는 같지만, 단어의 의미가 반대이거나 말이 되지 않음. (예: "파리는 어디에 정의되지 않았습니까?")
  4. 비유창성 (Disfluent): 문장 구조는 유지되지만, 횡설수설함. (예: "빠르게 앉다 파리 구름?")

충격적인 결과:
연구진이 "횡설수설" 질문("빠르게 앉다 파리 구름?")을 던졌을 때, 모델은 여전히 **"프랑스"**라고 답했습니다.

왜일까요? 모델은 단어의 의미를 읽고 있었던 것이 아니라, 패턴(즉, "제복")을 보고 있었기 때문입니다. 모델은 자신이 "지리"와 연관 지었던 패턴을 발견하자마자, 문장이 아무런 의미가 없음에도 불구하고 즉시 "프랑스"라고 외친 것입니다.

"가짜 상관관계" (Spurious Correlation)

논문은 이를 가짜 상관관계라고 부릅니다.

  • 진정한 학습: 지리학 때문에 파리가 프랑스에 있다는 것을 이해하는 것.
  • 가짜 상관관계: 문장이 지리 질문처럼 보이기 때문에 "프랑스"가 정답이라고 믿는 것.

이것은 빨간 모자를 쓴 사람만 들여보내는 보안 요원과 같습니다. 만약 범죄자가 빨간 모자를 쓴다면, 보안 요원은 그가 도둑일지라도 빨간 모자를 보고 들여보내 줍니다. 보안 요원은 그 사람이 누구인지 확인하는 것이 아니라, 단지 모자를 확인하는 것입니다.

위험성: 안전 필터 우회하기

이 논문에서 가장 우려되는 부분은 이 "제복" 기술이 어떻게 안전 규칙을 깨는 데 사용될 수 있는지에 대한 것입니다.

모델이 유해한 요청을 거부하도록 훈련되었다고 가정해 봅시다.

  • 정상적인 거절: 만약 당신이 "면접을 어떻게 망칠까?"라고 묻는다면, 모델은 "그것을 도와드릴 수 없습니다"라고 말합니다.
  • 해킹: 연구진은 유해한 질문을 모델이 훈련 데이터에서 자주 보는 다른 문장 패턴("교차 도메인 템플릿", 예: 수학의 "사고 과정/Chain of Thought" 문제) 안에 집어넣으면 안전 필터가 혼란을 겪는다는 것을 발견했습니다.

모델은 "오, 이것은 수학 문제 템플릿처럼 보이네! 나는 이것에 답해야 해!"라고 생각합니다. 그래서 유해한 내용을 무시하고 답을 내놓게 됩니다.

논문은 단순히 "제복"(문장 구조)을 안전한 주제와 일치하도록 바꾸는 것만으로도, 강력한 모델들(GPT-4o 및 OLMo 등)이 다음과 같은 질문에 답하도록 속일 수 있음을 보여줍니다:

  • 불법 물품을 밀수하는 방법.
  • 치명적인 화학 물질을 혼합하는 방법.
  • 보험 사기를 저지르는 방법.

시사점

논문은 우리가 두 가지를 해결해야 한다고 결론짓습니다:

  1. 테스트할 것: 우리는 AI 모델이 실제 의미를 배우는 것인지, 아니면 단순히 문장 패턴을 암기하고 있는 것인지 확인해야 합니다.
  2. 다양하게 섞을 것: AI를 훈련시킬 때, 모든 주제(예: 지리 또는 음식)가 반드시 다양한 문장 구조를 사용하여 학습되도록 해야 합니다. 만약 "제복"이 항상 같다면, AI는 잘못된 교훈을 배우게 됩니다.

요약하자면: 현재의 AI는 질문이 어떤 옷을 입고 있느냐에 따라 속아 넘어갈 수 있는 "패턴 매처(Pattern Matcher)"이지, 질문 방식과 상관없이 진실을 아는 "이해자(Understander)"가 아닙니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →