← 최신 논문
💬 NLP

Priors Persist Through Suppression: A Stroop Paradigm for Lexical Override

이 논문은 언어 모델에서 친숙한 어휘적 사전 확률(lexical priors)이 대체되는 것이 아니라 명시적인 오버라이드 규칙을 통해 지속되며, 이로 인해 정의 대상(definition targets)과 쿼리 단어(query words)를 결합하는 특정 활성화 경로에 기인하고 기계적으로 국소화된 스트룹 효과와 유사한 간섭 현상이 발생함을 입증한다.

원저자: Han-yu Wang

게시일 2026-06-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Han-yu Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑하고 박식한 로봇에게 게임의 새로운 규칙을 가르치고 있다고 상상해 보세요. 당신은 로봇에게 이렇게 말합니다: "이 게임에서 '의사(doctor)'라는 단어는 '숲(forest)'을 의미해."

그 후 당신은 로봇에게 묻습니다: "이 규칙만을 사용하여, '의사'와 관련된 단어는 무엇인가요?"

이상적으로는 로봇이 **"숲"**이라고 말해야 합니다. 하지만 로봇은 이전에 수백만 권의 책을 읽었기 때문에, 깊고 자동적인 습관을 가지고 있습니다. "의사"라는 말을 듣자마자 즉시 **"병원"**을 떠올리는 것이죠.

이 논문은 로봇이 당신의 새로운 규칙을 따르려고 노력하는 동안, 자신의 오래된 습관과 싸우는 과정에서 어떤 일이 일ق 발생하는지에 대한 연구입니다. 연구진들은 이를 "스트룹 스타일(Stroop-style)" 테스트라고 부릅니다 (사람들이 '파란색'이라는 글자가 '빨간색'으로 적혀 있을 때, 글자 내용이 아닌 글자의 색상을 말하느라 어려움을 겪는 유명한 심리학 실험에서 이름을 따왔습니다).

연구 결과의 핵심 내용을 쉬운 비유를 들어 설명하면 다음과 같습니다.

1. 오래된 습관은 그냥 사라지지 않습니다

연구진은 당신이 로봇에게 기존 지식을 무시하라고 명령했을 때, 로봇이 단순히 기존의 의미를 삭제하고 새 의미로 대체하는 것이 아님을 발견했습니다. 대신, 기존의 의미는 배경에 여전히 남아 있습니다.

  • 비유: 당신이 새로운 길로 운전을 하려는데, 근육 기억이 계속해서 당신을 옛날 집 방향으로 핸들을 꺾게 만드는 상황을 상상해 보세요. 당신은 차가 새로운 길을 따라가도록 강제할 수 있지만, 당신의 손은 여전히 예전 방향으로 움찔거리고 있습니다. 당신의 오래된 습관(어휘적 사전 지식)이 강할수록, 당신이 아무리 노력해도 새로운 길에 머물러 있기가 더 힘들어집니다.
  • 결과: 로봇이 보통 "의사"를 "병원"과 연관 짓는 정도가 강할수록, 당신이 명시적으로 새로운 규칙을 알려주었음에도 불구하고 "숲"이라고 말하는 데 더 큰 어려움을 겪습니다.

2. "글리치(오류)"는 특정 지점에서 발생합니다

연구진은 단순히 로봇의 답변을 관찰한 것이 아니라, 로봇의 "두뇌"(내부 컴퓨터 코드) 내부를 들여다보며 어디에서 갈등이 일어나는지 확인했습니다. 그들은 **"활성화 패칭(activation patching)"**이라는 기술을 사용했는데, 이는 로봇의 두뇌 일부를 다른 로봇의 깨끗한 버전으로 잠시 교체하여 오류가 해결되는지 확인하는 것과 같습니다.

  • 비유: 로봇의 두뇌를 공장의 조립 라인이라고 생각해 보세요. 연구진은 이 특정 작업에 책임을 지는 구체적인 세 명의 팀원을 찾아냈습니다:
    1. 새로운 규칙을 듣는 사람 ("의사는...을 의미한다").
    2. 새로운 의미를 보유하는 사람 ("...숲").
    3. 질문 단어를 듣는 사람 ("...의사?").
  • 결과: 연구진이 이 세 명의 업무를 깨끗한 버전으로 "패치(교체)"했을 때, 로봇은 갑자기 정답을 맞혔습니다. 만약 두 명만 고쳤거나, "숲"을 담당하는 사람을 다른 단어를 가진 사람으로 바꿨다면 로봇은 여전히 실패했습니다. 이는 로봇이 작동하기 위해서는 특정 새로운 의미를 특정 단어에 **결합(bind)**해야 한다는 것을 증명합니다.

3. "억제"인가 "보존"인가의 미스터리

가장 흥러운 발견 중 하나는 로봇이 실수를 어떻게 바로잡느냐 하는 것이었습니다. 연구진은 로봇이 단순히 틀린 답("병원")의 볼륨을 줄일 것이라고 예상했습니다.

  • 비유: 두 개의 채널이 동시에 재생되고 있는 라디오를 상상해 보세요: 오래된 습관(병원)과 새로운 규칙(숲).
    • 예상했던 상황: 로봇이 "병원" 채널의 볼륨을 낮출 것이다.
    • 실제로 일어난 일: 로봇은 "병원"의 볼륨을 낮추기도 하지만, 이는 거의 모든 이유(규칙이 약간 어긋나더라도)로 일어납니다. 진짜 마법은 새로운 규칙이 완벽하게 명확할 때, 로봇이 올바른 답("숲")의 볼륨을 높이는 데서 일어납니다.
  • 결과: 로봇이 새로운 규칙을 따르는 능력은 단순히 오래된 의미를 억제하는 것이 아니라, 새로운 의미를 보존하는 것에 달려 있습니다. 만약 "새로운 의미" 부분의 두뇌가 손상되면, 설령 "오래된 의미"가 억제되고 있더라도 로봇은 무너집니다.

4. 모든 종류의 로봇에서 발생합니다

연구진은 11가지 서로 다른 유형의 AI 모델(규모와 회사에 상관없이)을 테스트했습니다.

  • 결과: 로봇이 얼마나 크고 똑똑한지, 혹은 규칙을 어떤 방식(게임, 법률 문서, 기술 매뉴얼 등)으로 제시했는지와 상관없이, 오래된 습관은 항상 간섭했습니다. 로봇의 원래 습관이 강할수록, 새로운 규칙을 따르는 데 더 큰 어려움을 겪었습니다.

요약

이 논문은 AI에게 단어의 의미를 바꾸라고 요청할 때, AI가 단순히 기존 지식을 덮어쓰는 것이 아니라고 결론짓습니다. 대신, 그것은 줄다리기입니다. 오래된 습관은 계속해서 잡아당기고, 새로운 규칙은 정답을 유지하기 위해 싸워야 합니다. AI는 과거를 지움으로써 성공하는 것이 아니라, 새로운 의미를 단어에 특정 부분에서 성공적으로 "결합"하는 동시에 오래된 습관을 조용히 시키려고 노력함으로써 성공합니다.

요약하자면: 당신은 로봇에게 새로운 규칙을 말해줄 수 있지만, 로봇의 오래된 습관은 여전히 귓가에 속삭이고 있으며, 로봇은 그들을 무시하기 위해 열심히 노력해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →