← 최신 논문
💻 computer science

How Language Models Process Negation

본 논문은 대규모 언어 모델에서 부정의 기계적 처리를 조사하여, 낮은 정확도가 후기 층의 어텐션 단축 경로에서 비롯되지만 모델이 부정 구문을 올바르게 처리하기 위해 억제 메커니즘과 구성적 메커니즘을 모두 내부적으로 활용하며 후자가 우세함을 밝혀냈다.

원저자: Zhejian Zhou, Tianyi Zhou, Robin Jia, Jonathan May

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhejian Zhou, Tianyi Zhou, Robin Jia, Jonathan May

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대 언어 모델 (LLM) 을 아주 유능하지만 약간 산만한 사서로 상상해 보세요. 이 사서가 질문에 답하려고 노력하는 모습입니다. 제공해주신 논문인 "언어 모델이 부정을 처리하는 방식 (How Language Models Process Negation)"은 '아니다'라는 단어가 포함된 까다로운 질문을 할 때, 이 사서의 뇌 안에서 어떤 일이 일어나는지 조사합니다.

다음은 그들의 발견을 간단한 개념으로 정리한 이야기입니다.

1. 문제: 사서가 '아니다'에 혼란을 겪다

연구자들은 다음과 같은 간단한 관찰로 연구를 시작했습니다. 현대의 AI 에게 *"양서류가 아닌 동물은 무엇인가?"*라고 묻는다면, AI 는 종종 '개구리'(실제로는 양서류임) 와 같이 틀린 답변을 내놓습니다. 마치 AI 가 '아니다'라는 단어를 완전히 무시하는 것처럼 보입니다.

그러나 논문은 놀라운 반전을 밝혀냅니다: AI 는 실제로 '아니다'를 완벽하게 이해합니다. 다만 그 이해가 나쁜 습관이라는 층위에 묻혀 있을 뿐입니다.

2. 두 가지 경쟁 메커니즘: '구축' 대 '단축로'

AI 가 어떻게 생각하는지 이해하기 위해 연구자들은 부정문을 처리할 수 있는 두 가지 다른 방식을 살펴보았습니다. 이를 사람이 수수께끼를 푸는 두 가지 다른 방식에 비유해 보았습니다.

  • 가설 1: '억제' 전략 (지우개)
    동물 목록이 있다고 상상해 보세요. '양서류가 아니다'에 답하기 위해 목록에서 '양서류'를 찾아 지우개로 지워버립니다. 그러면 나머지 것들이 남습니다.

    • 논문의 발견: AI 도 이를 약간 수행하지만, 이것이 주요 작동 방식은 아닙니다.
  • 가설 2: '구축' 전략 (건축가)
    지우는 대신, AI 는 완전히 새로운 정신적 이미지를 구축한다고 상상해 보세요. '가스가 아니다'를 들을 때, AI 는 단순히 '가스'를 생각했다가 지우는 것이 아닙니다. 대신 머릿속에서 **"고체"**라는 새로운 개념을 적극적으로 구축합니다. 반대 모습이 어떻게 보이는지에 대한 정신적 모델을 구축하는 것입니다.

    • 논문의 발견: 이것이 승자입니다. AI 는 주로 건축가 역할을 합니다. 부정 개념의 표현을 적극적으로 구축 (예: '가스가 아니다'를 '고체'로 변환) 하고 이를 이용해 답을 찾습니다.

3. 악당: '단축로' 습관

그렇다면 AI 가 이렇게 훌륭한 '부정 개념'을 구축하는 데 능숙하다면, 왜 여전히 답을 틀릴까요?

논문은 AI 뇌 내부, 특히 **나중 층 (AI 가 말을 하기 직전의 마지막 단계)**에 있는 '나쁜 행위자'들을 식별합니다. 연구자들은 이를 **"단축로 주의 헤드 (Shortcut Attention Heads)"**라고 부릅니다.

  • 비유: AI 가 시험을 보는 학생이라고 상상해 보세요. 학생은 정답을 알고 있습니다 ('가스가 아니다' = '고체' 개념을 구축했기 때문입니다). 하지만 답을 쓰기 직전, 뇌의 게으른 부분이 속삭입니다. "이봐, 훈련 데이터에서 '양서류'와 '개구리'라는 단어가 백만 번이나 함께 등장한 걸 봤어. 그냥 '개구리'라고 쓰고 시간을 아껴!"
  • 결과: 이 '단축로'가 똑똑한 '구축' 작업을 압도합니다. AI 는 논리를 무시하고 단어들이 보통 어떻게 함께 나타나는지에 기반해 단순히 추측합니다.

4. 해결책: 나쁜 습관 끄기

연구자들은 이를 증명하기 위해 교묘한 트릭을 테스트했습니다. 그들이 **"주의 침강 (Attention Sinking)"**이라고 부르는 방법을 사용했습니다.

  • 비유: 합창단을 듣는다고 상상해 보세요. '단축로'는 뒷줄에서 큰 소리로 음정을 벗어난 가수가 솔로 가수를 압도하는 것과 같습니다. 연구자들은 합창단이 더 잘 노래하도록 가르치려 하지 않았습니다. 대신 단순히 큰 소리로 음정을 벗어난 가수를 음소거 (mute) 했습니다.
  • 결과: 그들이 나중 층의 이러한 특정 단축로 모듈을 '음소거' (제거) 했을 때, AI 의 부정 질문에 대한 정확도가 급격히 상승했습니다. AI 는 갑자기 올바른 답을 주기 시작했는데, 이는 부정 이해 능력이 처음부터 있었으나 단축로에 가려져 있었음을 증명합니다.

5. 생각의 여정

논문은 생각의 과정이 AI 를 통해 어떻게 이동하는지 정확히 매핑해 냅니다.

  1. 초기 층 (이동자): AI 는 '아니다'라는 단어를 가져와 부정을 당하는 단어 바로 옆에 위치시킵니다 (예: '가스' 옆에 '아니다'를 이동).
  2. 중간 층 (건축가): 여기서 마법이 일어납니다. AI 는 새로운 개념 ('고체') 을 구축하고 이를 앞으로 밀어냅니다. 동시에 기존 개념 ('가스') 을 약하게 억제하려 시도합니다.
  3. 후기 층 (방해꾼): AI 가 말을 하려는 순간, '단축로' 헤드가 작동합니다. 그들은 '가스'와 '양서류'라는 단어를 보고, AI 가 방금 구축한 '고체' 개념을 무시하고 가장 흔한 연관성으로 답을 강제로 되돌리려 합니다.

요약

이 논문은 거대 언어 모델이 '아니다'를 이해하는 데 서툴지 않다고 결론 내립니다. 실제로는 정교한 '구축' 방식을 사용하여 부정 구문의 의미를 구축하는 데 매우 뛰어납니다.

그러나 그들은 훈련 과정에서 배운 나쁜 습관 (단축로) 에 압도당합니다. 이러한 단축로가 너무 강력하여 종종 올바른 논리를 압도해 오류를 일으킵니다. 이러한 단축로를 식별하고 일시적으로 끄는 것을 통해 연구자들은 AI 의 진정한 논리적 능력이 최종 산출물이 시사하는 것보다 훨씬 강력함을 보여주었습니다.

간단히 말해: AI 는 답을 알고 있지만, 쉬운 길로 추측하는 나쁜 습관이 있습니다. 단축로를 취하지 못하게 막으면, AI 는 올바르게 답합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →