← 최신 논문
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

본 논문은 언어 모델에 대한 기존 화이트박스 아웃오브디스트리뷰션 (OOD) 탐지 방법이 시퀀스 길이에 구조적으로 혼동된다는 점을 밝히고, 어휘 변화를 탐지하기 위한 임베딩 기반 신호와 조크브레이크와 같은 은밀한 의도를 가진 입력을 탐지하기 위한 숨겨진 상태 궤적 특징을 구분하는 양-경로 프레임워크를 제안한다.

원저자: Hamidreza Saghir

게시일 2026-05-04
📖 3 분 읽기☕ 가벼운 읽기

원저자: Hamidreza Saghir

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 박물관의 경비원이라고 상상해 보세요. 당신의 임무는 진짜 그림들 사이에서 위조 그림들 (Out-of-Distribution 또는"OOD"입력) 을 찾아내는 것입니다. 최근 다른 경비원들은 새로운 도구를 사용하고 있습니다: 그들은 그림이 얼마나"흔들리는지"또는 붓터치가 얼마나 혼란스러운지 측정합니다 (이는 AI 에서어텐션 엔트로피를 측정하는 것과 같습니다). 그들은 이 도구가 위조를 찾아내는 데 놀라울 정도로 뛰어나다고 주장합니다.

그러나 이 논문은 그 경비원들이 실제로 속고 있다고 주장합니다. 그들은 위조를 찾아내는 것이 아니라, 캔버스에 있는 붓터치의 수를 세고 있을 뿐입니다.

다음은 간단한 비유를 사용한 이 논문의 연구 결과에 대한 요약입니다:

1."긴 캔버스"함정 (길이 교란)

이 논문은 많은 인기 있는 AI 안전 도구들이 사실은 텍스트의 길이를 측정하고 있음을 발견했습니다.

  • 비유: 경비원의 도구가 자라고 상상해 보세요. 그것은"혼란"을 측정한다고 주장하지만, 실제로는 단지"길이"만 측정합니다.
  • 문제: 테스트에서"위조"그림 (재일브레이크 또는 스팸) 은 종종 진짜 그림보다 훨씬 길었습니다. 도구는 긴 그림을 보고 당황하며 단순히 길다는 이유만으로"그건 위조야!"라고 외쳤습니다.
  • 증거: 연구자들이 진짜와 위조 그림을 정확히 같은 길이로 강제했을 때, 도구는 작동하지 않았습니다. 그것은 동전 던지기 수준으로 무작위 추측으로 무너졌습니다. 이 논문은 CED, RAUQ 와 같은 도구들뿐만 아니라 배포된 시스템의 일부 신뢰도 점수조차도 텍스트 길이에 따라 자연스럽게 성장하는 어텐션 메커니즘에 의존하기 때문에 구조적으로 결함이 있음을 보여줍니다.

2. 두 가지 경로 프레임워크:"무엇"vs"어떻게"

연구자들이"길이 속임수"를 제거한 후, 그들은 다음과 같이 질문했습니다:*입력이 이상한지 어떻게 실제로 알 수 있을까요?*그들은 범죄 현장을 두 가지 다른 방식으로 바라보는 형사처럼 두 부분으로 구성된 시스템을 제안합니다:

경로 A:"무엇"(임베딩)

  • 비유: 이는 수프의 재료를 보는 것과 같습니다.
  • 작동 방식: 어휘를 확인합니다. 수프에"유해한"단어나"스팸"키워드가 있다면 이 경로가 이를 경고합니다.
  • 작동할 때: 라벨에"독"이라고 갑자기 쓰여 있는 수프처럼 명백한 위조를 찾아내는 데 탁월합니다.
  • 실패할 때: 위조 수프가 진짜 수프와 정확히 같은 재료를 사용하지만 이상하게 섞여 있다면 실패합니다. 예를 들어,"재일브레이크"프롬프트는 종종 정상적인 단어를 사용하지만 AI 를 속이도록 배열합니다."재료 검사기"는 정상적인 단어를 보고"모두 안전하다"고 말하며 속임수를 놓칩니다.

경로 B:"어떻게"(처리 궤적)

  • 비유: 이는 요리사가 수프를 만드는 과정을 지켜보는 것과 같습니다.
  • 작동 방식: 단순히 최종 그릇을 보는 대신, 이 경로는 요리사의 손이 요리 과정의 모든 단계 (레이어별) 를 어떻게 움직이는지 지켜봅니다. 질문합니다:"요리사가 부드럽게 다지고 있나요? 갑자기 당황하며 재료를 던지고 있나요? 냄비가 이상한 리듬으로 흔들리고 있나요?"
  • 작동하는 이유: 재료 (단어) 가 정상적으로 보이더라도,"재일브레이크"프롬프트는 AI 요리사가 이상하고 비자연스러운 리듬으로 요리를 하도록 강요합니다."어떻게"경로는 이 이상한 요리 스타일을 포착합니다.
  • 결과: 이 경로는"재료"경로가 놓친 까다로운"재일브레이크"위조를 성공적으로 찾아냈으며, 훨씬 높은 정확도 점수 (기존 방법의 우연 수준 대비 0.850) 를 달성했습니다.

3."교차"발견

이 논문은 어떤 방법도 모든 것에 완벽하지 않다는 것을 발견했습니다. 서로 다른 두 가지 유형의 금속 탐지기를 가진 것과 같습니다:

  • 탐지기 1 (재료/임베딩): 모래 더미에 숨겨진 금화를 찾는 데 탁월합니다 (명백한 어휘 변화).
  • 탐지기 2 (요리 스타일/궤적): 금처럼 칠해진 플라스틱 동전을 찾는 데 탁월합니다 (미묘한 구조적 속임수).
  • 통찰: 둘 다 필요합니다."위조"가 단순히 다른 주제일 때 탐지기 1 이 이깁니다."위조"가 정상적인 단어를 사용한 교묘한 속임수일 때 탐지기 2 가 이깁니다.

4."왜" (메커니즘적 증거)

연구자들은 단순히 추측한 것이 아니라, AI 의 뇌 (회로) 를 들여다보며 무슨 일이 일어나고 있는지 확인했습니다.

  • 발견: AI 가"재일브레이크"(구조적 속임수) 를 마주할 때, 특정 방식으로 혼란을 겪습니다: 그"어텐션"(집중) 회로가 망가져 집중력을 혼란스럽게 만듭니다.
  • 대조: AI 가"혐오 발언"(어휘 변화) 을 마주할 때, 나쁜 단어를 인식하기 때문에 뇌의"기억"(MLP) 부분이 빛납니다.
  • 교훈: 서로 다른 유형의"위조"는 AI 를 서로 다른 방식으로 파괴합니다. 기존 도구들은"집중"부분만 바라보았고 길이 때문에 혼란을 겪었습니다. 새로운"궤적"도구는 전체 요리 과정을 지켜보기 때문에, 어디에서 파괴가 일어나든 그것을 포착합니다.

요약

이 논문은 많은 현재 AI 안전 도구들이 텍스트 길이에 속기 때문에 고장 났다고 주장합니다. 이를 수정하기 위해서는 텍스트가 무엇이라고 말하는지 보는 것을 멈추고 AI 가 그것을 어떻게 처리하는지 지켜보기 시작해야 합니다. AI 의"사고 과정"을 단계별로 (궤적으로) 지켜봄으로써, 표면적으로는 정상처럼 보이지만 AI 의 내부 메커니즘에는 이상하게 느껴지는 교묘한 속임수들을 잡아낼 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →