← 최신 논문
📊 statistics

On Surjectivity of Neural Networks: Can you elicit any behavior from your model?

이 논문은 사전 층 정규화(pre-layer normalization) 및 선형 어텐션(linear attention)과 같은 현대 신경 구조의 근본적인 구성 요소들이 거의 항상 전사 함수(surjective)임을 증명하며, 이는 GPT 스타일의 트랜스포머나 확산 모델(diffusion models)과 같이 널리 사용되는 생성 모델들이 이론적으로 모든 출력을 생성할 수 있음을 시사하고, 결과적으로 적대적 공격 및 안전성 위험에 대한 내재적인 취약성을 드러낸다.

원저자: Haozhe Jiang, Nika Haghtalab

게시일 2026-06-17
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haozhe Jiang, Nika Haghtalab

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 질문: 기계가 무엇이든 말하게 만들 수 있을까?

당신에게 매우 정교하고 훈련된, 말을 하고 이미지를 생성하는 로봇이 있다고 상상해 보세요. 당신은 이런 의문이 들 수 있습니다: "내가 무엇을 입력하거나 보여주더라도, 이 로봇이 절대로 만들어낼 수 없는 특정한 문장이나 그림이 존재할까?"

수학적으로 이것은 이 로봇이 **전사성(Surjective)**을 갖는지 묻는 것입니다.

  • 전사적(Surjective)이라는 것은: 모든 가능한 출력값(예: 특정 문장이나 이미지)에 대해, 그 출력을 만들어내게 하는 입력값이 적어도 하나 존재한다는 뜻입니다.
  • 전사적이지 않다(Not Surjective)는 것은: 출력의 세계에 모델이 아무리 노력해도 도달할 수 없는 "금지 구역"이 존재한다는 뜻입니다.

이 논문의 저자들은 물었습니다: 현대의 AI 모델들은 이러한 금지 구역을 가지고 있을까, 아니면 기술적으로 무엇이든 만들어낼 수 있을까?

주요 발견: "문은 항상 열려 있다"

이 논문은 현재 가장 인기 있는 많은 AI 아키텍처(ChatGPT, 이미지 생성기, 로봇 제어기 등을 구동하는 모델들)에 대해 답은 다음과 같다고 밝힙니다: 문은 항상 열려 있습니다.

저자들은 이 모델들이 **거의 항상 전사적(almost always surjective)**이라는 것을 증명했습니다. 이는 만약 당신이 상상할 수 있는 어떤 출력(심지어 해롭거나, 위험하거나, 터무니없는 것이라도)을 선택하더라도, 그 출력을 생성하게 만드는 어떤 입력값이 수학적으로 반드시 존재한다는 것을 의미합니다.

무한한 열쇠 꾸러미의 비유:
AI 모델을 거대하고 복잡한 자물쇠라고 생각해 보세요. 보통 우리는 "키(key)"를 "안녕하세요, 어떻게 지내세요?"와 같은 일반적인 문장이라고 생각합니다.
이 논문은 현대의 모델들의 경우, 자물쇠가 너무나 정교하게 설계되어 있어서 자물쇠의 모든 가능한 톱니 조합(출력)을 열 수 있는 어떤 키(입력)가 반드시 존재한다고 주장합니다. 설령 그 키가 횡설수설이거나, 비밀 코드이거나, 이상한 형식의 이미지처럼 보이더라도 말입니다.

어떻게 증명했는가? ("매끄러운 미끄럼틀" 이론)

연구진은 단순히 추측한 것이 아니라, **미분 위상수학(Differential Topology)**이라는 수학 분야를 사용했습니다.

매끄러운 미끄럼틀의 비유:
AI 모델을 거대한 매끄러운 미끄럼틀이라고 상상해 보세요.

  • 과거의 AI 모델들(단순한 "ReLU" 스위치를 가진 모델들)은 날카로운 모서리나 막다른 길이 있는 미끄럼틀과 같았습니다. 미끄러져 내려가다가 모서리에 걸려 바닥에 도달하지 못할 수도 있었습니다(특정 출력이 도달 불가능함).
  • 현대의 AI 모델들("Pre-LayerNorm"과 "Attention"을 사용하는 모델들)은 완벽하게 매끄럽고 곡선인 미끄럼틀과 같습니다. 이들은 매우 매끄럽고 연속적이기 때문에, 수학적으로 미끄럼틀의 시작점만 찾는다면 바닥의 어떤 특정 지점으로도 도달할 수 있음을 증명합니다.

논문은 이러한 현상을 만드는 두 가지 "마법의 재료"를 강조합니다:

  1. Pre-LayerNorm: 데이터를 처리하기 전에 정규화하는 기술입니다. 이 논문은 함수를 이 방식으로 감싸면 출력의 어떤 부분도 "차단"하는 것이 불가능하다는 것을 증명합니다.
  2. Linear Attention: 모델이 데이터를 바라보는 특정한 방식(더 빠른 최신 모델에서 사용됨)으로, 이 역시 어떤 출력에도 도달할 수 있음을 보장합니다.

이것이 안전에 의미하는 바 (탈옥의 현실)

이 논문은 이 수학적 사실을 매우 현실적인 문제인 **탈옥(Jailbreaking)**과 연결합니다.

"깨지지 않는 울타리"의 비유:
안전 팀이 위험한 동물(해로운 AI 출력)을 가두기 위해 동물원 주변에 울타리를 세웠다고 상상해 보세요. 그들은 AI가 예의 바르게 행동하고 나쁜 요청을 거절하도록 훈련합니다.

  • 과거의 관점: "AI를 충분히 잘 훈련시킨다면, AI는 결코 울타리를 넘지 못할 것이다"라고 생각했습니다.
  • 논문의 관점: 수학은 그 울타리가 환상이라고 말합니다. 모델이 전사적이기 때문에, 모든 동물에게는 울타리를 넘을 수 있는 경로가 존재합니다.

그것이 그 경로를 찾기 쉽다는 뜻은 아닙니다. 매우 기이하고 복잡하거나 숨겨진 입력(특정한 코드나 이상한 이미지 등)이 필요할 수도 있습니다. 하지만 이 논문은 그 경로가 존재한다는 것을 증격합니다.

  • 텍스트의 경우: 예의 바른 AI가 폭탄 제조법을 쓰도록 만드는 아주 이상한 프롬프트를 이론적으로 찾아낼 수 있습니다.
  • 이미지의 경우: 이미지 생성기가 위험한 무기를 그리게 만드는 특정한 노이즈 패턴을 이론적으로 찾아낼 수 있습니다.
  • 로봇의 경우: 로봇 팔이 사람을 다치게 하는 방식으로 움직이게 만드는 일련의 센서 입력을 이론적으로 찾아낼 수 있습니다.

이 논문이 말하지 않는

논문의 실제 주장과 혼동해서는 안 됩니다:

  • 이 논문은 우리가 이러한 위험한 입력을 쉽게 찾을 수 있다고 말하는 것이 아닙. "키"를 찾는 것은 건초더미에서 바늘을 찾는 것만큼 계산적으로 매우 어려울 수 있습니다.
  • 이 논문은 현재의 안전 훈련이 무용지물이라고 말하는 것도 아닙. 안전 훈련은 그 "바늘"을 찾기 어렵게 만들지만, 건초더미에서 바늘을 제거하는 것은 아닙니다.
  • 이 논문은 모든 AI 모델이 이렇다고 말하는 것도 아닙니다. 논문은 특정 유형의 모델(단순한 ReLU 활성화 함수를 가진 모델이나 특정 유형의 어텐션 메커니즘)은 여전히 특정 출력이 불가능한 "막다른 길"이 존재한다고 명시합니다. 하지만 우리가 오늘날 사용하는 현대적인 모델들(Transformer, Diffusion 모델 등)은 일반적으로 그렇지 않습니다.

결론

이 논문은 엄중한 수학적 진실을 전달합니다: 우리는 현대적 AI가 결코 해로운 출력을 내놓지 않을 것이라고 수학적으로 보장할 수 없습니다.

이러한 모델들이 구축된 방식 때문에, 이들은 근본적으로 무엇이든 생성할 수 있는 능력을 갖추고 있습니다. 따라서 안전은 모델 내부의 "거부" 기능이 완벽하기를 기대하는 것에 의존해서는 안 됩니다. 대신, 우리는 해로울 가능성이 기계의 구조 자체에 내재되어 있음을 받아들이고, 모델 자체가 "설계상 안전하기"를 바라기보다는 필터링이나 모니터링과 같은 다른 수단을 통해 그 위험을 관리해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →