← 최신 논문
⚡ electrical engineering

Divergence-based Safety Measure for Large Language Models via Rational Inattention

이 논문은 임베딩 입력 공격(embedding-input attacks) 상황에서 대규모 언어 모델을 위한 새로운 발산 기반 안전 측정법을 제안하며, 이는 트랜스포머 어텐션과 합리적 부주의(rational inattention) 사이의 등가성을 활용하여 은밀성을 보장하는 동시에 최악의 경우 출력 분포 변화를 정량화한다.

원저자: Anh Tung Nguyen, Quanyan Zhu

게시일 2026-06-30
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anh Tung Nguyen, Quanyan Zhu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 중요한 결정을 내릴 때 도움을 주는 매우 똑똑하고 박식한 로봇 비서(대규모 언어 모델, 즉 LLM)가 있다고 상상해 보세요. 당신은 이 로봇에게 질문을 던지고, 로봇은 답을 줍니다. 하지만 만약 어떤 교활한 해커가 로봇의 "귀"(입력 데이터)에 아주 미세하고 거의 보이지 않는 변화를 속삭여서, 로봇이 위험하거나 잘못된 답을 내놓도록 속일 수 있다면 어떻게 될까요?

이 논문은 로봇 비서가 이러한 교활한 속임수에 대해 얼마나 안전한지를 측정하는 새로운 방법을 제안합니다. 다음은 쉬운 비유를 사용한 요약입니다.

1. 핵심 문제: "속삭임" 공격

로봇의 뇌를 텍스트 도서관이라고 생각해 보세요. 해커는 문을 부수고 들어올 필요가 없습니다. 그저 로봇이 읽고 있는 단어에 아주 미세하고 감지하기 어려운 변화를 속삭이기만 하면 됩니다.

  • 목표: 해커는 당신이 눈치채지 못하게 로봇의 답변을 바꾸는 것(예: "문이 열려 있다"에서 "문이 잠겨 있다"로)을 목표로 합니다.
  • 도전 과제: 우리는 어떻게 로봇이 "안전한지" 알 수 있을까요? 우리는 최악의 시나리오를 측정해야 합니다: 우리가 잡아내기 전까지 해커가 로봇의 생각을 얼마나 많이 바꿀 수 있는가 하는 점입니다.

2. 새로운 "안전 계측기": 합리성 체크

저자들은 새로운 안전 계측기를 만들었습니다. 단순히 최종 답변을 보는 대신, 로봇이 어떻게 생각하는지를 봅니다.

비유: 과로한 매니저
매니저(로봇)가 결정을 내리기 위해 엄청난 양의 이메일(입력 텍스트)을 읽어야 한다고 상상해 보세요.

  • 합리적 무관심(Rational Inattention): 인간은 모든 이메일의 모든 단어를 완벽하게 읽을 수 없습니다. 우리는 에너지를 아끼기 위해 가장 중요한 부분만 훑어보고 나머지는 무시하는 "합리적 무관심"을 가져야 합니다.
  • 로봇의 "주의력": 로봇도 이와 유사하게 작동합니다. 로봇은 "트랜스포머 어텐션(Transformer Attention)"이라는 메커니즘을 사용하여 문장에서 어떤 단어가 가장 중요한지 결정합니다.
  • 연결 고리: 이 논문은 로봇이 주의를 기울이는 방식이 피곤하거나 바쁠 때 인간 매니저가 어디에 집중할지 결정하는 방식과 수학적으로 동일하다고 주장합니다.

계측기:
저자들은 다음과 같은 질문을 던지는 "합리성 계측기"를 구축했습니다: 로봇이 정상적인, 인간과 유사한 방식으로 주의를 기울이고 있는가, 아니면 혼란을 겪고 있는가?

  • 로봇이 정상적으로 행동하고 있다면, 계측기는 낮은 수치를 나타냅니다 (안전).
  • 로봇이 속임수에 빠졌다면, 로봇의 주의력은 흩어지고 계측기 수치는 올라갑니다.

3. "스텔스" 규칙

이 안전 테스트에는 엄격한 규칙이 있습니다: 공격은 은밀해야 합니다.

  • 도둑이 그림을 훔치려 한다고 상상해 보세요. 만약 도둑이 형광색 옷을 입는다면 즉시 들통날 것입니다.
  • 이 "안전 측정치"는 다음과 같이 묻습니다: 도둑이 합리성 계측기를 울리지 않는 "위장복"을 입은 상태에서, 로봇의 답변을 얼마나 크게 바꿀 수 있는가?

논문은 **쿨백-라이블러 발산(Kullback–Leibler Divergence, KL Divergence)**을 계산합니다. 간단히 말해, 이것은 로봇의 "속은" 답변과 "정상적인" 답변이 얼마나 다른지를 측정하는 점수입니다.

  • 높은 점수: 로봇의 마음이 교활한 공격에 쉽게 휘둘렸습니다. (불안전!)
  • 낮은 점수: 로봇이 속임수에 저항했거나, 혹은 그 속임수가 숨기기에 너무 노골적이었습니다. (더 안전함!)

4. 실험: GPT-2 vs. GPT-Neo

저자들은 이 안전 계측기를 두 개의 유명한 로봇 뇌인 GPT-2GPT-Neo에 대해 테스트했습니다.

  • 그들은 두 로봇에게 동일한 "속삭임" 공격(동일한 예산의 보이지 않는 변화들)을 가했습니다.
  • 그들은 두 로봇이 합리성 계측기로부터 숨으려고 노력하는 동안 답변이 얼마나 변하는지 관찰했습니다.

결과:
두 로봇은 서로 다르게 반응했습니다.

  • GPT-2는 더 쉽게 속았습니다. "위장"을 했음에도 불구하고 답변이 크게 변했습니다. 즉, 안전 프로필이 더 "새는(leaky)" 형태였습니다.
  • GPT-Neo는 속이기 더 어려웠습니다. 공격을 받았을 때도 답변을 정상에 가깝게 유지했습니다.

요약

이 논문은 단순히 "해커는 나쁘다"라고 말하는 것이 아닙니다. 이는 AI 안전을 위한 온도계를 만드는 것입니다.

  1. AI의 주의력 메커니즘을 인간의 제한된 집중력처럼 취급합니다.
  2. 이를 사용하여 미묘한 혼란을 감시하는 "거짓말 탐지기"를 만듭니다.
  3. 숨겨진 공격에 의해 AI의 마음이 얼마나 많이 뒤틀릴 수 있는지(탐지기가 울리기 전까지)를 측정합니다.
  4. 어떤 AI 모델이 이러한 숨겨진 속임수에 대해 본질적으로 더 "강한"지를 증명합니다.

궁극적인 목표는 엔지니어들이 중요한 업무를 위해 더 안전한 로봇을 선택하도록 돕고, 미래의 해커들에 맞선 더 나은 방어책을 구축하는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →