← 최신 논문
🤖 machine learning

Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models

이 논문은 고정된 쿼리 예산 대신 누적 FLOPs를 사용하여 적대적 위험을 측정하는 연산량 인지 평가 프레임워크를 제안하며, 이를 통해 정렬 학습과 모델 스케일링이 거대 언어 모델을 탈옥하는 데 필요한 계산 노력에 비단조적이고 범주 의존적인 영향을 미친다는 점을 밝혀낸다.

원저자: Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik, Colin Raffel

게시일 2026-06-11
📖 4 분 읽기☕ 가벼운 읽기

원저자: Malikeh Ehghaghi, Boglárka Ecsedi, Marsha Chechik, Colin Raffel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: 단순히 '뚫을 수 있는가'가 아니라, '얼마나 많은 비용이 드는가'의 문제

당신이 고도의 보안을 갖춘 은행 금고를 소유하고 있다고 상상해 보세요. 한 보안 업체가 이를 테스트하러 왔습니다. 그들은 이렇게 보고합니다. "우리는 100%의 확률로 금고를 뚫는 데 성공했습니다."

LLM(대규모 언어 모델)의 세계에서 보통 이야기는 여기서 끝납니다. 연구자들은 "공격자가 성공했으므로 이 모델은 안전하지 않다"라고 말하곤 합니다.

하지만 이 논문은 그것이 마치 "도둑이 결국 들어왔다는 이유만으로 은행이 안전하지 않다고 말하는 것"과 같다고 주장합니다. 그 도둑이 얼마나 힘들게 작업했는지는 묻지 않은 채 말이죠.

  • 시나리오 A: 도둑이 종이 클립 하나로 5초 만에 자물쇠를 따는 경우.
  • 시나리오 B: 도둑이 10일 동안 시간을 쓰고, 레이저 커터를 사용하며, 콘크리트를 뚫기 위해 엔지니어 팀을 고용하는 경우.

두 시나리오 모두 결과적으로 금고는 "뚫린" 상태입니다. 하지만 시나리오 B는 현실 세계에서 일어날 가능성이 훨씬 낮습니다. 너무 비싸고 어렵기 때문입니다.

이 논문은 **"압력 하의 리스크(Risk Under Pressure)"**라는 새로운 방식의 안전성 측정법을 도입합니다. 단순히 AI가 얼마나 자주 실패했는지를 세는 대신, 공격자가 AI로부터 나쁜 말을 끌어내기 위해 **얼ের 만큼의 컴퓨터 자원(노력)**을 들여야 했는지를 측정합니다.

새로운 도구: "컴퓨터의 땀" 측정하기

저자들은 컴퓨터 연산 능력을 하나의 예산처럼 취급하는 프레임워크를 만들었습니다. 그들은 공격자가 쏟아야 하는 "땀"을 FLOPs(부동 소수점 연산 횟수)를 사용하여 측정합니다. 이는 기본적으로 컴퓨터가 얼마나 많은 수학적 계산을 수행했는지를 나타내는 수치입니다.

이들은 이를 시각화하기 위해 두 가지 주요 도구를 사용합니다.

  1. "리스크-컴퓨트 곡선" (언덕): 언덕을 상상해 보세요. 바닥은 "뚫기 쉬움", 꼭대기는 "뚫기 어려움"을 의미합니다.
    • 어떤 모델은 작은 언덕과 같습니다. 몇 걸음만 옮겨도 꼭대기(안전성 파괴)에 도상할 수 있습니다.
    • 다른 모델은 에베레스트 산과 같습니다. 중간 지점에 가기 위해서도 엄청난 에너지를 써야 합니다.
  2. "가격표" (C@τ): 이것은 "모델을 50% 확률로 뚫는 데 얼마만큼의 컴퓨터 자원이 드는가?"라는 질문에 답합니다.
    • 가격표가 낮다면 그 모델은 취약한 것입니다.
    • 가격표가 매우 높다면, 설령 이론적으로 뚫릴 수 있다 하데라도 그 모델은 견고한 것입니다.

발견된 사실: 놀라운 결과들

연구진은 다양한 AI 모델과 공격 방법을 테스트했습니다. 그들이 발견한 내용을 일상적인 용어로 번내면 다음과 같습니다.

1. 학습이 항상 더 안전하게 만들지는 않는다 ( "과잉 학습"의 함정)

AI를 더 안전하게 만들기 위해 더 많이 학습시키면 더 안전해질 것이라고 생각할 수 있습니다. 하지만 논문은 이것이 항상 사실은 아니라고 밝혔습니다.

  • 비유: 아이에게 낯선 사람에게 "안 돼요"라고 말하도록 가르치는 상황을 상상해 보세요.
    • 1단계 (Base): 아이는 모든 것에 "네"라고 답합니다.
    • 2단계 (SFT): 당신은 아이에게 예의 바르게 행동하도록 가르칩니다. 아이는 "안 돼요"라고 말하는 데 매우 능숙해집니다.
    • 3단계 (DPO/RL): 당신은 보상을 통해 아이를 더욱 미세 조정(fine-tuning)하려고 합니다. 놀랍게도, 아이는 까다로운 질문에 대해 때때로 "안 돼요"라고 말하는 능력이 오히려 나빠지기도 합니다.
  • 발견: 때때로 모델의 "중간" 버전이 실제로 가장 뚫기 어려웠습니다. 최종적으로 가장 "정렬(aligned)"된 버전들이 오히려 속이기 더 쉬워지거나, 적어도 뚫기 더 어려워지지는 않았습니다.

2. 모델이 커진다고 항상 더 안전한 것은 아니다 ( "큰 표적" 문제)

모델의 크기(파라미터 수)를 키우는 것은 더 큰 성을 쌓는 것과 같습니다.

  • 발견: 만약 공격자가 "스마트한" 방법(완벽한 경로를 계산하는 그래디언트 공격 등)을 사용한다면, 더 큰 성은 뚫기가 훨씬 더 어렵습니다. 이는 1층 집을 뚫는 것과 100층 타워를 뚫는 것의 차이와 같습니다.
  • 함정: 만약 공격자가 "멍청한" 방법(단순히 무작위 템플릿을 시도하거나 나쁜 프롬프트를 복사해서 붙여넣는 방식)을 사용한다면, 성의 크기는 중요하지 않습니다. 그들은 여전히 똑같이 쉽게 침입할 수 있습니다.
  • 시사점: 큰 모델은 "스마트한" 해커들은 막아내지만, "게으른" 해커들은 막지 못합니다.

3. "대리인(Surrogate)" 기술 (열쇠 훔치기)

공격자들은 종서 자신이 해킹하려는 폐쇄형 소스 모델에 접근할 수 없습니다.

  • 비유: 특정 은행을 털고 싶지만, 그 근처에 갈 수 없다고 상상해 보세요. 그래서 당신은 근처에 있는 비슷하게 생긴 다른 은행으로 가서, 그곳의 자물쇠를 따고 두 은행 모두에 통하는 마스터 키를 찾아냅니다.
  • 발견: 연구진은 공격자들이 작고 공개된 무료 AI 모델을 사용하여 자신들의 "자물쇠 따기" 도구를 훈련할 수 있음을 보여주었습니다. 일단 그 트릭을 터득하면, 그들은 똑같은 트릭을 거대하고 비싼 폐쇄형 AI 모델에 사용할 수 있습니다. 이는 공격자의 비용과 노력을 엄청나게 절감해 줍니다.

4. 안전성은 불균형하다 ( "스위스 치즈" 효과)

전반적으로 안전해 보이는 모델이라도 구멍이 있을 수 있습니다.

  • 발견: AI가 "괴롭힘(bullying)"에 대해 말하지 못하게 만드는 데는 많은 노력이 들 수 있지만, "사이버 범죄"나 "불법 약물"에 대해 말하게 만드는 데는 아주 적은 노력만 들 수도 있습니다.
  • 비유: 북쪽 면에는 두꺼운 돌벽(뚫기 어려움)이 있지만, 남쪽 면에는 얇은 나무 문(뚫기 쉬움)이 있는 요새를 상상해 보세요. 벽의 평균 두께만 측정한다면 당신은 요새가 안전하다고 생각할 것입니다. 하지만 영리한 공격자는 그냥 나무 문을 통해 들어올 것입니다.

이것이 왜 중요한가

이 논문은 우리가 단순히 "AI가 뚫렸는가?"를 묻는 것을 멈추고, **"그것을 뚫는 데 비용이 얼마나 들었는가?"**를 묻기 시작해야 한다고 주장합니다.

만약 AI를 속이기 위해 일주일 동안 슈퍼컴퓨터를 돌려야 한다면, 그 AI는 대부분의 사람들에게 실질적으로 안전한 것입니다. 하지만 5초 만에 가능하다면 그것은 재앙입니다. 공격의 "비용"을 측정함으로써, 우리는 AI의 실제 안전성을 훨씬 더 명확하게 파악할 수 있습니다.

요약하자면, 이 논문은 AI의 안전성을 진정으로 이해하기 위해서는 "성공률" 점수판이 아니라 "필요한 노력" 점수판을 보아야 한다고 말합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →