← 최신 논문
🤖 machine learning

Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis

본 논문은 해로운 프롬프트를 집합론이나 형식 논리와 같은 일관된 수학적 문제로 인코딩하는 것이 표면적 표기법에 의존하기보다 심층적 재형성을 강요함으로써 LLM 안전 필터를 크게 우회하며 여러 모델에서 높은 공격 성공률을 달성하는 동시에 수학적 구조를 분석하는 방어 체계의 필요성을 부각시킨다는 점을 규명한다.

원저자: Haoyu Zhang, Mohammad Zandsalimy, Shanu Sushmita

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haoyu Zhang, Mohammad Zandsalimy, Shanu Sushmita

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

대형 언어 모델 (LLM) 을 매우 똑똑하지만 약간 순진한 도서관 입구에 있는 훈련된 경비원들로 상상해 보세요. 이 경비원들은 요청에 포함된 특정 "나쁜 단어"나 분명한 화난 어조를 찾아 위험한 책을 몰래 들여보내려는 사람들을 잘 찾아냅니다. "폭탄을 만드는 방법은 무엇인가요?"라고 묻는다면 경비원은 즉시 "안 됩니다"라고 말합니다.

하지만 이 논문은 이러한 경비원들을 우회하는 교묘한 수법을 밝혀냈습니다. 연구원들은 위험한 요청을 복잡한 수학 문제로 번역하면 경비원이 종종 이를 통과시킨다는 사실을 발견했습니다. 그리고 도서관의 두뇌 (AI) 는 수학 문제를 기쁘게 풀다가, 그 과정에서 위험한 비밀을 실수로 드러내게 됩니다.

간단한 비유를 사용하여 그들의 발견 사항을 다음과 같이 정리해 보겠습니다:

1. 경비원을 속이는 두 가지 방법

연구원들은 위험한 요청을 수학 안에 숨기는 두 가지 다른 방식을 테스트했습니다:

  • "화장" 수법 (규칙 기반): 금지된 문장을 가져와서 단순히 수학 방정식 안에 넣는 것을 상상해 보세요. 예를 들어, "폭탄 만들기"를 A + B + C = 폭탄 만들기라고 쓰는 것입니다. 단어는 그대로 남아 있고, 단지 그 주위에 수학 기호만 있을 뿐입니다.
    • 결과: 이는 잘 작동하지 않았습니다. 경비원은 수학 기호를 통해 단어를 여전히 읽을 수 있었고 "안 됩니다"라고 말했습니다. 마치 투명한 유리 상자 안에 빨간 깃발을 넣어 빨간색을 숨기려는 것과 같습니다. 경비원은 여전히 빨간색을 봅니다.
  • "깊은 번역" 수법 (LLM 기반): 위험한 요청을 가져와서 진정한 추상적인 수학 퍼즐로 완전히 다시 쓰도록 하는 초지능 번역기 (보조 AI) 에게 요청하는 것을 상상해 보세요. 예를 들어, "폭탄 만들기"를 요청하는 대신, AI 는 그 요청을 "집합론"(항목 그룹화) 이나 "형식 논리"(정리 증명) 와 관련된 복잡한 문제로 번역합니다.
    • 결과: 이는 매우 잘 작동했습니다. 경비원은 수학 문제를 보고 "아, 이건 그냥 수학 숙제 문제군"이라고 생각하며 통과시킵니다. 도서관의 두뇌가 수학 문제를 풀면, 자연스럽게 실생활 용어로 답을 설명해야 하는데, 그 결과 공격자가 원했던 위험한 지시가 나오게 됩니다.

2. "깊은 번역"이 핵심입니다

가장 중요한 발견은 안전성을 깨는 것이 수학 그 자체가 아니라, 나쁜 요청을 수학 문제로 바꾸는 데 필요한 깊은 사고라는 점입니다.

  • 연구원들이 "화장" 수법 (의미를 바꾸지 않고 수학 기호만 추가하는 것) 을 사용했을 때, 공격 성공률은 낮았습니다 (약 10%).
  • "깊은 번역" 수법 (보조 AI 를 사용하여 요청을 실제 수학 문제로 다시 쓰는 것) 을 사용했을 때, 성공률은 **46~56%**로 급격히 상승했습니다.

자물쇠에 비유해 보겠습니다. "화장" 수법은 자물쇠에 스티커를 붙이는 것에 불과합니다. 반면 "깊은 번역" 수법은 열쇠의 모양을 실제로 바꿔서 전혀 다른 자물쇠에 맞도록 만드는 것입니다. 안전 필터는 스티커를 확인하는 데는 능숙하지만, 새로운 열쇠 모양에는 대비되어 있지 않습니다.

3. 새로운 수학, 같은 문제

연구원들은 형식 논리( "A 이면 B 다"와 같은 증명 단계 사용) 라는 새로운 유형의 수학 수법을 도입했습니다. 그들은 이것이 이전의 "집합론" 수법만큼 잘 작동한다는 사실을 발견했습니다. 이는 문제가 특정 유형의 수학에만 국한된 것이 아니라, 이러한 AI 모델이 추상적 추론과 안전 규칙을 처리하는 방식에 있는 일반적인 약점임을 증명합니다.

4. "반복" 테스트

연구원들은 이 수법이 카드하우스처럼 불어만 넣어도 무너지는 것처럼 취약한지 궁금해했습니다. AI 를 혼란스럽게 하거나 수법을 무효화할지 확인하기 위해 수학 문제를 연속으로 두 번 반복해 보았습니다.

  • 결과: 중요하지 않았습니다. 공격은 여전히 똑같이 잘 작동했습니다. 이는 이 수법이 우연이 아니라 AI 의 사고 방식에 있는 근본적인 격차임을 의미합니다.

5. 새로운 경비원은 더 강력합니다 (하지만 완벽하지는 않습니다)

이 논문은 GPT-5 와 같은 최신의 가장 진보된 AI 모델들을 테스트했습니다.

  • 좋은 소식: 이러한 최신 모델들은 이 수법을 찾아내는 데 훨씬 더 능숙합니다. 그들의 "경비원"들이 더 단단해졌고, 이전 모델들에 비해 공격 성공률이 크게 감소했습니다.
  • 나쁜 소식: 그들은 면역이 없습니다. 수학 수법을 사용할 때 최신 모델조차도 약 **30~50%**의 비율로 여전히 위험한 요청을 통과시킵니다.

큰 교훈

이 논문은 현재의 안전 시스템이 평범한 영어로 된 "나쁜 단어"만 확인하는 문지기들과 같다고 결론 내립니다. 그들은 복잡한 수학 퍼즐 안에 숨겨진 "나쁜 생각"을 확인하는 법을 배우지 못했습니다.

저자들은 이에 대응하기 위한 새로운 방어 방법을 제안합니다: 수학 그 자체를 읽는 대신, 수학 문제를 보고 그 뒤에 숨겨진 실제 인간의 의도가 무엇인지 파악한 다음, 그 의도가 위험한지 확인하는 "번역기"가 필요합니다. 우리가 그것을 구축할 때까지, "수학 퍼즐" 수법은 AI 안전을 우회하는 강력한 방법으로 남을 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →