← 최신 논문
💬 NLP

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

이 논문은 다양한 암호 알고리즘에 걸친 최첨단 대규모 언어 모델의 암호 해독 능력과 일반화 능력을 평가하기 위한 벤치마크 데이터셋을 소개하며, 이를 통해 모델이 저일반화 공격(under-generalization attacks)에 노출될 수 있는 잠재적 취약성을 드러내고 암호학적 맥락에서 AI의 이중 용도 보안 위험을 강조한다.

원저자: Utsav Maskey, Chencheng Zhu, Usman Naseem

게시일 2026-06-02
📖 4 분 읽기☕ 가벼운 읽기

원저자: Utsav Maskey, Chencheng Zhu, Usman Naseem

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게 지구상의 거의 모든 책을 읽은 거대하고 매우 똑똑한 로봇 사서(거대 언어 모델, 즉 LLM)가 있다고 상상해 보세요. 당신이 간단한 질문을 던지면 그 로봇은 완벽하게 대답합니다. 하지만 만약 당신이 그 로봇에게 비밀 코드로 작성된 메시지를 건네준다면 어떻게 될까요? 그 로보는 코드를 해독할 수 있을까요, 아니면 그저 멍하니 바라만 보고 있을까요?

이 논문은 이 로봇 사서들을 위한 일종의 "스트레스 테스트"와 같습니다. 연구진들은 AI 모델들이 얼마나 잘 코드 브레이커(암호 해독가) 역할을 수행할 수 있는지 알아보기 위해 거대한 비밀 메시지 놀이터를 만들었습니다. 여기 그들이 발견한 이야기를 쉽게 설명해 드립니다.

놀이터: 비밀 코드의 혼합

연구진은 4,509개의 방대한 비밀 메시지 데이터셋을 만들었습니다. 이것을 잠긴 상자들의 도서관이라고 생각하면 됩니다.

  • 내용물: 상자 안에는 과학, 뉴스, 셰익스피어, 심지어 농담에 관한 일반적인 문장들이 들어 있었습니다.
  • 자물쇠: 이 문장들을 9가지 유형의 "자물쇠"(암호화 방식)로 잠갔습니다.
    • 쉬운 자물쇠: 단순한 알파벳 교체(카이사르 암호)나 모스 부호(점과 선)와 같은 것들입니다.
    • 중간 난이도 자물쇠: 격자 안에 글자를 재배열하거나(레일 펜스), 비밀 키워드를 사용하는(비제네르 암호) 방식입니다.
    • 어려운 자물쇠: 오늘날 은행 보안에 사용되는 고도의 디지털 자물쇠(RSA 및 AES)와 같은 것들입니다.

테스트: 로봇이 자물쇠를 딸 수 있을까?

연구진은 다양한 AI 모델(ChatGPT, Claude, Gemini의 두뇌와 같은 모델들)에게 이 상자들을 열어보라고 요청했습니다. 그들은 두 가지 방식으로 테스트했습니다.

  1. 제로샷(Zero-Shot): "여기 잠긴 상자가 있다. 열어라." (도움 없음).
  2. 퓨샷(Few-Shot): "여기 잠긴 상자와 열쇠가 있다. 이제, 여기 또 다른 잠긴 상자가 있다. 이것을 열어라." (힌트를 줌).

발견한 사실: "부분적 이해"의 함정

1. "친숙함" 편향 (The "Familiarity" Bias)
로봇들은 자신들의 학습 데이터에서 수백만 번 본 "쉬운" 자물쇠를 여는 데 뛰어났습니다.

  • 비유: 빨간 문을 수천 번 본 아이를 상상해 보세요. 빨간 문을 보여주면 아이는 그것을 여는 법을 압니다. 하지만 작동 방식은 똑같지만 색깔만 다른 '파란 문'을 보여주면 아이는 얼어붙을 수 있습니다.
  • 결과: AI는 (글자를 3칸씩 미는) '카이사르' 암호를 자주 보았기 때문에 쉽게 해독할 수 있었습니다. 하지만 (알파벳을 역순으로 배열하는) '아트바시(Atbash)' 암호에는 어려움을 겪었습니다. 아트바시는 그만큼 간단함에도 불구하고, AI는 단지 그 특정 패턴을 충분히 많이 보지 못했을 뿐입니다. 즉, 일반화하는 데 어려움을 겪은 것입니다.

2. "토큰 팽창" 문제 (The "Token Inflation" Problem)
어떤 코드들은 메시지를 실제보다 훨씬 더 길게 보이게 만듭니다.

  • 비유: 당신이 "Hello"라는 짧은 메모를 썼다고 상상해 보세요. 그런데 코드를 적용했더니 이 메모가 50페이지 분량의 기호 책이 되었습니다. 로봇은 단 하나의 단어를 찾기 위해 그 책 전체를 읽으려다 압도되어 버립니다.
  • 결과: 모스 부호나 베이컨 암호(글자를 긴 점/선이나 A/B 패턴으로 바꾸는 방식)와 같은 코드들은 텍xt를 거대하게 만들었습니다. AI는 논리는 단순하더라도, "단어"가 너무 길고 생소해지면서 혼란에 빠졌습니다.

3. "거의 다 왔어"의 위험 (Partial Comprehension)
이것이 가장 중요한 발견입니다. AI가 상자를 완벽하게 열지 못하더라도, 그 안에 무엇이 들어있는지 종종 이해했다는 점입니다.

  • 비유: 외국어를 번역하려는 로봇을 상상해 보세요. 문장 구조는 맞추고 전반적인 분위기는 이해하지만, 단어 하나를 비슷한 소리가 나는 다른 단어로 바꿔버립니다. 완벽한 번역은 아니지만, 충분히 근접한 수준입니다.
  • 결과: AI는 비록 정확한 글자를 다시 써내지는 못하더라도, 비밀 메시지의 의미를 종종 추측해 냈습니다. 예를 들어, "고혈압 환자들은..."을 "당신의 기대치에 대한 인내심..."과 같이 바꿀 수 있습니다. 단어는 틀릴지언라도 핵심적인 '생각'은 맞춘 것입니다.

4. "힌트" 효과 (Few-Shot Learning)
연구진이 로봇에게 특정 자물쇠를 여는 방법의 예시를 단 하나만 주었을 때, 로봇은 훨씬 더 잘 해냈습니다.

  • 비유: 로봇에게 특정 종류의 자물쇠를 따는 법을 한 번 보여주면, 로봇은 다른 문에 있는 똑같은 종류의 자락을 따는 법을 찾아낼 수 있습니다.
  • 결과: 이것은 양날의 검입니다. 이는 만약 악의적인 행위자가 비밀 코드를 사용하여 안전 규칙을 우회하는 방법을 AI에게 "힌트"로 준다면, AI가 즉시 그것을 학습할 수 있음을 의미합니다.

핵심 결론: 안전성 vs 지능

이 논문은 AI 안전성을 측정하는 방식에 대해 경고하며 끝을 맺습니다.

  • 역설: 보통 우리는 AI가 똑똑하고 모든 것을 이해하기를 원합니다. 하지만 보안의 세계에서 비밀 코드를 이해하는 능력이 너무 뛰어난 것은 위험 요소가 됩니다.
  • 위험성: 만약 AI가 비밀 메시지를 "부분적으로 이해"할 수 있다면, 악의적인 행위자가 코드 안에 해로운 명령을 숨길 수 있습니다. AI가 그것을 완벽하게 해독하지 못하더라도, 그 해로운 명령을 따르기에 충분한 내용을 이해할 수 있기 때문입니다.
  • 교훈: 우리는 이 로봇들에게 주의를 가르쳐야 합니다. 암호화된 메시지의 의미를 "추측"할 수 있다고 해서, 그것에 따라 행동해서는 안 됩니다. 이 논문은 안전을 위해서, 모델들이 본 적 없는 코드를 해독하는 능력이 오히려 (새로운 코드를 접했을 때) 떨어지는 것이, 그래-서 나쁜 것들이 틈새로 새어 들어오는 것을 막을 수 있다고 제안합니다.

요약하자면: 이 똑똑한 AI 로봇들은 책을 읽는 데는 뛰어나지만, 비밀 코드에 있어서는 규칙을 알지만 규칙이 약간만 바뀌어도 혼란스러워하는 아이들과 같습니다. 무서운 점은, 그들이 속기 위해 완벽할 필요가 없다는 것입니다. 단지 그 내용을 파악할 수 있을 만큼 "충분히 잘" 이해하는 것만으로도 문제를 일으키기에 충분합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →