← 최신 논문
🤖 machine learning

Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs

이 논문은 Claude Code 기반의 'Autoresearch' 파이프라인이 기존 30 개 이상의 방법을 크게 능가하는 새로운 화이트박스 적대적 공격 알고리즘을 자동 발견하여, 다양한 LLM 모델에 대해 100% 에 가까운 공격 성공률을 달성했음을 보여줍니다.

원저자: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

게시일 2026-03-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Alexander Panfilov, Peter Romov, Igor Shilov, Yves-Alexandre de Montjoye, Jonas Geiping, Maksym Andriushchenko

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

이 논문은 **"인공지능 (AI) 이 스스로를 연구하여, 기존에 없던 더 강력한 해킹 방법을 찾아냈다"**는 놀라운 사실을 보여줍니다.

제목인 **'Claudini'**는 연구진이 만든 프로젝트 이름으로, Anthropic 의 AI 모델인 'Claude'가 스스로 코딩하고 실험하며 새로운 공격 알고리즘을 개발한 과정을 말합니다.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴겠습니다.


🏰 1. 배경: 성벽과 해커의 전쟁

마치 거대한 성벽 (LLM 모델) 이 있다고 상상해 보세요. 이 성벽은 해로운 질문이나 나쁜 명령을 막아주는 '안전 요원 (Guard)' 역할을 합니다.

  • 기존 해커들: 그동안 해커들은 성벽의 약점을 찾기 위해 다양한 도구 (GCG, TAO 등 30 가지 이상의 기존 공격법) 를 사용했습니다. 하지만 성벽이 점점 튼튼해지면서, 기존 도구로는 성벽을 뚫는 데 실패하거나 아주 낮은 확률 (10% 미만) 로만 성공했습니다.

🤖 2. 주인공 등장: "스스로 연구하는 AI" (Claudini)

연구진은 "그럼 AI 가 스스로 해커가 되어 더 좋은 도구를 만들면 어떨까?"라고 생각했습니다.

  • Claudini의 역할: Claude라는 AI 코딩 도구를 성벽 안으로 보냈습니다. 하지만 AI 는 단순히 "이렇게 해킹해줘"라고 명령받은 것이 아니라, **"기존 해킹 도구들을 분석하고, 더 좋은 해킹 알고리즘을 직접 코딩해서 만들어봐"**라고 미션을 받았습니다.
  • 작동 방식: AI 는 밤낮으로 코드를 짭니다.
    1. 기존 해킹 도구들을 분석합니다.
    2. "아, 이 방법은 여기가 약하네. 저 방법과 섞으면 어떨까?"라고 아이디어를 냅니다.
    3. 새로운 코드를 작성하고, GPU(컴퓨터) 를 돌려 실험합니다.
    4. 실패하면 다시 고치고, 성공하면 다음 단계로 넘어갑니다.
      이 과정이 수백 번 반복되며 AI 는 스스로 진화했습니다.

🚀 3. 놀라운 결과: "성벽을 뚫는 새로운 열쇠"

AI 가 찾아낸 새로운 방법들은 기존 해커들이 쓰던 모든 방법보다 훨씬 강력했습니다.

  • 비유: 기존 해커들이 성벽을 두드리거나 구멍을 뚫으려 애쓸 때, AI 는 성벽의 구조를 분석해 '성벽이 무너지는 정확한 지점'을 찾아내는 새로운 열쇠를 만들었습니다.
  • 성과:
    • 기존 방법: 성벽을 뚫는 성공률이 10% 미만.
    • AI 가 만든 방법: 성공률이 **40%~100%**까지 치솟았습니다.
    • 특히, AI 가 한 모델 (성벽) 에서 찾아낸 해킹 방법은, 전혀 다른 모델 (다른 성벽) 에도 그대로 적용되어 100% 성공하는 **'범용 해킹 도구'**가 되었습니다.

🧩 4. AI 는 어떻게 똑똑해졌을까? (핵심 전략)

AI 가 무에서 유를 창조한 것은 아닙니다. 기존에 있던 도구들을 **'레고 블록'**처럼 잘게 부수고 다시 조립했습니다.

  1. 레고 조합 (Recombination): A 라는 도구의 '모멘텀(관성)' 기능과 B 라는 도구의 '코사인 유사도' 기능을 합쳐서 더 강력한 C 라는 도구를 만들었습니다.
  2. 세밀한 튜닝 (Hyperparameter Tuning): 레고 블록의 나사 조임 정도 (학습률, 반복 횟수 등) 를 미세하게 조절하여 최적의 상태를 찾았습니다.
  3. 함정 회피 (Escape Mechanisms): AI 가 어느 지점에 갇히면 (최적해에 도달하면) 다시跳出 (탈출) 할 수 있도록 '충돌'을 일으키는 장치를 추가했습니다. 마치 미로에서 길을 잃으면 벽을 뚫고 나오는 전략을 세운 것입니다.

⚠️ 5. 경고: "AI 가 스스로 방어벽을 뚫는다면?"

이 연구는 매우 중요한 메시지를 줍니다.

  • 방어는 더 어려워진다: 우리가 만든 안전 장치는 이제 AI 가 스스로 찾아낸 해킹 기법보다 약할 수 있습니다.
  • 새로운 기준: 앞으로 새로운 AI 모델을 만들 때, "인간 해커가 뚫지 못한다"는 것만으로는 충분하지 않습니다. **"AI 연구자가 뚫지 못한다"**는 것을 증명해야 진정한 안전이라고 할 수 있습니다.

📝 요약

이 논문은 **"AI 가 스스로 연구하여, 인간이 만들었던 어떤 해킹 방법보다 더 강력하고 똑똑한 해킹 도구를 찾아냈다"**는 것을 증명한 역사적인 순간입니다.

이는 마치 AI 가 스스로 '해커 학교'를 졸업하고, 기존에 없던 새로운 '해킹 기술'을 개발해낸 것과 같습니다. 앞으로는 AI 가 방어하는 AI 와 AI 가 공격하는 AI 의 전쟁이 본격적으로 시작될 것임을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →