← 최신 논문
💻 computer science

CrypFormBench: Benchmarking Formal Analysis Capability of Large Language Models for Cryptographic Schemes

이 논문은 대규모 언어 모델이 보안 증명을 생성하고 수정하는 데 있어 현재 직면한 한계를 평가하고 드러내는 동시에, 모델의 성능을 향상시키기 위한 실질적인 전략을 제공하기 위해 677개의 암호화 체계와 7개의 형식 검증 언어에 걸친 700개의 인스턴스로 구성된 포괄적인 벤치마크인 CrypFormBench를 소개한다.

원저자: Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

게시일 2026-06-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zhaoxuan Li, Qionglu Zhang, Hengyuan Liu, Xiaoyan Gu, Xianhui Lu, Hongbo Liu, Bingzheng Wang, Haihui Fan, Ziming Zhao, Rui Zhang, Li Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

개요: "번역가" 문제

당신이 매우 안전한 금고(암호화 스킴)를 설계하는 숙련된 건축가라고 상상해 보세요. 당신은 누구나 이해할 수 있도록 영어로 설계도를 작성합니다. 하지만 이 금고의 약점을 실제로 구축하고 테스트하려면, 특정 하이테크 보안 로봇(Scyther나 Tamarin 같은 형식 검증 도구)만이 이해할 수 있는 매우 엄격하고 고대적인 언어로 그 설계도를 번역해야 합니다.

이 번역 작업은 매우 어렵습니다. 금고 설계와 로봇의 엄격한 언어를 모두 알고 있는 전문가가 필요합니다. 만약 쉼표 하나를 놓치거나 단어 하나를 잘못 사용하면, 로봇은 설계도를 거부하거나, 더 심각하게는 겉보기에는 안전해 보이지만 숨겨진 백도어가 있는 금고를 만들어 버릴 수도 있습니다.

질문: 거대 언어 모델(LLM)—우리가 오늘날 사용하는 AI 챗봇들—이 이러한 전문 번역가 역할을 할 수 있을까요? 평범한 영어로 된 보안 프로토콜 설명을 듣고, 보안 로봇을 위한 완벽하고 오류 없는 코드를 즉시 작성할 수 있을까요?

답변 (이 논문에 따르면): 아직은 아닙니다. 읽고 수정하는 능력은 좋아지고 있지만, 처음부터 직접 쓰는 것에는 여전히 어려움을 겪고 있습니다.


해결책: CrypFormBench ("AI를 위한 체육관")

이 AI 번역가들이 얼마나 뛰어난지 정확히 알아내기 위해, 연구진들은 CrypFormBench(또는 C.F.B)라고 불리는 거대한 테스트장을 구축했습니다.

이것은 700개의 서로 다른 운동 스테이션이 있는 체육관이라고 생각하면 됩니다.

  • 장비: 연구진은 700개의 실제 세계 보안 프로토콜(당신의 휴대폰, 은행, 또는 인터넷에서 사용되는 것들)을 모았습니다.
  • 언어: 이 프로토콜들을 7가지의 "로봇 언어"(SPDL, HLPSL, EasyCrypt 등과 같은 형식 언어)로 번역했습니다.
  • 테스트: 단순히 AI에게 코드를 쓰라고 시킨 것이 아닙니다. 그들은 다섯 가지 특정 기술을 테스트했습니다:
    1. 해석 (Interpretation): "여기 로봇 코드가 있습니다. 이것을 영어로 설명해 주세요." (읽기)
    2. 생성 (Generation): "여기 영어 설명이 있습니다. 로봇 코드를 작성하세요." (처음부터 쓰기)
    3. 완성 (Completion): "여기에 구멍이 뚫린 로봇 코드가 있습니다. 빈칸을 채우세요." (부분적인 작업 수정하기)
    4. 변환 (Transformation): "여기에 언어 A의 코드가 있습니다. 이를 언어 B로 다시 쓰세요." (로봇 간의 언어 번역)
    5. 교정 (Correction): "이 로봇 코드에 오류가 있습니다. 수정하세요." (디버깅)

결과: AI의 성적표

연구진은 가장 똑똑한 9개의 AI 모델(GPT-4o, Claude-3.5, DeepSeek 포함)을 테스트했습니다. 결과는 다음과 같습니다.

1. "읽기 능력" (해석 및 완성)

  • 비유: 교과서를 잘 읽고, 문맥이 이미 존재하기 때문에 문장의 빠진 단어를 채울 수 있는 학생을 상상해 보세요.
  • 결과: AI는 놀라울 정도로 이 작업에 능숙했습니다. 코드 조각이 일부 누락되었거나 코드의 일부가 무엇을 하는지 설명하라는 요청을 받았을 때, 성능이 매우 좋았습니다. 그들은 보안 언어의 "문법"을 이해하고 있었습니다.

2. "쓰기 능력" (생성 및 변환)

  • 비유: 이제 그 똑같은 학생에게 완전히 새로운 교과서를 처음부터 쓰거나, 사전 없이 프랑스어를 일본어로 번역하라고 시킨다고 상상해 보세요. 학생은 환각 현상을 일으키거나, 규칙을 지어내거나, 엄격한 문법을 잊어버리기 시작할 것입니다.
  • 결과: 이 부분이 AI가 실패한 지점입니다.
    • 생성: 평범한 영어 설명으로부터 전체 보안 프로토콜을 작성하라는 요청을 받았을 때, 대부분의 AI는 로봇이 실행조차 할 수 없는 코드를 생성했습니다. 이는 마치 문법이 깨진 문장을 쓰는 것과 같았습니다.
    • 변환: 한 로봇 언어에서 다른 로봇 언어로 코드를 번역하라는 요청을 받았을 때, AI는 자주 혼란을 겪었습니다. 그들은 두 언어의 규칙을 뒤섞어, 어느 쪽에서도 작동하지 않는 "프랑켄슈타인" 코드를 만들어냈습니다.
    • 점수: 가장 뛰어난 AI인 Claude-3.5조차 100점 만점에 48.7점을 받았습니다. 이는 그들의 시도 중 절반 미만이 실제로 보안 도구에서 사용 가능하다는 것을 의미합니다.

3. "수정 능력" (교정)

  • 비유: 만약 학생에게 명확한 오타(예: "receive" 대신 "recieve")가 있는 문장을 준다면, 그들은 쉽게 고칠 수 있습니다. 하지만 문장이 문법적으로는 맞지만 논리적으로 틀린 경우(예: "금고는 모든 이에게 열려 있지만, 안전하다"), 그들은 논리적 오류를 찾는 데 어려움을 겪습니다.
  • 결과: AI는 단순한 구문 오류(오타)를 고치는 데는 능숙했습니다. 그러나 "의미론적(semantic)" 오류, 즉 보안 프로토콜 자체의 논리적 오류를 고치는 데는 어려움을 겪었습니다.

왜 이렇게 어려운가요?

이 논문은 이 "로봇 언어"들이 Python이나 Java와는 다르다는 점을 설명합니다. 이들은 극도로 엄격합니다.

  • "단 하나의 실수" 규칙: 일반적인 코딩에서는 세미콜론 하나를 빠뜨려도 컴퓨터가 그냥 불평하고 넘어갈 수 있습니다. 하지만 이러한 보안 언어에서는 단 하나의 단어 누락이 전체 보안 증명의 의미를 바꾸어, 안전한 금고를 불안전하게 보이게 하거나 그 반대로 만들 수 있습니다.
  • "문맥" 문제: 이러한 프로토콜은 종종 긴 사건의 사슬에 의존합니다 (예: "만약 앨리스가 단계 1에서 메시지를 보냈다면, 밥은 단계 2에서 답장을 보내야 하지만, 이는 그가 단계 0의 메시지를 보지 않았을 때만 가능하다"). AI는 이러한 긴 사슬을 놓치곤 합니다.

무엇을 할 수 있을까요? ("보조 바퀴")

논문은 우리가 아직 AI에게 전체 작업을 맡길 수는 없지만, 적절한 도움을 준다면 조수로 사용할 수 있다고 제안합니다.

  • 퓨샷 프롬프팅 (Few-Shot Prompting): 단순히 "이것을 써라"라고 말하는 대신, 먼저 어떻게 쓰는지에 대한 세 가지 예시를 보여주세요. 이것은 치트 시트(컨닝 페이퍼) 역할을 합니다.
  • Pass@K: AI에게 코드를 5번 시도하게 한 다음, 가장 좋은 것을 선택하게 하세요. 이는 작동하는 버전을 얻을 확률을 높여줍니다.
  • 인간 참여형 (Human-in-the-Loop): AI가 코드를 초안 작성하게 하되, 보안 로봇이 실행하기 전에 인간 전문가가 검토하도록 합니다.

결론

이 논문은 거대 언어 모델이 현재 보안 코드를 이해하고 수정하는 데 있어서는 훌륭한 연구 조수이지만, 처음부터 새로운 보안 프로토콜을 구축하는 신뢰할 수 있는 설계자는 아직 아니라고 결론짓습니다.

그들은 당신이 매뉴얼을 읽고 오타를 고치는 것을 도와줄 수는 있지만, 당신이 열쇠를 넘겨주기 전에 금고가 실제로 안전한지 확인하기 위해서는 여전히 인간 전문가가 필요합니다. 이 벤치마크(CrypFormBench)는 다른 연구자들이 새로운 AI 모델을 이 엄격한 기준에 따라 테스트할 수 있도록 공개되어 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →