← 최신 논문
💻 computer science

Enhancing Smart Contract Vulnerability Detection in DApps Leveraging Fine-Tuned LLM

본 논문은 215개의 실제 DApp 프로젝트로 구성된 포괄적인 데이터셋을 통해 미세 조정된 거대 언어 모델(Llama3-8B 및 Qwen2-7B)을 활용하여, 기존 도구들이 흔히 놓치는 토큰 가격 조작과 같은 복잡한 논리적 오류를 탐지하는 능력을 유의미하게 향상시키는 새로운 접근 방식을 제안한다.

원저자: Jiuyang Bu, Wenkai Li, Zongwei Li, Zeng Zhang, Xiaoqi Li

게시일 2026-02-03
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jiuyang Bu, Wenkai Li, Zongwei Li, Zeng Zhang, Xiaoqi Li

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

스마트 컨트랙트를 블록체인 상에 존재하는 디지털 자판기로 상상해 보세요. 일단 돈을 넣으면, 프로그래밍된 규칙에 따라 자동으로 음료수(또는 디지털 토큰)를 내어줍니다. 문제는 프로그래머가 코드에 실수를 했다면, 기계가 공짜 음료를 내주거나, 돈을 훔치거나, 혹은 영원히 멈춰버릴 수도 있다는 점입니다. 이 기계들은 "불변성(immutable)"을 가지고 있어서(한 번 구축되면 규칙을 바꿀 수 없음), 가동하기 전에 이러한 실수를 찾아내는 것이 매우 중요합니다.

이 논문은 이 자판기들이 문을 열기 전에 결함을 점검할 초지능형 보안 요원을 구축하는 것에 관한 내용입니다.

문제점: 구식 경비원 vs 새로운 기술

전통적으로 보안 요원들은 "규칙집"(정적 분석 도구)을 사용했습니다. 그들은 "바닥에 구멍이 있는가?" 또는 "문이 잠겨 있는가?"와 같이 이미 알려진 특정 실수들을 찾아냈습니다.

  • 문제점: 해커들은 점점 더 영리해지고 있습니다. 그들은 단순히 잠금장치를 부수는 것이 아니라, 기묘한 논리적 허점을 찾아냅니다. 예를 들어, "만약 내가 오전 9시에 토큰을 사고 9시 1분에 판다면, 기계가 가격이 실제보다 높다고 착각하게 만들 수 있을까?"와 같은 방식입니다.
  • 한계: 기존의 규칙집들은 이러한 복잡한 논리적 속임수를 볼 수 없습니다. 이는 마치 깨진 창문을 확인하는 법은 알지만, 도둑이 어떻게 자물쇠를 따는지에 대해서는 이해하지 못하는 경비원과 같습니다.

해결책: "특화된" AI 경비원

저자들은 인간의 언어와 코드를 읽고 이해하는 데 매우 뛰어난 유형의 AI인 **대규모 언로 모델(LLM)**을 사용하기로 했습니다. 일반적인 LLM을 일반론적인 사서라고 생각해 보세요. 그들은 모든 것에 대해 많이 알고 있지만, "블록체인 보안"을 특별히 공부하지는 않았습니다.

만약 일반적인 사서에게 "이 코드가 안전한가요?"라고 묻는다면, 그들은 추측은 할 수 있겠지만 자주 틀릴 것입니다. 왜냐하면 특정 보안 사례를 충분히 접해보지 못했기 때문입니다.

저자들의 혁신: 단순히 사서에게 추측하라고 시키는 대신, 그들은 사서에게 방대한 양의 실제 블록체인 재난 사례를 바탕으로 특화 교육을 시켰습니다. 즉, 일반론적인 사서를 특화된 보안 전문가로 탈바ф시킨 것입니다.

그들은 어떻게 전문가를 만들었나

  1. 학습 데이터 (The "Case Files"):
    이전의 대부분의 연구는 아주 작고 단순한 코드 예시(예: 40줄짜리 스크립트)를 사용했습니다. 이는 보안 요원을 장난감 자판기로 훈련시키는 것과 같습니다.
  • 그들이 한 일: 팀은 거의 5,000개의 컨트랙트를 포함하는 215개의 실제 프로젝트를 수집했습니다. 심지어 토큰 가격 조작(해커가 돈의 가치를 바꾸도록 시스템을 속이는 행위)과 같이 탐지하기 까다롭고 어려운 "논리적 오류"까지 포함했습니다.
  • 도구: 그들은 "SmartCollect"라는 로봇 도구를 만들어, 실제 앱을 구성하는 복잡하고 서로 연결된 파일들을 모두 수집했습니다. 이를 통해 AI가 단편적인 조각이 아닌 전체 그림을 볼 수 있도록 했습니다.
  1. 불균형 해결 (The "Rare Disease" Problem):
    현실 세계에서는 대부분의 코드가 안전하며, 깨진 코드는 아주 적습니다. 이는 의사가 환자의 99%가 건강한 상태에서 희귀 질환을 진단하는 법을 배우려는 것과 같습니다. AI는 혼란을 느껴 안전하게 가기 위해 그냥 "모두 괜찮습니다"라고 말해버릴 수 있습니다.
  • 해결책: 그들은 **무작위 과표집(Random Over Sampling, ROS)**이라는 기술을 사용했습니다. "고장 난 기계"의 몇 안 되는 사례들을 복사하여 AI가 "정상 작동하는 기계"만큼 자주 보게 만드는 것입니다. 이는 AI가 결함에 집중하도록 강제합니다.
  1. 학습 방법 (두 가지 교육 방식):
  • 전체 파라미터 미세 조정 (Full-Parameter Fine-Tuning, FFT): 이것은 AI의 뇌 전체를 다시 쓰는 것과 같습니다. 매우 무겁고 많은 에너지가 들지만, AI를 진정한 전문가로 만듭니다.
  • LoRA (Low-Rank Adaptation): 이것은 AI의 기존 뇌에 특화된 노트 하나를 추가하는 것과 같습니다. 더 가볍고 빠르지만, 논문에서는 이것이 전체를 다시 쓰는 방식만큼 까다로운 버그를 잡아내는 데 효과적이지 않다는 것을 발견했습니다.
  1. "이중 감사(Dual Audit)" 시스템:
    AI는 단순히 추측만 하지 않습니다. AI는 두 가지 역할을 수행합니다.
  • 감사자(Auditor): 코드를 보고 "여기에 문제가 있는 것 같다"라고 말합니다.
  • 검증자(Verifier): 감사자의 작업을 재확인하여 그것이 단순히 환각(hallucination) 현상이 아닌지 확인합니다.

결과: 효과가 있었는가?

논문은 그들의 특화된 AI를 "일반론적인" AI(질문만 던지는 경우) 및 다른 보안 도구들과 비교합니다.

  • 일반론적인 AI: 약 **20%**의 확률로만 정답을 맞혔습니다. 대부분 추측에 불과했습니다.
  • 특화된 AI (전체 학습 적용 시): 약 **83%**의 확률(F1-score)로 정답을 맞혔습니다.
  • 경쟁 상대 압도: 그들의 방식은 다른 최고 수준의 도구들(GPTLENS 및 GPTSCAN 등)보다 뛰어났습니다.
  • "감사 불가능한 영역"에서의 승리: 가장 큰 승리는 가격 조작 결함을 잡아낸 것이었습니다. 이것은 컴퓨터가 보통 놓치는 "논리적 오류"입니다. 그들의 AI는 이러한 오류를 **97%의 정밀도(precision)**로 잡아냈습니다 (즉, "이것은 고장 났다"라고 말했을 때, 거의 항상 옳았습니다).

핵심 요약

이 논문은 가장 똑똑한 해커를 잡기 위해서는 단순히 일반적인 AI나 단순한 규칙집을 사용해서는 안 된다고 주장합니다. 강력한 AI를 가져와서, 실제 세계의 복잡하고 지저кси한 코드를 대량으로 먹이고, 인간과 기존 컴퓨터가 놓치는 미묘하고 논리적인 속임수를 찾아내도록 특별히 훈련시켜야 합니다. 이렇게 함으로써, 그들은 탈중앙화 애플리케이션(DApp) 세계를 위한 훨씬 더 신뢰할 수 있는 보안 요원을 만들어냈습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →