← 최신 논문
💻 computer science

TM-RUGPULL: A Temporary Sound, Multimodal Dataset for Early Detection of RUG Pulls Across the Tokenized Ecosystem

본 논문은 기존 자료의 데이터 누출과 모달리티 한계를 극복하도록 설계된 1,028 개 토큰 프로젝트로 구성된 엄격하게 선별된 멀티모달 데이터셋인 TM-RugPull 을 소개함으로써 토큰화 생태계 전반에서 rug-pull 사기의 조기 탐지를 위한 새로운 벤치마크를 확립합니다.

원저자: Fatemeh Shoaei, Mohammad Pishdar, Mozafar Bag-Mohammadi, Mojtaba Karami, Bert Lagaisse

게시일 2026-05-13
📖 3 분 읽기☕ 가벼운 읽기

원저자: Fatemeh Shoaei, Mohammad Pishdar, Mozafar Bag-Mohammadi, Mojtaba Karami, Bert Lagaisse

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

가상화폐의 세계를 거대하고 붐비는 디지털 시장으로 상상해 보세요. 이 시장에서는 사람들이 투자자에게 판매할 새로운 "토큰"(디지털 코인) 을 만듭니다. 때로는 제작자들이 정직하게 가치 있는 무언가를 구축하기도 하지만, 다른 경우에는 사기꾼들이 **"러그 풀 (Rug Pull)"**을 저지르기도 합니다.

러그 풀을 생각할 때는 카니발 게임 운영자를 떠올려 보세요. 부스를 차리고 모든 사람의 돈을 받은 뒤, 게임이 조작되었다는 사실을 아무도 깨닫지 못하게 하는 순간 플레이어들 발밑의 카펫을 갑자기 찢어내고 현금을 들고 도망치는 것입니다.

공유하신 논문인 TM-RugPull은 컴퓨터가 사기꾼들이 도망치기 전에 이를 식별할 수 있도록 더 나은 "훈련 매뉴얼"을 구축하는 것에 관한 것입니다. 이를 간단한 용어로 설명하면 다음과 같습니다.

문제: "거꾸로" 된 훈련 매뉴얼

현재 사기꾼을 찾아내는 데 사용되는 컴퓨터 도구들은 결함이 있습니다. 이는 도둑이 돈을 훔쳐 도망친 의 사진을 보여 주며 보안 요원에게 도둑을 식별하도록 가르치려는 것과 같습니다.

  • 결함: 기존 데이터셋은 사기가 완료된 에만 나타나는 단서들 (가격 폭락이나 자금 실종 등) 을 활용합니다.
  • 결과: 이 데이터로 훈련된 컴퓨터들은 사기 예측에 뛰어나다고 생각하지만, 실제 세계에서는 실패합니다. 왜냐하면 너무 늦을 때까지 존재하지 않는 단서들을 보고 있기 때문입니다. 또한 대부분 디파이 (DeFi) 라는 한 가지 유형의 프로젝트만 살펴봄으로써 밈, 게임, 유명인 토큰에서의 사기를 놓치고 있습니다.

해결책: "시간 여행" 데이터셋

저자들은 TM-RugPull이라는 새로운 데이터셋을 만들었습니다. 이는 "재앙 발생 에 이용 가능한 정보만 볼 수 있다"는 엄격한 시간 여행 규칙처럼 설계되었습니다.

구축 방식은 다음과 같습니다.

1. 다양한 군중 (1,000 개 프로젝트)
진지한 금융 앱만 보는 대신, 1,000 개의 다양한 프로젝트를 수집했습니다. 마치 다음과 같은 라인업을 상상해 보세요:

  • 진지한 금융 앱 (DeFi).
  • 재미있는 인터넷 농담 (밈 토큰).
  • 디지털 아트와 게임 (NFT).
  • 유명인 브랜드 코인.
    이를 통해 컴퓨터는 진지한 프로젝트뿐만 아니라 어떤 유형의 디지털 프로젝트에서도 사기꾼을 식별하도록 학습합니다.

2. "중간점" 규칙 (시간 누출 방지)
컴퓨터가 미래를 미리 보는 식으로 속이지 않도록 하기 위해, 저자들은 모든 프로젝트에 대해 시간상의 특정 "중간점"을 선정했습니다.

  • 규칙: 컴퓨터는 프로젝트 생애의 전반부(중간점 이전) 데이터만 볼 수 있습니다.
  • 점검: 프로젝트가 나중에 사기인 것으로 밝혀지더라도, 컴퓨터는 오직 초기 단서들만 사용하여 이를 예측할 수 있었는지에 대해서만 평가받습니다. 만약 컴퓨터가 사기가 시작된 에 나타난 단서를 사용했다면 자격이 박탈됩니다. 이를 "시간적 누출 (temporal leakage)" 방지라고 합니다.

3. 시장을 바라보는 세 가지 눈 (다중 모달 데이터)
완전한 그림을 얻기 위해 이 데이터셋은 세 가지 다른 "렌즈"를 통해 프로젝트를 동시에 살펴봅니다:

  • 렌즈 1: 온체인 행동: 블록체인상의 실제 자금 및 토큰 이동을 관찰하는 것 (현금 등록기를 지켜보는 것과 같음).
  • 렌즈 2: 스마트 계약 메타데이터: 코드 자체에 작성된 "규칙"을 읽는 것 (계약서의 조항을 읽는 것과 같음).
  • 렌즈 3: OSINT (오픈 소스 인텔리전스): 소셜 미디어, 구글 검색, 뉴스를 확인하는 것 (광장의 소문을 듣는 것과 같음).
  • 중요성: 종종 사람들이 블록체인에서 자금이 실제로 사라지기 에 트위터나 구글에서 사기에 대해 이야기하기 시작합니다. 이 데이터셋은 그러한 초기의 속삭임들을 포착합니다.

4. 인간 탐정 팀 (수동 라벨링)
저자들은 컴퓨터에게 누가 사기꾼인지 결정하도록 맡기지 않았습니다. 대신 전문가 팀을 활용했습니다.

  • 과정: 문제가 발생한 후 72 시간 동안 프로젝트를 관찰했습니다. 유동성이 사라지고 활동이 멈추며 가격이 동결되면 이를 "러그 풀"로 표시했습니다.
  • 안전망: 알려진 사기 데이터베이스와 대조하여 이중 확인을 거쳤으며, 두 명의 전문가가 판결과정에 동의하도록 하여 실수가 없도록 했습니다.

결과

이 논문은 AI 를 위한 깨끗하고 정직하며 다양한 훈련 데이터셋을 제시합니다.

  • 약 60% 가 사기꾼이고 40% 가 정직한 1,000 개 프로젝트를 포함합니다.
  • 이더리움과 바이낸스 등 5 개의 서로 다른 블록체인을 다룹니다.
  • 미래 정보를 사용하여 "속임수"를 치는 것을 엄격히 금지합니다.

간단히 말해: 저자들은 AI 보안 요원들을 위한 "비행 시뮬레이터"를 구축했습니다. 이미 일어난 추락 영상을 바탕으로 훈련하는 대신, 추락 전 신호들을 바탕으로 훈련하여 경비원들이 실제로 비행기가 추락하는 것을 막을 수 있도록 했습니다. 그들은 이 시뮬레이터와 이를 구축하는 코드를 누구나 사용할 수 있도록 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →