TM-RUGPULL: A Temporary Sound, Multimodal Dataset for Early Detection of RUG Pulls Across the Tokenized Ecosystem
Het artikel introduceert TM-RugPull, een zorgvuldig samengesteld, multimodaal dataset van 1.028 tokenprojecten die is ontworpen om gegevenslekken en modaliteitsbeperkingen in bestaande bronnen te overwinnen, en zo een nieuwe benchmark vaststelt voor de vroege detectie van rug-pull-oplichting in het getokeniseerde ecosysteem.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van cryptocurrency voor als een enorme, bruisende digitale markt. Op deze markt creëren mensen nieuwe "tokens" (digitale munten) om aan investeerders te verkopen. Soms zijn de makers eerlijk en bouwen ze iets waardevols. In andere gevallen zijn het oplichters die een "Rug Pull" uitvoeren.
Denk aan een Rug Pull als een kermisexploitant die een kraam opzet, het geld van iedereen inpant en vervolgens plotseling het tapijt onder de spelers vandaan rijt en wegrent met het contante geld voordat iemand beseft dat het spel trucage is.
Het document dat je hebt gedeeld, TM-RugPull, gaat over het bouwen van een betere "trainingshandleiding" voor computers om deze oplichters voordat ze wegrennen te spotten. Hier is de uiteenzetting in eenvoudige bewoordingen:
Het Probleem: De "Terugwaartse" Trainingshandleiding
Op dit moment zijn de tools die computers gebruiken om oplichters te vinden, gebrekkig. Het is alsof je probeert een beveiliger te leren een dief te herkennen door hem foto's te tonen van de dief nadat hij het geld al heeft gestolen en is gevlucht.
- Het Gebrek: Oude datasets gebruiken aanwijzingen die pas na de oplichting verschijnen (zoals de instortende prijs of het verdwijnen van het geld).
- Het Resultaat: Computers die op deze data zijn getraind denken dat ze goed zijn in het voorspellen van oplichting, maar in de echte wereld falen ze omdat ze kijken naar aanwijzingen die pas bestaan als het te laat is. Ze kijken bovendien meestal alleen naar één type project (DeFi), waardoor ze oplichting in memes, games of celebrity-tokens missen.
De Oplossing: De "Tijdsreizen"-Dataset
De auteurs hebben een nieuwe dataset gecreëerd genaamd TM-RugPull. Ze hebben deze ontworpen volgens een strikte tijdsreisregel: "Je mag alleen kijken naar informatie die beschikbaar is voordat de ramp gebeurt."
Hier is hoe ze het hebben opgebouwd:
1. Een Divers Publiek (De 1.000 Projecten)
In plaats van alleen te kijken naar serieuze financiële applicaties, hebben ze 1.000 verschillende projecten verzameld. Stel je een rij voor die bestaat uit:
- Serieuze financiële applicaties (DeFi).
- Grappige internetgrappen (Meme-tokens).
- Digitale kunst en games (NFT's).
- Celebrity-gebrande munten.
Dit zorgt ervoor dat de computer leert omlichters te spotten in elk type digitaal project, niet alleen de serieuze.
2. De "Middelpunt"-Regel (Stoppen met Tijdslekkage)
Om ervoor te zorgen dat de computer niet cheat door naar de toekomst te kijken, hebben de auteurs een specifiek "Middelpunt" in de tijd gekozen voor elk project.
- De Regel: De computer mag alleen data zien uit de eerste helft van de levensduur van het project (voor het middelpunt).
- De Check: Als het project later een oplichting blijkt te zijn, wordt de computer alleen beoordeeld op basis van of het had kunnen voorspellen met alleen de vroege aanwijzingen. Als de computer een aanwijzing gebruikte die na het begin van de oplichting verscheen, wordt het gediskwalificeerd. Dit noemen we het voorkomen van "temporale lekkage".
3. Drie Ogen op de Markt (Multimodale Data)
Om een volledig beeld te krijgen, bekijkt de dataset de projecten tegelijkertijd door drie verschillende "lenzen":
- Lens 1: On-Chain Gedrag: Het volgen van de daadwerkelijke beweging van geld en tokens op de blockchain (zoals het kijken naar de kassa).
- Lens 2: Smart Contract Metadata: Het lezen van de "regels" die in de code zelf zijn geschreven (zoals het lezen van de kleine lettertjes van een contract).
- Lens 3: OSINT (Open Source Intelligence): Het controleren van sociale media, Google-zoekopdrachten en nieuws (zoals het luisteren naar het gerucht in het dorpsplein).
- Waarom dit belangrijk is: Vaak beginnen mensen over een oplichting te praten op Twitter of Google voordat het geld daadwerkelijk verdwijnt op de blockchain. Deze dataset vangt die vroege fluisteringen op.
4. Het Menselijke Detectiveteam (Handmatige Labeling)
De auteurs hebben niet zomaar een computer laten beslissen wie een oplichter is. Ze hebben een team van menselijke experts ingezet.
- Het Proces: Ze hebben projecten 72 uur lang gevolgd nadat er iets mis was gegaan. Als de liquiditeit verdween, de activiteit stopte en de prijs bevriest, labelden ze het als een "Rug Pull".
- Het Veiligheidsnet: Ze hebben dit dubbelgecontroleerd tegen bekende oplichtingsdatabases en hadden twee experts nodig die het eens waren over het vonnis om ervoor te zorgen dat er geen fouten werden gemaakt.
Het Resultaat
Het document presenteert een schone, eerlijke en diverse trainingsset voor AI.
- Het bevat 1.000 projecten (ongeveer 60% oplichters, 40% eerlijk).
- Het behandelt 5 verschillende blockchains (zoals Ethereum en Binance).
- Het verbiedt strikt "cheaten" door gebruik te maken van toekomstinformatie.
Kortom: De auteurs hebben een "vluchtsimulator" voor AI-beveiligers gebouwd. In plaats van hen te trainen op video's van crashes die al gebeurd zijn, hebben ze hen getraind op de pre-crash signalen zodat de bewakers het vliegtuig daadwerkelijk kunnen laten crashen. Ze hebben deze simulator en de code om het te bouwen beschikbaar gesteld voor iedereen om te gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.