← Nieuwste papers
💻 computer science

DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain

Dit artikel introduceert DLT-Corpus, een grote, domeinspecifieke tekstcollectie van 2,98 miljard tokens uit wetenschappelijke literatuur, octrooien en sociale media, die wordt gebruikt om aan te tonen dat DLT-onderzoek voorafgaat aan marktgroei en om verbeterde NLP-tools zoals LedgerBERT vrij te geven.

Oorspronkelijke auteurs: Walter Hernandez Cruz, Peter Devine, Nikhil Vadgama, Paolo Tasca, Jiahua Xu

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Walter Hernandez Cruz, Peter Devine, Nikhil Vadgama, Paolo Tasca, Jiahua Xu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de wereld van Distributed Ledger Technology (DLT) – de technologiefamilie die blockchain en cryptocurrencies omvat – voor als een enorme, bruisende stad. Jarenlang moesten onderzoekers die deze stad wilden begrijpen navigeren met slechts een paar verspreide straatborden (voornamelijk over prijsgrafieken en handelsapps). Ze misten de blauwdrukken, de notulen van de gemeenteraad en het gepraat in de lokale cafés.

Dit artikel introduceert DLT-Corpus, een enorme nieuwe bibliotheek die eindelijk het "hele verhaal" van deze digitale stad verzamelt. Hier is wat de auteurs hebben gebouwd en wat ze hebben ontdekt, eenvoudig uitgelegd:

1. De Grote Bibliotheek (Het Corpus)

Zie DLT-Corpus als een gigantisch magazijn met 2,98 miljard woorden (tokens) uit 22 miljoen documenten. De auteurs hebben niet zomaar willekeurige tekst gegrepen; ze hebben het zorgvuldig georganiseerd in drie distincte secties, zoals drie verschillende vleugels van een bibliotheek:

  • De Academische Vleugel (Wetenschappelijke Literatuur): 37.440 onderzoeksartikelen. Dit zijn de "blauwdrukken" waar wetenschappers en ingenieurs voor het eerst nieuwe ideeën schetsen.
  • De Octrooivleugel: 49.023 octrooiaanvragen. Dit zijn de "juridische akten" waar bedrijven officieel eigendom opeisen van nieuwe uitvindingen.
  • Het Stadsplein (Sociale Media): 22 miljoen berichten van Twitter/X. Dit is het "gepraat" waar gewone mensen praten over wat ze kopen, verkopen en hopen.

Waarom is dit bijzonder?
Voorheen keken de meeste computerprogramma's die dit veld bestudeerden alleen naar het "Stadsplein" (sociale media) of specifieke handelsdata. Ze misten de diepgaande technische stof. Deze nieuwe bibliotheek is 8,7 keer rijker aan specifieke technische sleutelwoorden dan algemene internettekst. Het is als het vergelijken van een woordenboek met dagelijkse straattaal met een gespecialiseerde encyclopedie voor techniek; de laatste is veel beter om een computer de specifieke taal van deze industrie te leren begrijpen.

2. De "Slimme Student" (LedgerBERT)

Om te bewijzen dat deze bibliotheek nuttig is, leerden de auteurs een computermodel (een type AI genaamd LedgerBERT) om het te lezen.

  • De Test: Ze vroegen de AI om specifieke technische termen (zoals "Proof of Stake" of "Merkle Tree") in de tekst te vinden, een taak genaamd Named Entity Recognition.
  • Het Resultaat: De AI die op deze nieuwe bibliotheek was getraind, werd 23% beter in het vinden van deze termen dan standaard AI-modellen. Het leerde de "dialect" van de DLT-wereld veel sneller omdat het zo veel hoogwaardig materiaal had om te bestuderen.

3. Wat de Bibliotheek Onthulde (De Analyse)

De auteurs gebruikten deze bibliotheek om te kijken hoe ideeën door de stad reizen. Ze vonden twee fascinerende patronen:

Patroon A: De "Idee-reis"
Ze volgden drie grote concepten: Stablecoins (digitale gelden gekoppeld aan echte valuta), DEX's (gedecentraliseerde beurzen) en AMM's (geautomatiseerde handelsinstrumenten).

  • De Bevinding: Deze ideeën verschijnen bijna altijd eerst in de Academische Vleugel (onderzoeksartikelen).
  • De Reis: Jaren later verschijnen ze in de Octrooivleugel (bedrijven die proberen ze te beschermen). Uiteindelijk, veel later, exploderen ze in het Stadsplein (sociale media) waar iedereen erover begint te praten.
  • De Metafoor: Het is als een wetenschappelijke ontdekking in een laboratorium, die uiteindelijk een product wordt in een fabriek, en uiteindelijk een trend op TikTok wordt. Het onderzoek leidt de markt, niet andersom.

Patroon B: Het "Emotionele Weer"
Ze keken naar hoe mensen zich voelen over de markt (sentiment) versus hoeveel werk onderzoekers doen.

  • De Bevinding: Zelfs wanneer de markt crasht (een "crypto winter" waar prijzen dalen), blijven de mensen op sociale media overmatig optimistisch (bullish). Ze blijven de technologie prijzen, ongeacht de prijs.
  • Het Contrast: Wetenschappers en octrooihouders zijn echter meer aards. Hun werk piekt en crasht niet met het dagelijkse nieuws. In plaats daarvan groeit hun activiteit gestaag in de loop van de tijd, in lijn met de langetermijngroei van de industrie, niet met de kortetermijnstemmingsschommelingen.
  • De Cyclus: De auteurs beschrijven een "deugdelijke cyclus": Onderzoek creëert nieuwe tools \rightarrow Deze tools helpen de markt te groeien \rightarrow Een groeiende markt levert geld op om meer onderzoek te financieren.

4. De Regels van het Spel (Ethiek & Beperkingen)

De auteurs waren zeer voorzichtig met hoe ze deze bibliotheek bouwden:

  • Geen auteursrechtenschendingen: Ze gebruikten alleen open-access artikelen, publieke overheidsoctrooien en sociale mediadata die voor Twitter zijn verzameld voordat de regels in 2023 veranderden.
  • Privacy: Ze verwijderden alle gebruikersnamen uit de sociale mediaberichten om de privacy van mensen te beschermen, en hielden alleen de tekst en de datum over.
  • Taal: De bibliotheek is momenteel alleen in het Engels, aangezien dat de dominante taal is voor wetenschap en octrooien.

Samenvatting

Kortom, de auteurs bouwden de eerste enorme, uitgebreide bibliotheek voor de wereld van Distributed Ledger Technology. Ze bewezen dat als je wilt begrijpen waar deze technologie naartoe gaat, je niet alleen naar aandelenprijzen of Twitter-trends moet kijken. Je moet kijken naar de onderzoeksartikelen, want daar wordt de toekomst geschreven, jaren voordat de rest van de wereld bijhaalt. Ze hebben ook de bibliotheek, het getrainde AI-model en de tools gratis beschikbaar gesteld zodat anderen dit onderzoek kunnen voortzetten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →