DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
Dieser Beitrag stellt das DLT-Corpus vor, eine groß angelegte, domänenspezifische Textsammlung mit 2,98 Milliarden Tokens aus wissenschaftlicher Literatur, Patenten und sozialen Medien, die genutzt wird, um nachzuweisen, dass die DLT-Forschung dem Marktwachstum vorausgeht, und um erweiterte NLP-Tools wie LedgerBERT bereitzustellen.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich die Welt der Distributed-Ledger-Technologie (DLT) – die Familie von Technologien, zu der Blockchain und Kryptowährungen gehören – als eine massive, geschäftige Stadt vor. Jahrelang mussten Forscher, die diese Stadt verstehen wollten, sich nur mit wenigen verstreuten Straßenschildern (meist über Preisdiagramme und Handels-Apps) orientieren. Ihnen fehlten die Baupläne, die Protokolle der Stadtratssitzungen und das Gemurmel in den lokalen Cafés.
Dieser Beitrag stellt DLT-Corpus vor, eine riesige neue Bibliothek, die endlich die „gesamte Geschichte" dieser digitalen Stadt zusammenfasst. Hier ist, was die Autoren aufgebaut haben und was sie entdeckt haben, einfach erklärt:
1. Die große Bibliothek (Das Korpus)
Stellen Sie sich das DLT-Corpus als ein riesiges Lagerhaus vor, das 2,98 Milliarden Wörter (Tokens) aus 22 Millionen Dokumenten enthält. Die Autoren haben nicht einfach zufälligen Text gesammelt; sie haben ihn sorgfältig in drei verschiedene Abschnitte gegliedert, wie drei verschiedene Flügel einer Bibliothek:
- Der akademische Flügel (Wissenschaftliche Literatur): 37.440 Forschungsarbeiten. Dies sind die „Baupläne", in denen Wissenschaftler und Ingenieure zuerst neue Ideen skizzieren.
- Der Patentflügel: 49.023 Patentanmeldungen. Dies sind die „rechtlichen Urkunden", in denen Unternehmen offiziell das Eigentum an neuen Erfindungen beanspruchen.
- Der Marktplatz (Soziale Medien): 22 Millionen Beiträge von Twitter/X. Dies ist das „Gemurmel", in dem normale Menschen darüber sprechen, was sie kaufen, verkaufen und worauf sie hoffen.
Warum ist das besonders?
Davor betrachteten die meisten Computerprogramme, die dieses Feld studierten, nur den „Marktplatz" (soziale Medien) oder spezifische Handelsdaten. Sie verpassten die tiefgreifenden technischen Aspekte. Diese neue Bibliothek ist in spezifischen technischen Schlüsselwörtern 8,7-mal reicher als allgemeiner Internettext. Es ist wie der Vergleich eines Wörterbuchs alltäglicher Slangausdrücke mit einer spezialisierten Enzyklopädie für Ingenieurwesen; letztere ist viel besser geeignet, einem Computer beizubringen, die spezifische Sprache dieser Branche zu verstehen.
2. Der „kluge Schüler" (LedgerBERT)
Um zu beweisen, dass diese Bibliothek nützlich ist, brachten die Autoren einem Computermodell (eine Art KI namens LedgerBERT) bei, sie zu lesen.
- Der Test: Sie baten die KI, spezifische Fachbegriffe (wie „Proof of Stake" oder „Merkle Tree") im Text zu finden, eine Aufgabe namens Named Entity Recognition.
- Das Ergebnis: Die KI, die auf dieser neuen Bibliothek trainiert wurde, war 23 % besser darin, diese Begriffe zu finden als Standard-KI-Modelle. Sie lernte den „Dialekt" der DLT-Welt viel schneller, weil sie so viel hochwertiges Material zum Studium hatte.
3. Was die Bibliothek enthüllte (Die Analyse)
Die Autoren nutzten diese Bibliothek, um zu beobachten, wie Ideen durch die Stadt wandern. Sie entdeckten zwei faszinierende Muster:
Muster A: Die „Ideen-Reise"
Sie verfolgten drei große Konzepte: Stablecoins (digitales Geld, das an reale Währungen gekoppelt ist), DEXs (dezentrale Börsen) und AMMs (automatisierte Handelstools).
- Die Erkenntnis: Diese Ideen erscheinen fast immer zuerst im akademischen Flügel (Forschungsarbeiten).
- Die Reise: Jahre später tauchen sie im Patentflügel auf (Unternehmen versuchen, sie zu schützen). Schließlich, viel später, explodieren sie im Marktplatz (soziale Medien), wo alle beginnen, darüber zu sprechen.
- Die Metapher: Es ist wie eine wissenschaftliche Entdeckung in einem Labor, die schließlich zu einem Produkt in einer Fabrik wird und schließlich zu einem Trend auf TikTok. Die Forschung führt den Markt, nicht umgekehrt.
Muster B: Das „emotionale Wetter"
Sie untersuchten, wie sich die Menschen über den Markt fühlen (Sentiment) im Vergleich dazu, wie viel Arbeit Forscher leisten.
- Die Erkenntnis: Selbst wenn der Markt einbricht (ein „Krypto-Winter", in dem die Preise fallen), bleiben die Menschen in den sozialen Medien übermäßig optimistisch (bullish). Sie sprechen weiterhin positiv über die Technologie, unabhängig vom Preis.
- Der Kontrast: Die Wissenschaftler und Patentinhaber sind jedoch bodenständiger. Ihre Arbeit schwankt nicht mit den täglichen Nachrichten. Stattdessen wächst ihre Aktivität stetig im Laufe der Zeit und spiegelt das langfristige Wachstum der Branche wider, nicht die kurzfristigen Stimmungsschwankungen.
- Der Zyklus: Die Autoren beschreiben einen „positiven Kreislauf": Forschung schafft neue Werkzeuge Diese Werkzeuge helfen dem Markt zu wachsen Ein wachsender Markt stellt Geld bereit, um mehr Forschung zu finanzieren.
4. Die Regeln des Spiels (Ethik & Grenzen)
Die Autoren waren sehr sorgfältig beim Aufbau dieser Bibliothek:
- Keine Urheberrechtsverletzungen: Sie verwendeten nur Open-Access-Publikationen, öffentliche Regierungspatente und Social-Media-Daten, die vor dem Regelwechsel von Twitter im Jahr 2023 gesammelt wurden.
- Datenschutz: Sie entfernten alle Benutzernamen aus den Social-Media-Beiträgen, um die Privatsphäre der Menschen zu schützen, und behielten nur den Text und das Datum bei.
- Sprache: Die Bibliothek ist derzeit nur auf Englisch, da dies die dominierende Sprache für Wissenschaft und Patente ist.
Zusammenfassung
Kurz gesagt bauten die Autoren die erste massive, umfassende Bibliothek für die Welt der Distributed-Ledger-Technologie. Sie bewiesen, dass man, wenn man verstehen will, wohin diese Technologie geht, nicht nur die Aktienkurse oder Twitter-Trends betrachten sollte. Man muss die Forschungsarbeiten betrachten, denn dort wird die Zukunft Jahre bevor der Rest der Welt aufholt geschrieben. Sie veröffentlichten auch die Bibliothek, das trainierte KI-Modell und die Werkzeuge kostenlos, damit andere diese Forschung fortsetzen können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.