DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
本論文は、科学文献、特許、ソーシャルメディアから収集された29.8億トークンの大規模なドメイン固有テキストコーパスであるDLT-Corpusを導入し、これを用いてDLT研究が市場成長に先行することを示すと同時に、LedgerBERTのような強化されたNLPツールの公開を行うものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
分散型台帳技術(DLT)の世界、つまりブロックチェーンや暗号資産を含む技術のファミリーを、巨大で賑やかな都市だと想像してみてください。長年、この都市を理解しようとしてきた研究者たちは、主に価格チャートや取引アプリに関する数少ない散在する街標識だけで案内を受けてきました。彼らは設計図も、市議会の議事録も、地元の喫茶店での雑談も欠いていました。
本論文は、このデジタル都市の「全体像」ついに集大成した大規模な新図書館「DLT-Corpus」を紹介するものです。以下に、著者が構築したものとその発見を、簡潔に説明します。
1. 大図書館(コーパス)
DLT-Corpus を、29 億 8,000 万語(トークン)に及ぶ 2200 万件の文書を含む巨大な倉庫だと考えてください。著者は単にランダムなテキストを収集したのではなく、図書館の 3 つの異なる翼のように、3 つの明確なセクションに慎重に整理しました。
- 学術翼(学術文献): 37,440 件の研究論文。これらは科学者やエンジニアが最初に新しいアイデアをスケッチする「設計図」です。
- 特許翼: 49,023 件の特許出願。これらは企業が新しい発明の所有権を公式に主張する「法的権利証書」です。
- タウンスクエア(ソーシャルメディア): Twitter/X からの 2200 万件の投稿。これらは一般の人々が何を買っているか、売っているか、何を期待しているかを語る「雑談」です。
なぜこれが特別なのか?
以前、この分野を研究するほとんどのコンピュータプログラムは、「タウンスクエア」(ソーシャルメディア)や特定の取引データしか見ていませんでした。彼らは深い技術的な内容を見過ごしていました。この新しい図書館は、一般的なインターネットテキストと比較して、特定の技術用語において 8.7 倍も豊富です。日常のスラング辞書と、工学に特化した百科事典を比較するようなもので、後者の方が、コンピュータにこの業界の特定の言語を理解させるにははるかに優れています。
2. 「賢い学生」(LedgerBERT)
この図書館が有用であることを証明するため、著者はコンピュータモデル(LedgerBERT という種類の AI)に、これを読み取るよう教えました。
- テスト: AI に、テキスト内の特定の技術用語(「プルーフ・オブ・ステーク」や「マークルツリー」など)を見つけるよう求めました。これは固有表現認識と呼ばれるタスクです。
- 結果: この新しい図書館で訓練された AI は、標準的な AI モデルよりもこれらの用語を見つける能力が 23% 向上しました。これほど高品質な資料を研究できたため、DLT 世界の「方言」を格段に速く習得しました。
3. 図書館が明らかにしたもの(分析)
著者はこの図書館を用いて、アイデアが都市内をどのように移動するかを監視しました。彼らは 2 つの興味深いパターンを発見しました。
パターン A: 「アイデアの旅」
彼らは 3 つの大きな概念を追跡しました。ステーブルコイン(実在の通貨にペグされたデジタル通貨)、DEX(分散型取引所)、AMM(自動取引ツール)です。
- 発見: これらのアイデアは、ほぼ常に学術翼(研究論文)で最初に現れます。
- 旅: 数年後、それらは特許翼(それらを保護しようとする企業)に現れます。最後に、さらに時を経て、それらがタウンスクエア(ソーシャルメディア)で爆発的に広がり、誰もが話し始めるようになります。
- 比喩: これは、実験室での科学的発見が、最終的に工場の製品となり、最後に TikTok のトレンドになるようなものです。研究が市場を先導しており、その逆ではありません。
パターン B: 「感情の天気」
彼らは、市場に対する人々の感情(センチメント)と、研究者がどれだけの作業を行っているかを比較しました。
- 発見: 市場が暴落し(価格が下落する「クリプト・ウィンター」)、人々が過度に楽観的(強気)であるときでさえ、ソーシャルメディア上の人々はそうであり続けます。彼らは価格に関係なく、技術を持ち上げ続けています。
- 対照: しかし、科学者や特許保有者はより現実的です。彼らの活動は日々のニュースとともに急騰したり急落したりしません。代わりに、彼らの活動は時間とともに着実に成長し、短期的な気分の浮き沈みではなく、業界の長期的な成長を追跡しています。
- サイクル: 著者はこれを「好循環」と表現しています。研究が新しいツールを生み出し これらのツールが市場の成長を支援し 成長する市場が、さらに多くの研究を資金提供する。
4. ゲームのルール(倫理と限界)
著者はこの図書館を構築する際、非常に慎重でした。
- 著作権侵害なし: 彼らは、オープンアクセスの論文、公的な政府特許、および 2023 年に Twitter がルールを変更する前に収集されたソーシャルメディアデータのみを使用しました。
- プライバシー: 人々のプライバシーを保護するため、ソーシャルメディアの投稿からすべてのユーザー名を削除し、テキストと日付のみを保持しました。
- 言語: 科学と特許の支配的な言語である英語であるため、この図書館は現在、英語のみで構成されています。
まとめ
要約すると、著者は分散型台帳技術の世界における最初の包括的な大規模図書館を構築しました。彼らは、この技術の行く末を理解したいのであれば、株価や Twitter のトレンドだけでなく、研究論文を見る必要があることを実証しました。なぜなら、未来は他の世界が追いつく何年も前から、そこで書かれているからです。彼らはまた、他の人々がこの研究を継続できるよう、図書館、訓練済み AI モデル、およびツールを無料で公開しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。