DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
Este artigo apresenta o DLT-Corpus, uma coleção de texto em larga escala e específica de domínio composta por 2,98 bilhões de tokens provenientes de literatura científica, patentes e mídias sociais, a qual é utilizada para demonstrar que a pesquisa em DLT antecede o crescimento do mercado e para lançar ferramentas aprimoradas de PNL como o LedgerBERT.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine o mundo da Tecnologia de Ledger Distribuído (DLT)—a família de tecnologias que inclui blockchain e criptomoedas—como uma cidade massiva e movimentada. Por anos, pesquisadores tentando entender essa cidade tiveram que navegar usando apenas alguns sinais de rua esparsos (majoritariamente sobre gráficos de preços e aplicativos de negociação). Eles estavam sem os projetos arquitetônicos, as atas das reuniões do conselho municipal e as conversas nos cafés locais.
Este artigo apresenta o DLT-Corpus, uma nova biblioteca massiva que finalmente reúne a "história completa" dessa cidade digital. Aqui está o que os autores construíram e o que descobriram, explicado de forma simples:
1. A Grande Biblioteca (O Corpus)
Pense no DLT-Corpus como um galpão gigante contendo 2,98 bilhões de palavras (tokens) de 22 milhões de documentos. Os autores não apenas pegaram textos aleatórios; organizaram-nos cuidadosamente em três seções distintas, como três alas diferentes de uma biblioteca:
- A Ala Acadêmica (Literatura Científica): 37.440 artigos de pesquisa. Estes são os "projetos arquitetônicos" onde cientistas e engenheiros primeiro esboçam novas ideias.
- A Ala de Patentes: 49.023 pedidos de patente. Estes são os "títulos de propriedade legais" onde empresas reivindicam oficialmente a propriedade de novas invenções.
- A Praça da Cidade (Redes Sociais): 22 milhões de postagens do Twitter/X. Estas são as "conversas" onde pessoas comuns falam sobre o que estão comprando, vendendo e esperando.
Por que isso é especial?
Antes disso, a maioria dos programas de computador que estudavam esse campo olhava apenas para a "Praça da Cidade" (redes sociais) ou dados específicos de negociação. Eles perdiam o conteúdo técnico profundo. Esta nova biblioteca é 8,7 vezes mais rica em palavras-chave técnicas específicas do que o texto geral da internet. É como comparar um dicionário de gírias cotidianas a uma enciclopédia especializada em engenharia; esta última é muito melhor para ensinar um computador a entender a linguagem específica dessa indústria.
2. O "Estudante Inteligente" (LedgerBERT)
Para provar que esta biblioteca é útil, os autores ensinaram um modelo de computador (um tipo de IA chamado LedgerBERT) a lê-la.
- O Teste: Eles pediram à IA que encontrasse termos técnicos específicos (como "Proof of Stake" ou "Árvore de Merkle") no texto, uma tarefa chamada Reconhecimento de Entidades Nomeadas.
- O Resultado: A IA treinada nesta nova biblioteca ficou 23% melhor em encontrar esses termos do que os modelos de IA padrão. Ela aprendeu o "dialeto" do mundo DLT muito mais rápido porque tinha tanto material de alta qualidade para estudar.
3. O Que a Biblioteca Revelou (A Análise)
Os autores usaram esta biblioteca para observar como as ideias viajam pela cidade. Eles encontraram dois padrões fascinantes:
Padrão A: A "Jornada da Ideia"
Eles rastrearam três grandes conceitos: Stablecoins (dinheiro digital lastreado em moeda real), DEXs (exchanges descentralizadas) e AMMs (ferramentas de negociação automatizada).
- A Descoberta: Essas ideias quase sempre aparecem na Ala Acadêmica (artigos de pesquisa) primeiro.
- A Jornada: Anos depois, elas aparecem na Ala de Patentes (empresas tentando protegê-las). Finalmente, muito mais tarde, elas explodem na Praça da Cidade (redes sociais), onde todos começam a falar sobre elas.
- A Metáfora: É como uma descoberta científica em um laboratório, que eventualmente se torna um produto em uma fábrica e, finalmente, se torna uma tendência no TikTok. A pesquisa lidera o mercado, e não o contrário.
Padrão B: O "Clima Emocional"
Eles analisaram como as pessoas se sentem em relação ao mercado (sentimento) versus o quanto os pesquisadores estão trabalhando.
- A Descoberta: Mesmo quando o mercado cai (um "inverno cripto" onde os preços despencam), as pessoas nas redes sociais permanecem excessivamente otimistas (altistas). Elas continuam falando bem da tecnologia independentemente do preço.
- O Contraste: No entanto, os cientistas e detentores de patentes são mais realistas. Seu trabalho não dispara nem cai com as notícias diárias. Em vez disso, sua atividade cresce de forma constante ao longo do tempo, acompanhando o crescimento de longo prazo da indústria, e não as oscilações de humor de curto prazo.
- O Ciclo: Os autores descrevem um "ciclo virtuoso": A pesquisa cria novas ferramentas Essas ferramentas ajudam o mercado a crescer Um mercado em crescimento fornece dinheiro para financiar mais pesquisa.
4. As Regras do Jogo (Ética e Limites)
Os autores foram muito cuidadosos sobre como construíram esta biblioteca:
- Sem Violação de Direitos Autorais: Eles usaram apenas artigos de acesso aberto, patentes governamentais públicas e dados de redes sociais coletados antes do Twitter mudar suas regras em 2023.
- Privacidade: Eles removeram todos os nomes de usuário das postagens nas redes sociais para proteger a privacidade das pessoas, mantendo apenas o texto e a data.
- Idioma: A biblioteca está atualmente apenas em inglês, pois esse é o idioma dominante para ciência e patentes.
Resumo
Em resumo, os autores construíram a primeira biblioteca massiva e abrangente para o mundo da Tecnologia de Ledger Distribuído. Eles provaram que, se você quer entender para onde essa tecnologia está indo, não deve olhar apenas para os preços das ações ou tendências do Twitter. Você precisa olhar para os artigos de pesquisa, porque é lá que o futuro está sendo escrito anos antes do resto do mundo acompanhar. Eles também lançaram a biblioteca, o modelo de IA treinado e as ferramentas gratuitamente para que outros possam continuar essa pesquisa.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.