Vidya: An AI-Driven Modular Pipeline for Archival Automation and Semantic Metadata Enrichment
Vidya é um pipeline modular e de código aberto desenvolvido na UEPG que utiliza Modelos de Linguagem de Grande Porte restritos por ontologias YAML e validação Pydantic para automatizar o enriquecimento semântico e a ingestão arquivística de "dados escuros" históricos, reduzindo significativamente o tempo de processamento de décadas para dias, ao mesmo tempo que garante a conformidade com padrões internacionais como NOBRADE e ISAD(G).
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma biblioteca massiva de caixas antigas e empoeiradas, repletas de documentos históricos, fotos e cartas. Você passou anos escaneando-as cuidadosamente para salvá-las de apodrecer. Mas eis o problema: agora você tem uma montanha de arquivos digitais que são essencialmente "dados escuros". Eles existem, mas ninguém consegue encontrá-los porque carecem de rótulos, tags ou descrições. É como ter um galpão gigante cheio de caixas misteriosas onde você não sabe o que há dentro sem abrir cada uma delas manualmente.
Tradicionalmente, contratar pessoas para ler cada documento e escrever um resumo para ele é incrivelmente lento, caro e propenso a erros. É aqui que entra a Vidya.
O que é a Vidya?
Pense na Vidya como uma bibliotecária robô superinteligente e incansável, construída especificamente para resolver esse problema de rotulagem. Ela é um "pipeline", que é apenas uma palavra chique para uma linha de montagem. Em vez de um humano sentado em uma mesa, a Vidya pega seus arquivos digitais, lê-os usando Inteligência Artificial (IA) e escreve automaticamente as descrições necessárias (metadados) para que as pessoas possam pesquisar e encontrá-los posteriormente.
Como Funciona? (O "Colete de Força Digital")
Você pode estar pensando: "Espere, a IA pode ser pouco confiável. Às vezes ela inventa coisas ou 'alucina' fatos". Os autores do artigo sabiam que isso era um risco enorme para arquivos, onde a precisão é tudo.
Para corrigir isso, a Vidya usa um truque inteligente que eles chamam de "colete de força digital".
- O Problema: Imagine pedir a um escritor criativo que descreva uma foto. Ele pode inventar detalhes que não existem.
- A Solução: A Vidya não deixa a IA apenas "conversar". Em vez disso, ela força a IA a preencher um formulário rígido e pré-definido (definido por um arquivo chamado YAML). É como dar à IA uma folha de exercícios de preencher lacunas com regras específicas.
- A Verificação: Antes que a resposta da IA seja aceita, um guardião digital (chamado Pydantic) verifica o trabalho. Se a IA tentar escrever algo que não se encaixa no formulário ou quebra as regras, o sistema rejeita. Isso garante que a saída seja sempre estruturada, precisa e siga as regras internacionais de bibliotecas (como ISAD(G) e NOBRADE).
O Espírito "Maker"
A Vidya não foi construída em um laboratório corporativo de alta tecnologia com dinheiro ilimitado. Foi construída por uma equipe de uma universidade no Brasil usando princípios Maker.
- Baixo Custo: Foi projetada para rodar em computadores modestos e acessíveis (como um desktop padrão ou até mesmo um Raspberry Pi), e não em supercomputadores caros.
- Código Aberto: É um software gratuito que qualquer pessoa pode examinar, corrigir ou melhorar.
- Colaboração: Reúne historiadores (que conhecem a história) e cientistas da computação (que conhecem o código) para trabalharem juntos.
O Que Eles Encontraram?
A equipe testou a Vidya em um monte de 50 documentos (jornais e fotos) e comparou com fazer o trabalho manualmente. Os resultados foram dramáticos:
- Velocidade: O que levaria uma equipe humana 18,5 anos para processar manualmente, a Vidya poderia fazer em cerca de 45 a 60 dias.
- Custo: A abordagem assistida por IA custou apenas cerca de 1,5% do que o trabalho humano custaria.
- Precisão: A Vidya alcançou cerca de 85% de precisão em detalhes-chave como títulos, criadores e datas. Embora não seja perfeita, é boa o suficiente para fazer o trabalho pesado, deixando os humanos apenas para verificar o trabalho em vez de começar do zero.
- Acessibilidade: Ao transformar essas imagens "escuras" em descrições de texto, a Vidya torna esses arquivos acessíveis a pessoas cegas ou com baixa visão, que usam leitores de tela para navegar na web.
O Quadro Geral
A Vidya não é apenas uma ferramenta; é uma maneira de desbloquear a história. Ela pega os "dados escuros" do passado — arquivos que estavam sentados no escuro, invisíveis e não pesquisáveis — e os transforma em um museu digital brilhante, organizado e pesquisável. Ela prova que você não precisa de um orçamento massivo para usar IA avançada; você apenas precisa de uma abordagem inteligente e estruturada para manter a tecnologia honesta e útil.
Em resumo: a Vidya é a ponte que transforma uma pilha caótica de arquivos digitais em uma biblioteca utilizável e pesquisável, economizando décadas de trabalho e tornando a história acessível a todos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.