← Últimos artigos
💻 computer science

Digging Up Citations: FOSSIL, a Dataset and Workflow for Reference Extraction in Law and the Humanities

Este artigo apresenta o FOSSIL, um conjunto de dados multilíngue e um fluxo de trabalho acompanhante projetados para melhorar a extração de citações baseadas em notas de rodapé nos campos do direito e das humanidades, demonstrando que um pipeline especializado quase dobra a qualidade da extração em comparação com ferramentas padrão, ao mesmo tempo em que destaca os desafios remanescentes no tratamento de referências cruzadas e notas de rodapé de conteúdo misto.

Autores originais: Luca Foppiano, Christian Boulanger

Publicado 2026-06-02
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Luca Foppiano, Christian Boulanger

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando organizar uma biblioteca enorme. Nas Ciências Naturais (como biologia ou física), os livros têm uma estrutura muito limpa e previsível: a história principal está nos capítulos, e todas as "notas de fontes" estão guardadas em uma lista numerada e organizada ao final. É como uma receita onde os ingredientes são listados separadamente das instruções de cozimento. Os computadores são muito bons em ler essas receitas.

No entanto, no Direito e nas Humanidades (história, filosofia, literatura), as "notas de fontes" são bagunçadas. Elas estão enterradas dentro do próprio texto, muitas vezes nas margens inferiores (notas de rodapé), misturadas com os pensamentos pessoais do autor, esclarecimentos e referências cruzadas. É como uma receita onde os ingredientes estão escondidos dentro das frases, tipo: "Adicione duas xícaras de farinha (que comprei no mercado na terça-feira, veja a página 4) enquanto mexe".

Este artigo, intitulado "Digging Up Citations: FOSSIL," trata da construção de uma maneira melhor de encontrar e organizar esses ingredientes escondidos em livros de Direito e Humanidades.

Aqui está a divisão do que eles fizeram, usando analogias simples:

1. O Problema: A "Caixa Preta" e o "Porão Bagunçado"

Os autores explicam que os programas de computador existentes (modelos) são treinados no estilo "Ciências Naturais" que é organizado. Quando tentam ler as notas de rodapé de Direito e Humanidades, eles ficam confusos porque os dados estão misturados.

Eles também observam que, embora ferramentas de IA poderosas (como grandes chatbots comerciais) possam às vezes decifrar isso, elas são arriscadas. São como alugar uma escavadeira de alta tecnologia de uma empresa que pode falir amanhã, levando seus dados junto com ela. Os autores queriam uma ferramenta que fosse aberta, gratuita e que permanecesse com eles para sempre.

2. A Solução: O Projeto "FOSSIL"

A equipe criou um conjunto completo de ferramentas para desenterrar essas citações. Eles chamam o conjunto de dados de FOSSIL (Footnote-based Open-access SSH Scientific Instance Labels). Pense nisso como uma coleção massiva e organizada de exemplos de "antes e depois" que ensinam os computadores a ler notas de rodapé bagunçadas.

Eles construíram quatro coisas principais:

  • Uma Bancada de Trabalho Digital (Editor PDF-TEI): Uma ferramenta web que permite que humanos e computadores trabalhem lado a lado. Ela mostra o PDF original de um lado e os dados estruturados do outro, permitindo que as pessoas corrijam erros e ensinem o computador o que procurar.
  • Um Manual de Treinamento (O Fluxo de Trabalho): Um guia passo a passo de como uma equipe de sete pessoas (incluindo especialistas e estudantes) limpou e rotulou os dados.
  • O Tesouro (O Conjunto de Dados): Eles coletaram 96 artigos acadêmicos de direito, história e ciências sociais. Esses artigos contêm mais de 7.600 referências escondidas em notas de rodapé. Crucialmente, esses dados possuem "licença aberta", o que significa que qualquer pessoa pode usá-los sem problemas legais.
  • Um Motor Especializado (Especialização Grobid): Eles pegaram uma ferramenta de código aberto já existente chamada Grobid (que é como um scanner de biblioteca padrão) e deram a ela uma "lente especializada" para focar especificamente nas notas de rodapé complexas de Direito e Humanidades.

3. O Desafio: Por que isso é tão difícil?

O artigo explica que as notas de rodapé nesses campos são complicadas porque fazem cinco coisas diferentes ao mesmo tempo:

  1. Apenas um comentário (sem citação).
  2. Uma nota biográfica sobre o autor.
  3. Uma lista limpa de livros.
  4. Uma nota de "veja também" apontando para uma nota de rodapé anterior (como "Veja nota 5").
  5. Uma mistura caótica de tudo isso.

É como tentar separar uma pilha de correspondências onde alguns envelopes contêm cartas, outros contêm cheques, outros contêm fotos, e alguns contêm uma mistura de todos os três, e tudo escrito em diferentes idiomas e estilos de caligrafia.

4. Os Resultados: De "Ausente" para "Encontrado"

A equipe testou seu novo motor especializado contra a versão antiga e padrão.

  • O Jeito Antigo: A ferramenta padrão era muito exigente. Ela era quase perfeita ao identificar uma referência se encontrasse uma (alta precisão), mas perdia 70-80% das referências reais porque elas não pareciam citações científicas padrão (baixa revocação/recall). Era como um detector de metais que só apita para moedas de ouro, mas ignora as de prata.
  • O Jeito Novo: A versão especializada "FOSSIL" encontrou o dobro de referências.
    • Passou de encontrar apenas 21% das datas de publicação para encontrar 71%.
    • Passou de encontrar 23% dos nomes de autores para encontrar 60%.
    • No geral, a qualidade da extração quase dobrou (a pontuação foi de 0,36 para 0,72).

5. A Conclusão

O artigo conclui que você não pode apenas "ajustar" as configurações de uma ferramenta padrão para corrigir este problema; você precisa de uma ferramenta especificamente treinada para a realidade bagunçada das notas de rodapé de Direito e Humanidades.

O FOSSIL é agora um degrau. Ele prova que, com os dados certos e um fluxo de trabalho especializado, os computadores podem finalmente começar a ler essas notas de rodapé complexas com precisão. Os autores planejam expandir isso para mais idiomas e enfrentar problemas ainda mais difíceis, como conectar automaticamente um "Veja nota 5" de volta à nota 5 original.

Em resumo, eles construíram uma pá melhor e um mapa para desenterrar citações que antes estavam enterradas na lama das notas de rodapé acadêmicas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →