← Últimos artigos
💻 computer science

The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation

Este artigo apresenta o Saudi Legal Corpus para IA, um conjunto de dados abrangente, de fonte oficial e auditável, de nível de artigo, composto por 290 instrumentos legislativos sauditas que apresentam rastreamento de proveniência único, camadas analíticas estruturadas como grafos de citação e glossários de termos definidos, e um benchmark de recuperação demonstrando o desempenho superior da busca aprimorada por metadados em relação às linhas de base padrão para o PLN jurídico em árabe.

Autores originais: Abdullah Almohammedi

Publicado 2026-09-01
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Abdullah Almohammedi

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo moderno, os computadores são cada vez mais solicitados a responder perguntas sobre o direito. Para fazer isso com precisão, eles dependem de uma técnica chamada geração aumentada por recuperação. Esse processo funciona como um bibliotecário que, antes de responder a uma pergunta, primeiro pesquisa em uma vasta biblioteca de documentos confiáveis para encontrar a passagem exata que contém a resposta. Se o computador conseguir encontrar o texto correto, ele pode resumi-lo para o usuário sem inventar coisas. No entanto, este sistema só funciona se a biblioteca existir em um formato que o computador consiga ler e compreender. Para muitas línguas e sistemas jurídicos, especialmente no mundo árabe, essa biblioteca tem estado ausente. As leis da Arábia Saudita, uma grande economia global, são publicadas em diários oficiais e em sites governamentais, mas existem como páginas e documentos legíveis por humanos, não como dados estruturados que o software possa pesquisar facilmente. Sem uma versão legível por máquina dessas leis, a inteligência artificial não pode auxiliar de forma confiável em questões jurídicas no Reino, deixando uma lacuna significativa tanto na tecnologia quanto no acesso à justiça.

Para preencher essa lacuna, um pesquisador chamado Abdullah Almohammedi construiu o Saudi Legal Corpus for AI, uma vasta e estruturada coleção digital das leis do Reino. Isso não é uma simples lista de links ou uma coleção de PDFs digitalizados. Em vez disso, é um banco de dados cuidadosamente organizado contendo 290 instrumentos legislativos distintos, que variam de leis estatutárias principais a regulamentos de implementação detalhados e regras procedimentais. A coleção abrange doze áreas diferentes do direito, incluindo negócios comerciais, justiça criminal, direitos trabalhistas e tributação. O cerne deste trabalho é a transformação de 290 leis em 15.689 registros individuais ao nível do artigo. Cada registro é um pedaço de texto único e autossuficiente, como um artigo específico de uma lei, totalizando aproximadamente 1,2 milhão de palavras em árabe. Toda a coleção foi projetada para ser auditável, o que significa que cada pedaço de texto pode ser rastreado até sua fonte oficial exata, garantindo que o computador esteja lendo a lei real e não um resumo ou um palpite.

A construção deste corpus segue um conjunto rigoroso de regras para garantir precisão e confiabilidade. A regra mais importante é que o texto oficial em árabe é a única versão que conta. Embora a coleção inclua traduções para inglês e chinês, estas são claramente marcadas como referências não autoritativas, úteis para compreensão, mas não juridicamente vinculativas. Cada artigo no banco de dados carreha um rótulo que explica exatamente de onde veio e como foi verificado. O pesquisador utilizou um sistema de quatro níveis para classificar a confiabilidade de cada fonte, distinguindo entre leis que foram verificadas cruzadamente contra múltiplos documentos oficiais e aquelas que vieram de uma única fonte. Este nível de detalhe permite que os usuários filtrem os dados com base em quanta evidência eles precisam. Por exemplo, um sistema projetado para aconselhamento jurídico de alto risco poderia usar apenas as fontes mais rigorosamente verificadas, enquanto um projeto de pesquisa poderia aceitar uma gama mais ampla. O banco de dados também inclui um "manifesto de atualidade", uma lista que sinaliza 16 trilhas específicas onde o portal governamental oficial pode ainda não conter as emendas mais recentes, garantindo que os usuários estejam cientes de potenciais informações desatualizadas em vez de serem enganados por elas.

Além de apenas armazenar o texto, o pesquisador adicionou várias camadas de análise que nunca existiram para a lei saudita anteriormente. O corpus inclui um mapa de como as leis se referenciam, mostrando quais artigos citam outros artigos. Este grafo de citações contém mais de 3.600 referências, revelando quais leis atuam como centros no sistema jurídico, como a Lei do Trabalho e a Lei das Sociedades, que são frequentemente citadas por outras regulamentações. Há também um mapa classificado manualmente mostrando quais leis substituíram ou revogaram outras mais antigas, ajudando a rastrear a história das mudanças legais. Adicionalmente, o projeto criou um glossário de quase 2.000 termos que são especificamente definidos dentro das próprias leis, juntamente com mais de 3.300 definições. Isso ajuda a esclarecer como a mesma palavra pode significar coisas diferentes em diferentes contextos. Para tornar os dados prontos para ferramentas modernas de IA, o texto também foi dividido em partes menores e gerenciáveis, permitindo que os computadores processem seções específicas de uma lei sem se perderem em milhares de páginas de texto.

Para testar o quão bem este novo recurso funciona, o pesquisador criou um benchmark utilizando 519 perguntas específicas sobre a lei saudita, cada uma pareada com o artigo correto que contém a resposta. Estas perguntas foram escritas através da leitura das leis reais e, em seguida, formulando consultas que uma pessoa poderia fazer. Quando os pesquisadores testaram um método de busca padrão contra este novo sistema rico em metadados, os resultados foram reveladores. O novo sistema identificou corretamente o artigo correto 93,3 por cento das vezes, comparado a 90,4 por cento para o método padrão. A diferença foi mais perceptível quando as perguntas pediam definições, como "o que é um contrato de compra e venda?". Nestes casos, o novo sistema foi significativamente mais preciso, encontrando a definição correta 90,9 por cento das vezes, contra 74,5 por cento para o método padrão. Esta lacuna demonstra que o trabalho extra colocado na organização dos dados e na adição de rótulos detalhados compensa, tornando muito mais fácil para os computadores encontrarem a informação correta, mesmo quando os termos de busca não coincidem perfeitamente com o texto.

O lançamento deste corpus é um passo significativo para a tecnologia jurídica na região, mas traz consigo limites e limitações claros. A coleção não é exaustiva; ela cobre as principais leis, mas não inclui todas as decisões ministeriais ou regras municipais. O pesquisador é transparente sobre isso, documentando o escopo da coleção e os riscos específicos associados a cada dado. O trabalho não é explicitamente uma publicação oficial do governo, e as camadas em inglês e chinês não são traduções oficiais. O único texto vinculativo permanece o árabe original, conforme publicado no diário oficial. Ao fornecer este recurso estruturado, verificado e auditável, o projeto oferece uma base para a construção de assistentes jurídicos confiáveis e para a realização de estudos mais profundos sobre a estrutura da lei saudita. Ele fornece um modelo de como outros países sem diários oficiais legíveis por máquina podem organizar seus próprios sistemas jurídicos para a era digital, garantindo que a lei permaneça acessível, compreensível e fundamentada nos fatos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →