Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering
Este estudo introduz a primeira estrutura de Geração Aumentada de Recuperação para o sistema de perguntas e respostas jurídicas em nepalês, aproveitando o arquivo Nepal Kanun Patrika para alcançar pontuações de alta precisão e veracidade, abordando, assim, os desafios de escassez de dados em domínios jurídicos de baixos recursos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine o sistema jurídico do Nepal como uma biblioteca antiga e imensa. Esta biblioteca contém milhares de decisões judiciais (jurisprudências) escritas em nepalês. No entanto, existem dois grandes problemas:
- Os livros estão bagunçados: Eles são escritos em uma linguagem antiga, espalhados por diferentes lugares e nem todos foram digitalizados adequadamente.
- O bibliotecário é novo: Os modelos de Inteligência Artificial (IA) são geralmente treinados em livros em inglês. Quando você pergunta sobre leis nepalesas, eles costumam ficar confusos ou inventar coisas porque não "leram" textos jurídicos em nepalês o suficiente para aprender as regras.
Este artigo apresenta uma nova maneira de consertar isso usando um sistema chamado RAG (Geração Aumentada de Recuperação). Pense no RAG não como um estudante tentando memorizar um livro didático, mas como um assistente de pesquisa inteligente que tem permissão para procurar respostas em uma biblioteca antes de falar.
Veja como os pesquisadores construíram e testaram este assistente:
1. A Biblioteca (Os Dados)
A equipe recorreu ao arquivo digital oficial da Suprema Corte do Nepal (chamado Nepal Kanun Patrika). Eles extraíram e limparam 10.320 documentos jurídicos.
- O Desafio: Eles não podiam simplesmente alimentar a IA com esses documentos enormes. É como tentar encontrar uma frase específica em um livro de 500 páginas lendo o livro inteiro de uma vez.
- A Solução: Eles retalharam os documentos em pequenos "pedaços" (chunks) (como cortar uma história longa em parágrafos curtos) para que a IA pudesse lidar melhor com eles.
2. O Mecanismo de Busca (Encontrando a Página Certa)
Antes que a IA possa responder a uma pergunta, ela precisa encontrar a página certa na biblioteca. Os pesquisadores testaram duas maneiras diferentes de busca:
Método A: O "Caçador de Palavras-Chave" (BM25)
- Como funciona: Este é como um bibliotecário tradicional que procura por palavras exatas. Se você perguntar: "Qual é a penalidade para furto?", o bibliotecário escaneia por palavras exatas como "penalidade", "furto" e "lei".
- O Resultado: Este método foi o campeão. Ele encontrou o documento correto 91% das vezes ao procurar em pequenos pedaços, e 88% das vezes ao procurar em documentos inteiros. Foi muito preciso porque a linguagem jurídica é frequentemente muito específica e repetitiva.
Método B: O "Combinador de Significados" (Recuperação Densa)
- Como como funciona: Este é como um bibliotecário que entende a vibe ou o significado de uma pergunta, mesmo que as palavras sejam diferentes. Ele usa matemática avançada (embeddings) para supor que "roubar" e "furto" são a mesma coisa.
- O Resultado: Este método foi bom, mas não excelente para este trabalho específico. Ele encontrou o documento correto apenas 75% das vezes. Os pesquisadores descobriram que, para o direito nepalês, a correspondência exata de palavras funciona melhor do que adivinhar o significado, provavelmente porque os termos jurídicos são muito rígidos.
A Armadilha da Velocidade:
O "Caçador de Palavras-Chave" (BM25) tinha um porém. Quando eles retalharam os documentos em pedaços minúsculos para torná-los mais precisos, a busca tornou-se muito lenta (como pesquisar através de 110.000 pequenos cartões de índice em vez de 10.000 livros). Para manter o sistema rápido o suficiente para ser útil, eles escolheram a versão de "Documento Inteiro" do Caçador de Palavras-Chave. Foi um pouco menos preciso, mas muito mais rápido.
3. O Escritor de Respostas (Gerando a Resposta)
Uma vez que o sistema encontrou o documento certo, ele precisava escrever a resposta.
- A Regra: A IA recebeu a instrução estrita: "Não invente coisas."
- A Estratégia: Os pesquisadores usaram um processo de duas etapas. Primeiro, a IA tinha que apontar para a frase exata no documento que provava a resposta. Segundo, ela escrevia a resposta baseada apenas naquela frase. Se ela não encontrasse provas, era instruída a dizer: "Eu não sei", em vez de adivinhar.
4. Os Resultados (Funcionou?)
A equipe testou este sistema com 100 perguntas escritas por especialistas jurídicos. Veja como a melhor versão (Caçador de Palavras-Chave + Documentos Inteiros) se saiu:
- Taxa de Sucesso: Gerou com sucesso uma resposta para 92% das perguntas.
- Veracidade: Quando verificadas por outra IA e por advogados humanos, as respostas foram 85% verdadeiras (significando que não mentiram ou inventaram fatos).
- Fundamentação: 74% das respostas foram diretamente suportadas pelo texto encontrado na biblioteca.
A Conclusão
Este artigo prova que, para uma língua de poucos recursos como o nepalês, você não precisa de uma IA superinteligente que tenha memorizado tudo. Em vez disso, você precisa de uma ferramenta de busca confiável que encontre o texto jurídico exato e uma IA rigorosa que se recuse a falar a menos que tenha o texto à sua frente.
Ao combinar um método de busca simples e rápido (BM25) com um processo de escrita cuidadoso, eles criaram o primeiro sistema que pode responder de forma confiável a perguntas jurídicas em nepalês sem inventar fatos. É uma base que poderá, futuramente, ajudar pessoas comuns a entenderem seus direitos legais sem a necessidade de um diploma em direito.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.