GreekBarRetrieval: A Benchmark for Greek Statutory Retrieval
Este artigo apresenta o GreekBarRetrieval, um novo benchmark para recuperação de estatutos gregos derivado de questões de exames da ordem, e demonstra que um ciclo de reformulação de consultas baseado em LLM de dez rodadas melhora significativamente o desempenho do BM25, permitindo que ele supere tanto recuperadores densos tradicionais quanto outras estratégias de recuperação avançadas.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo do direito, encontrar a regra certa para aplicar a uma situação específica é o fundamento da justiça. Quando um advogado ou um juiz precisa responder a uma questão complexa sobre um crime ou um contrato, eles não podem confiar apenas na memória; devem localizar o texto exato da lei que rege a situação. Este processo, conhecido como recuperação estatutária, envolve a busca entre milhares de artigos jurídicos para encontrar os poucos que são verdadeiramente relevantes. O desafio é que as pessoas descrevem eventos da vida real em uma linguagem comum e cotidiana, enquanto as leis que os regem são escritas em um código especializado e abstrato. Uma pessoa pode dizer: "Ele se recusou a dar o remédio", mas a lei pode formular o mesmo conceito como "omissão de um dever de agir". Preencher essa lacuna entre como os humanos falam e como as leis são escritas é difícil, especialmente para línguas como o grego, que possuem estruturas de palavras complexas que tornam a simples correspondência de palavras pouco confiável. Sem a capacidade de recuperar com precisão esses textos legais, os sistemas de inteligência artificial não podem fornecer respostas confiáveis ou explicar seu raciocínio, o que é um requisito crítico em contextos jurídicos.
Pesquisadores na Grécia enfrentaram este problema criando um novo campo de testes chamado GreekBarRetrieval. Eles construíram este benchmark utilizando questões dos exames reais da ordem dos advogados gregos, que são os testes rigorosos que os candidatos devem passar para exercer a profissão. Nestes exames, os candidatos são apresentados a uma história detalhada de um caso jurídico e solicitados a identificar quais artigos específicos do código penal ou de outras leis se aplicam. Os pesquisadores pegaram 283 destas questões de exame, juntamente com as histórias completas por trás delas, e as parearam com uma vasta biblioteca de 6.308 artigos jurídicos candidatos. O objetivo era verificar se os sistemas de computador poderiam olhar para uma pergunta e sua história e, então, encontrar com sucesso os artigos jurídicos corretos escondidos dentro dessa grande biblioteca. Esta configuração é única porque testa a capacidade do sistema de encontrar o material de origem antes mesmo de tentar escrever uma resposta, separando a habilidade de pesquisa da habilidade de raciocínio.
Quando os pesquisadores testaram inicialmente os métodos de busca de computador padrão, os resultados mostraram uma divisão clara entre duas abordagens diferentes. Uma abordagem, conhecida como recuperação esparsa (sparse retrieval), funciona procurando correspondências exatas de palavras entre a pergunta e o texto legal. A outra, chamada de recuperação densa (dense retrieval), utiliza IA avançada para compreender o significado por trás das palavras, mesmo que o vocabulário seja diferente. Em seus testes iniciais, os sistemas baseados em significado tiveram um desempenho muito superior, encontrando os artigos relevantes entre os cem primeiros resultados cerca de 77 por cento das vezes. Os sistemas de correspondência de palavras, por outro lado, tiveram sucesso apenas cerca de 36 por cento das vezes. Isso confirmou que simplesmente combinar palavras muitas vezes não é suficiente quando a linguagem da pergunta e a linguagem da lei são tão distintas.
No entanto, os pesquisadores descobriram que o desempenho dos sistemas de correspondência de palavras poderia ser dramaticamente melhorado através do uso de um modelo de linguagem de grande escala para reescrever as perguntas de busca antes que o computador procurasse as respostas. Em vez de pesquisar com a história original, desordenada e cheia de detalhes irrelevantes, a IA foi solicitada a traduzir a pergunta para a linguagem jurídica precisa e formal, eliminando o excesso narrativo. Este passo simples de reformular a consulta aumentou a taxa de sucesso do sistema de correspondência de palavras de 36 por cento para 60 por cento, fechando efetivamente grande parte da lacuna com os sistemas mais complexos baseados em significado. O estudo descobriu que este método de reescrever a pergunta foi muito mais eficaz do que outros truques comuns, como tentar traduzir o texto grego para o inglês primeiro ou ajustar as configurações internas do mecanismo de busca.
Para elevar o desempenho ainda mais, a equipe introduziu um método onde o computador pesquisa, revisa o que encontrou e, em seguida, pesquisa novamente com base nesses resultados. Este processo iterativo, que mimetiza como um advogado humano poderia refinar sua estratégia de busca após ler alguns documentos iniciais, permitiu que o sistema de correspondência de palavras atingisse uma taxa de sucesso de 67 por cento. Embora isso não tenha superado o melhor sistema baseado em significado, que alcançou 73 por cento, produziu uma lista de resultados muito mais organizada, colocando os artigos mais importantes no topo da lista. Isso é particularmente valioso porque os sistemas jurídicos frequentemente precisam trabalhar com um número limitado de documentos. Os pesquisadores observaram, contudo, que esta abordagem iterativa traz um preço pesado: exige que o computador realize muito mais cálculos e leve significativamente mais tempo para completar a busca em comparação com uma busca direta e única.
O estudo conclui que, embora os sistemas de IA avançados que compreendem o significado sejam poderosos, eles não são o único caminho a seguir. Ao utilizar um modelo de linguagem de grande escala para traduzir perguntas cotidianas para a linguagem formal do direito, mesmo ferramentas de busca mais simples e rápidas podem se tornar altamente eficazes. Isso sugere que a chave para uma melhor IA jurídica não é apenas construir modelos maiores, mas garantir que as perguntas feitas sejam claras e utilizem a terminologia correta. Os pesquisadores disponibilizaram seus dados e códigos publicamente, fornecendo um novo padrão para testar quão bem os computadores podem navegar no complexo cenário do direito grego, e oferecendo um roteiro para melhorar as ferramentas de busca jurídica em outras línguas também.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.