Testing Frontier LLMs on Indian Statutory Interpretation: The Indian Construction Canon Benchmarking (ICCB) -Pilot Benchmark
Este artigo apresenta o benchmark ICCB-Pilot para avaliar LLMs de fronteira na interpretação estatutária indiana, revelando que, embora os modelos possam frequentemente prever resultados jurídicos corretos, eles falham em identificar e aplicar corretamente os cânones de construção subjacentes, sugerindo que seu raciocínio baseia-se em correspondência de padrões superficiais em vez de uma compreensão jurisprudencial genuína.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
No mundo do direito, ler um estatuto raramente é tão simples quanto ler uma definição de dicionário. Quando um juiz se depara com uma lei vaga ou ambígua, ele não meramente adivinha a resposta; ele segue um conjunto específico de ferramentas mentais conhecidas como "cânones de construção". Estas são regras práticas estabelecidas que orientam como um texto deve ser compreendido. Por exemplo, uma regra pode dizer que, se uma lei tem o intuito de punir alguém, ela deve ser lida de forma muito estrita, palavra por palavra. Outra regra pode dizer que, se uma lei foi desenhada para ajudar os pobres, ela deve ser lida de forma ampla para incluir o maior número possível de pessoas. Estas ferramentas são a diferença entre um juiz simplesmente recordar um caso passado e um juiz realmente raciocinar através de um novo problema. À medida que sistemas de inteligência artificial começam a entrar em tribunais e escritórios jurídicos, surge uma questão crítica: estas máquinas compreendem verdadeiramente como usar estas ferramentas ou estão apenas a ser muito boas a adivinhar a resposta certa com base em padrões que já viram antes?
Uma equipa de investigadores da Manipal Academy of Higher Education, na Índia, propôs-se a testar esta questão utilizando as mais recentes gerações de modelos de inteligência artificial. Eles criaram um teste especializado, que chamam de benchmark, focado inteiramente em como estas máquinas interpretam as leis indianas. Em vez de pedirem aos computadores para simplesmente preverem o desfecho de um caso, os investigadores pediram-lhes que explicassem o seu raciocínio. O teste apresentou aos modelos quarenta cenários jurídicos diferentes extraídos de julgamentos reais de tribunais indianos. Em cada cenário, o modelo tinha de identificar qual regra de interpretação específica deveria ser usada, explicar essa regra corretamente e, em seguida, aplicá-la aos factos para chegar a uma conclusão. Os investigadores avaliaram os modelos em cinco aspetos distintos: se escolheram a regra certa, se descreveram essa regra com precisão de acordo com a tradição jurídica indiana, se a aplicaram corretamente aos factos, se chegaram à resposta final correta e quão clara foi o seu raciocínio geral.
Os resultados revelaram uma lacuna impressionante entre o que as máquinas conseguem fazer e como o fazem. Os modelos de inteligência artificial mais poderosos testados foram surpreendentemente bons a obter a resposta final correta. Em muitos casos, chegaram à mesma conclusão a que um juiz humano teria chegado. No entanto, quando os investigadores analisaram como eles lá chegaram, o cenário mudou. Os modelos falharam frequentemente ao identificar corretamente a regra jurídica específica que estavam a utilizar. Muitas vezes chegaram ao resultado correto sem saberem qual era a ferramenta certa a usar, sugerindo que estavam a associar a situação a um padrão familiar em vez de seguirem um caminho lógico. É como se um aluno pudesse resolver um problema matemático complexo corretamente, mas não conseguisse explicar qual fórmula utilizou ou por que razão funcionava. O estudo descobriu que, quando os investigadores diziam explicitamente aos modelos qual regra usar, os modelos tornavam-se muito melhores a nomear essa regra, mas a sua capacidade de a explicar ou de a aplicar não melhorou significativamente. Isto sugere que os modelos possuem o conhecimento destas regras jurídicas, mas têm dificuldade em aceder a esse conhecimento por conta própria sem um comando direto.
Os investigadores também observaram que os modelos se comportavam de forma diferente dependendo de como a pergunta era feita. Quando deixados para resolver o problema sozinhos, os modelos hesitavam ou recusavam-se a responder, particularmente o modelo de código aberto testado. No entanto, quando os investigadores lhes davam uma pista sobre o tipo de regra a usar, os modelos mostravam-se mais dispostos a interagir. Apesar desta melhoria na disposição, o problema central permanecia: os modelos eram melhores a adivinhar o resultado certo do que a construir um argumento jurídico correto. Um modelo, em particular, chegava consistentemente ao resultado correto com mais frequência do que identificava o princípio jurídico, mas ainda assim cometia erros significativos nas suas conclusões finais. Esta dissociação entre uma resposta correta e um processo de raciocínio correto é uma descoberta significativa. Isto implica que, se estes sistemas forem implementados em contextos jurídicos reais baseando-se apenas na sua capacidade de prever resultados, poderão fornecer respostas corretas por razões erradas, o que poderá ser perigoso num sistema onde o raciocínio em si é tão importante quanto o resultado.
O estudo conclui que, embora estes sistemas de inteligência artificial sejam ferramentas poderosas, ainda não dominaram o tipo específico de raciocínio exigido pela interpretação jurídica. Eles parecem depender fortemente do reconhecimento de padrões em vez da aplicação passo a passo de regras jurídicas que os juí-zes humanos utilizam. Os investigadores enfatizam que isto não significa que a tecnologia seja inútil, mas significa que não podemos confiar nestes sistemas para raciocinar como advogados só porque obtêm a resposta certa. O estudo serve como um piloto, um teste de pequena escala concebido para provar que este tipo específico de avaliação é possível e necessário. A equipa planeia expandir este trabalho no futuro, testando mais modelos e uma variedade mais ampla de leis para ver se estes padrões se mantêm em todo o lado. Por agora, as descobertas sugerem um aviso claro: no complexo mundo do direito, obter a resposta certa não é suficiente; a máquina também deve ser capaz de mostrar o seu trabalho.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.