Hyperparameter Analysis in Retrieval-Augmented Generation Systems Applied to the Public Prosecutor’s Office of the State of Espírito Santo Corpus
Este estudo emprega uma metodologia de Planejamento de Experimentos para analisar e otimizar hiperparâmetros críticos — especificamente estratégia de fragmentação, volume de contexto e seleção de LLM — dentro de um sistema de Geração Aumentada de Recuperação (RAG) adaptado para a Procuradoria do Estado do Espírito Santo, revelando que esses fatores influenciam significativamente a qualidade da resposta por meio de análise estatística utilizando o Aligned Rank Transform.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um amigo robô superinteligente que consegue escrever ensaios, contar piadas e responder quase qualquer pergunta que você fizer. Este robô é como um estudante brilhante que leu toda a internet. Mas aqui está o problema: este estudante tem uma memória terrível para fatos. Se você perguntar sobre uma lei específica, ele pode inventar com confiança uma regra que parece perfeita, mas que é completamente falsa. Isso é chamado de "alucinação", e é um grande problema quando você precisa de informações precisas, como em um tribunal ou em um hospital.
Para consertar isso, cientistas inventaram um truque engenhoso chamado Geração Aumentada por Recuperação (RAG - Retrieval-Augmented Generation). Pense nisso como dar ao seu amigo robô uma pilha de livros didáticos logo antes do exame. Em vez de adivinhar a partir de sua própria memória, o robô primeiro procura a resposta nos livros e, então, escreve sua resposta baseando-se apenas no que encontrou. É como um detetive que verifica o arquivo de evidências antes de escrever o relatório. Mas há um detalhe: como você organiza esses livros importa. Você rasga as páginas em pequenos pedaços? Você mantém os capítulos inteiros juntos? E quantas páginas você deixa o robô ler antes de ele começar a escrever? Se você errar essas configurações, o robô pode perder a pista crucial ou ficar confuso com excesso de ruído. Este é exatamente o que uma equipe de pesquisadores no Brasil decidiu resolver.
O Dilema do Detetive: Ajustando a Máquina
No estado do Espírito Santo, Brasil, o Ministério Público (MPES) possui uma biblioteca massiva de documentos jurídicos — milhares de leis, regras e portarias. Durante anos, encontrar uma regra específica era um pesadelo. Os servidores civis tinham que saber exatamente onde procurar, ou ficariam travados. Para ajudar, eles construíram uma assistente virtual chamada Fabi (nomeada após uma funcionária real, superconhecedora). Fabi usa o truque do RAG: ela lê a biblioteca jurídica e responde às perguntas da equipe.
Mas a Fabi não era perfeita. Às vezes ela perdia detalhes importantes; às vezes dava respostas vagas. Os pesquisadores, liderados por Heitor Quartezani e sua equipe, fizeram uma pergunta simples: Quais configurações tornam a Fabi o melhor detetive possível? Eles não apenas chutaram; eles trataram o problema como um grande experimento científico. Eles testaram todas as combinações de quatro "botões" diferentes no sistema para ver qual produzia as respostas mais precisas, honestas e úteis.
Aqui está o que eles giraram e o que descobriram:
1. A Estratégia de "Corte" (Chunking)
Imagine que você tem uma história jurídica longa e complexa. Como você a corta para entregá-la ao robô?
- O Jeito Antigo (Recursivo): Cortar a história em pedaços de tamanho fixo, como fatiar um pão de forma em pedaços de 500 caracteres. É fácil, mas você pode cortar uma frase ao meio, perdendo o sentido.
- O Jeito Inteligente (Semântico): Cortar a história apenas quando o tópico muda. Se a lei muda de "regras de férias" para "pagamento de horas extras", é aí que você corta. Isso mantém as ideias inteiras.
A Descoberta: Os pesquisadores descobriram que o "Jeito Inteligente" (corte semântico) foi o vencedor claro. Especificamente, cortar com base no percentil 95 de mudanças de tópico (ou seja, cortar apenas quando o tópico muda significamente) manteve a maior parte da informação intacta. O "Jeito Antigo" de fatiar em pequenos pedaços de 500 caracteres foi terrível; ele quebrou a lógica jurídica, tornando impossível para o robô encontrar a resposta certa. No trabalho jurídico, perder um único detalhe pode ser desastroso, então manter a história inteira foi o fator mais importante.
2. O Método de Busca (Retrieval)
Como a Fabi encontra as páginas certas na biblioteca?
- Busca Vetorial: É como perguntar ao robô: "Encontre coisas que pareçam com esta pergunta". É ótimo para entender o significado, mas pode perder palavras exatas.
- Busca Lexical: É como um catálogo clássico de biblioteca. Procura por correspondências exatas de palavras. É ótimo para termos específicos, mas ruim para entender o contexto.
- Busca Híbrida: É o melhor dos dois mundos. Utiliza um truque matemático especial (chamado de Fusão de Classificação Recíproca) para combinar a busca de "sentimento" e a busca de "palavra exata".
A Descoberta: A Busca Híbrida foi a campeã. Ao combinar ambos os métodos, a Fabi pôde encontrar os documentos certos mesmo que o usuário fizesse uma pergunta de um jeito estranho ou usasse um termo jurídico muito específico. A busca de "sentimento" sozinha não era suficiente, e a busca de "palavra exata" sozinha era muito rígida. Juntas, elas tornaram o sistema muito mais confiável.
3. Quanto Ler (Top-K)
Quando a Fabi encontra os melhores documentos, quantos ela deve ler antes de responder? Ela deve ler 5 páginas? 20?
- A Descoberta: Quanto mais ela lia, melhor ficava — pelo menos até certo ponto. Ler 20 documentos deu os melhores resultados. Descobriu-se que dar ao robô uma "rede" maior para capturar informações ajudava a encontrar as pistas certas, mesmo que algumas das páginas extras tivessem um pouco de ruído. No entanto, os pesquisadores notaram que, após 15 documentos, a melhoria na qualidade da resposta final parou de ser estatisticamente significativa. Portanto, embora ler 20 fosse ligeiramente melhor, isso custava mais poder computacional. Eles sugeriram que, no futuro, o sistema poderia usar um filtro mais inteligente para ler menos páginas, mas ainda obter os mesmos excelentes resultados.
4. O Poder Cerebral (Escolha do LLM)
Finalmente, eles testaram dois "cérebros" diferentes para a Fabi: o massivo e superinteligente gpt-4o e o menor e mais rápido gpt-4o-mini.
- A Surpresa: Você poderia pensar que o cérebro maior e mais caro venceria. Mas o menor gpt-4o-mini na verdade teve um desempenho tão bom quanto, e às vezes até melhor!
- Por quê? O cérebro gigante era tão inteligente que às vezes tentava ser criativo demais. Quando o robô lia 20 documentos, o cérebro grande começava a misturar ideias ou a interpretar demais o texto, levando a pequenos erros. O cérebro menor, porém, era mais obediente. Ele se prendia estritamente ao texto fornecido, extraindo os fatos sem adicionar seu próprio "tempero". Para um assistente jurídico que precisa ser preciso, ser um pouco mais literal era, na verdade, um superpoder.
O Veredito Final
Os pesquisadores não apenas adivinharam; eles realizaram 3.840 experimentos diferentes (isso é 96 configurações diferentes testadas contra 40 perguntas diferentes) e usaram matemática avançada para provar seus resultados.
Eles concluíram que, para construir o melhor assistente jurídico:
- Corte os documentos por tópico, não por tamanho fixo.
- Use uma Busca Híbrida que combina significado e palavras exatas.
- Leia cerca de 20 documentos para garantir que nada seja perdido.
- Use o modelo de IA menor e mais barato (gpt-4o-mini), porque ele segue as instruções de forma mais estrita e comete menos erros.
Este estudo é importante porque vai além do "vamos tentar isso e ver o que acontece". Ele utiliza ciência rigorosa para nos dizer exatamente como ajustar essas ferramentas poderosas para que elas não apenas pareçam inteligentes, mas sejam de fato inteligentes e confiáveis. Para o Ministério Público, isso significa que a Fabi agora pode ajudá-los a encontrar as leis certas mais rapidamente e com menos erros, fazendo o sistema jurídico funcionar melhor para todos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.