← Últimos artigos
💻 computer science

Evaluating and Mitigating Hallucinations in Retrieval-Augmented Question Answering over Uzbek School Textbooks

Este estudo apresenta o conjunto de dados UzHistQA e demonstra que, embora a geração aumentada por recuperação reduza significativamente as alucinações em respostas sobre a história uzbeque, impor mecanismos de citação e abstenção é necessário para eliminar completamente respostas fabricadas, destacando a necessidade de avaliar separadamente a qualidade da recuperação e a fidelidade da geração em línguas com poucos recursos.

Autores originais: Ruzimboy Azimjonovich Kholmurotov

Publicado 2026-09-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ruzimboy Azimjonovich Kholmurotov

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Na sala de aula moderna, os alunos recorrem cada vez mais à inteligência artificial para explicar conceitos difíceis, resumir capítulos ou preparar-se para testes. Estes assistentes digitais são construídos sobre modelos de linguagem de grande escala, sistemas treinados em vastas quantidades de texto que podem gerar respostas fluentes, confiantes e, muitas vezes, convincentes. No entanto, surge um risco distinto quando um aluno faz uma pergunta sobre a qual ainda não possui a resposta: ele carece do conhecimento para verificar a resposta recebida. Se o sistema inventar um facto, o erro passará despercebido e o aluno aprenderá algo falso. Para corrigir isto, investigadores desenvolveram um método chamado geração aumentada por recuperação. Em vez de depender apenas da memória interna do modelo, o sistema procura primeiro um documento específico e fidedigno — como um livro de texto escolar — para encontrar a passagem relevante antes de responder. Isto mantém a resposta fundamentada na realidade, mas não garante a perfeição. O sistema ainda pode falhar ao encontrar a passagem correta, ou pode encontrar a passagem correta e depois ignorá-la, ou pode interpretar mal o que encontrou.

Esta incerteza é particularmente acentuada no uzbeque, uma língua falada por milhões, mas considerada de "baixos recursos" no mundo da inteligência artificial. Ao contrário do inglês, que domina os dados usados para treinar estes modelos, o uzbeque dispõe de menos textos digitais disponíveis. Além disso, o uzbeque é uma língua aglutinante, o que significa que uma única palavra raiz pode ser modificada com muitos sufixos diferentes para criar uma vasta gama de formas superficiais. Um aluno que pergunte sobre "independência" pode usar uma forma de palavra que pareça completamente diferente daquela utilizada no livro de texto, fazendo com que o sistema de pesquisa perca a resposta por completo. Até agora, não havia uma forma padrão de testar quão bem estes sistemas funcionam para a história do Uzbequistão ou de medir a frequência com que inventam informações.

Um estudo recente do investigador independente Ruzimboy Kholmurotov aborda esta lacuna, construindo um conjunto de testes específico chamado UzHistQA, baseado num livro de texto oficial de história do décimo ano que cobre os anos de 1917 a 1991. O investigador analisou o livro de texto e encontrou um obstáculo linguístico significativo: de quase 31.000 palavras no livro, mais de metade das formas de palavras únicas aparecia apenas uma vez. Esta variedade extrema significa que uma pesquisa simples por correspondências exatas de palavras provavelmente falharia. Para testar como superar isto, o estudo criou 56 perguntas, incluindo algumas que o livro de texto simplesmente não poderia responder, para ver se o sistema admitiria a sua ignorância ou inventaria uma resposta. O investigador comparou então quatro formas diferentes de executar o sistema: uma que dependia apenas da sua memória interna, uma que pesquisava o livro de texto usando uma pesquisa semântica padrão, uma que combinava essa com uma pesquisa por palavras-chave, e uma versão final que era estritamente instruída a citar a sua fonte e a recusar responder se a evidência estivesse ausente.

Os resultados foram gritantes. Quando o sistema dependia apenas da sua memória interna sem consultar o livro de texto, fazia afirmações não sustentadas ou inventadas em 91 por cento das suas respostas. Fabricava confiantemente datas, nomes e listas para questões que o livro de texto não cobria. Quando o sistema foi forçado a consultar o livro de texto primeiro, a taxa destas afirmações não sustentadas caiu dramaticamente para apenas 9 por cento. Isto confirmou que fundamentar as respostas no texto real é essencial para a fiabilidade. No entanto, o estudo também revelou uma complicação surpreendente. A versão que utilizou o método de pesquisa mais sofisticado, que combinava a compreensão semântica com a correspondência de palavras-chave, encontrou de facto as passagens corretas com mais frequência do que a pesquisa mais simples. Contudo, apesar de encontrar melhores evidências, este sistema avançado produziu mais afirmações não sustentadas do que o mais simples. Parece que, quando o sistema recuperava um conjunto de passagens maior e mais diverso, a informação extra confundia o modelo, levando-o a fazer inferências ou cálculos incorretos mesmo quando os factos estavam ali presentes.

A configuração mais eficaz para a segurança foi aquela que impôs regras estritas: o sistema tinha de citar a página específica para cada afirmação e foi instruído a dizer "Não sei" se o livro de texto não contivesse a resposta. Esta abordagem eliminou todas as respostas fabricadas para questões que o livro de texto não conseguia responder. A contrapartida foi que o sistema recusou responder a 14 por cento das perguntas que poderia ter respondido, por vezes mesmo quando a resposta estava presente no texto recuperado. O investigador conclui que, para um contexto educativo, esta recusa é uma característica necessária. Um aluno que recebe um "Não sei" pode pedir ajuda a um professor, mas um aluno que recebe uma resposta fabricada e confiante aprende uma falsidade e não tem forma de saber que está errada. O estudo estabelece que, embora a geração aumentada por recuperação torne estes sistemas viáveis para a educação no Uzbequistão, ela requer um design cuidadoso para evitar que o sistema alucine, e destaca que encontrar a informação certa e escrever uma resposta correta são dois desafios distintos que devem ser medidos de forma independente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →