uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking
Este artigo apresenta o sistema uva-irlab-conv para a SemEval-2026 Task 8, que utiliza um pipeline de geração aumentada por recuperação de múltiplos turnos combinando recuperação esparsa aprendida com reescrita de consulta baseada em LLM e reranking listwise para lidar efetivamente com diversos domínios e consultas não respondíveis.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando encontrar uma informação específica em uma biblioteca imensa, mas não está apenas fazendo uma pergunta; você está tendo uma conversa longa e de ida e volta com um bibliotecário. Às vezes você diz: "Quem é o CEO?" e, no minuto seguinte, diz: "Qual é o endereço dele?". A segunda pergunta não faz sentido sem a primeira. Este é o desafio da Recuperação e Resposta a Perguntas Multi-Turno (Multi-Turn Retrieval and Question Answering).
O artigo que você compartilhou descreve uma equipe da Universidade de Amsterdã (chamada uva-irlab-conv) que construiu um sistema inteligente para atuar como este bibliotecário. Eles participaram de uma competição chamada SemEval-2026 Task 8 para ver o quão bem o sistema deles conseguiria lidar com essas conversas através de quatro tópicos muito diferentes: finanças, computação em nuvem, governo e Wikipedia.
Aqui está como o sistema deles funciona, explicado através de analogias simples:
1. O Tradutor (Reescrita de Consulta/Query Rewriting)
O Problema: Humanos falam usando atalhos. Se você perguntar "Quem é o CEO?" e depois "Qual a idade dele?", um computador não sabe quem é "ele".
A Solução: O sistema possui um "Tradutor" (uma IA) que ouve todo o histórico da conversa. Antes de ir à biblioteca, ele reescreve sua última pergunta em uma frase completa e independente.
- Analogia: É como um tradutor que ouve você dizer "Eu quero o azul" e reescreve para o lojista como "Eu quero a camisa azul da prateleira que estávamos olhando agora há pouco".
2. O Batedor Rápido (Recuperação Esparsa Aprendida/Learned Sparse Retrieval)
O Probleimento: A biblioteca possui milhões de documentos. Você não pode ler todos eles.
A Solução: O sistema utiliza um "Batedor Rápido" chamado LION-SP. Este é um tipo especial de mecanismo de busca que é bom em entender tanto o significado das palavras quanto as palavras exatas utilizadas. Ele é projetado para funcionar bem mesmo que o tópico mude de finanças para governo.
- Analogia: Imagine um batedor que corre para dentro de uma floresta enorme. Em vez de ler cada árvore, ele escaneia rapidamente em busca de palavras-chave e conceitos específicos, trazendo de volta as 1.000 folhas mais promissoras para o escritório principal.
3. O Juiz Especialista (Reclassificação/Reranking)
O Problema: O Batedor trouxe 1.000 folhas, mas você só precisa das 10 melhores.
A Solução: O sistema utiliza um processo de julgamento de duas etapas:
- Etapa A (Pointwise): Uma IA olha para cada folha individualmente e atribui a ela uma pontuação. Isso reduz a lista para as 20 melhores.
- Etapa B (Listwise): Uma IA superinteligente (GPT-4.1) olha para as 20 folhas de uma só vez, enquanto se lembra de toda a conversa. Ela as compara entre si para decidir a ordem perfeita.
- Analogia: Primeiro, um treinador escolhe os 20 melhores jogadores de um teste. Depois, um treinador principal assiste a esses 20 jogarem juntos em um treino coletivo para decidir a escalação inicial definitiva, garantindo que eles funcionem bem juntos no contexto do jogo.
4. O Contador de Histórias (Geração de Resposta/Response Generation)
O Problema: Agora você tem os 10 melhores documentos. Você precisa de uma resposta clara.
A Solução: O sistema pega os 5 melhores documentos e o histórico completo da conversa e pede a uma IA poderosa para escrever a resposta final.
- Analogia: Um escritor senta-se com as 5 principais notas de pesquisa e a história completa da sua conversa para escrever um resumo curto e preciso para você.
Como Eles se Saíram?
A equipe participou de três desafios diferentes na competição:
- Encontrar os Documentos (Tarefa A): Eles foram incrivelmente bem, ficando em 2º lugar entre 38 equipes. O sistema deles foi muito bom em encontrar os documentos certos, mesmo em tópicos difíceis como finanças.
- Responder com Documentos Perfeitos (Tarefa B): Eles receberam os documentos "corretos" dos juízes e foram solicitados a escrever respostas. Eles foram razoáveis, mas não os melhores.
- Responder com Sua Própria Busca (Tarefa C): Eles usaram seus próprios resultados de busca para escrever respostas. Eles ficaram em 20º lugar entre 29.
A Grande Conclusão:
O artigo destaca um compromisso específico (trade-off). O sistema deles foi excelente em encontrar a informação certa (recuperação/retrieval). No entanto, quando se tratava de escrever a resposta final, ele teve dificuldades com perguntas que não podiam ser respondidas (como "Qual é a senha secreta?" quando a senha não está nos documentos).
Os autores observam que o sistema deles é muito "fiel", o que significa que raramente inventa coisas (alucinações) se a informação não estiver lá. No entanto, como eles não programaram explicitamente o sistema para dizer "eu não sei" quando a informação está faltando, às vezes o sistema tentava responder a perguntas que não conseguia responder totalmente, o que baixou sua pontuação nas tarefas de geração.
Em resumo: Eles construíram uma equipe de especialistas em IA (um tradutor, um batedor, um juiz e um escritor) que trabalham juntos para lidar com conversas complexas. Eles são mestres em encontrar os livros certos na biblioteca, mas ainda estão aprendendo a admitir quando um livro simplesmente não contém a resposta.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.