NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
O NightFeats é um sistema RAG de múltiplos agentes e contexto otimizado que conquistou o prêmio de Melhor Avaliação Dinâmica no NeurIPS 2025 ao empregar um pipeline principológico de três fases de recuperação, curadoria e composição para superar baselines proprietários através de transparência arquitetônica e fundamentação de evidências verificáveis em vez de otimização métrica estreita.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando escrever um relatório perfeito e confiável sobre um tópico complexo, mas tem uma equipe de três especialistas trabalhando juntos em vez de uma única pessoa fazendo tudo sozinha. Isso é essencialmente o que o NightFeats é: uma equipe inteligente de três agentes de IA projetada para responder perguntas com precisão, verificar o próprio trabalho e sempre mostrar o seu "dever de casa" (citações).
A equipe entrou recentemente em uma grande competição chamada MMU-RAGent na NeurIPS 2025. Enquanto outras equipes tentaram vencer apenas fazendo com que suas respostas parecessem as "corretas" em um teste de computador, o NightFeats ganhou um prêmio especial chamado "Melhor Avaliação Dinâmica" (Best Dynamic Evaluation). Isso significa que humanos reais preferiram suas respostas porque elas eram mais confiáveis e fáceis de confiar, mesmo que a pontuação automática do computador não tenha dado os pontos mais altos.
Aqui está como a equipe NightFeats trabalha, dividido em etapas simples:
1. Os Três Especialistas (Os Agentes)
Em vez de uma única IA tentando fazer tudo de uma vez, o NightFeats divide o trabalho em três funções distintas, como uma redação de jornal:
O Pesquisador (ResearchAgent): Este é o detetive. Quando você faz uma pergunta, o Pesquisador não apenas pega a primeira coisa que encontra. Ele sai em busca de informações de dois lugares diferentes:
- A Biblioteca "Fresca": Para notícias ou eventos recentes, ele busca os resultados mais recentes da web.
- A Biblioteca "Histórica": Para fatos antigos e fundamentais, ele vasculha arquivos massivos.
- O Truque: Ele usa uma fórmula especial para equilibrar relevância (o quão boa é a resposta) com atualidade (o quão nova ela é). É como um bibliotecário que sabe que um livro de 10 anos atrás pode ser perfeito para história, mas um post de blog de 10 minutos atrás é melhor para o mercado de ações de hoje.
O Editor (GeneratorAgent): Este é o verificador de fatos. O Pesquisador envia um monte de documentos para o Editor. O Editor os lê, extrai os fatos principais e procura por conflitos.
- A Verificação de "Contradição": Se uma fonte diz "O céu é azul" e outra diz "O céu é verde", o Editor não apenas adivinha. Ele sinaliza isso como um problema. Se o conflito for sério, o Editor envia o Pesquisador de volta para buscar mais evidências para resolver a discussão. Ele só faz isso algumas vezes para evitar ficar preso em um loop infinito.
O Escritor (WriterAgent): Este é o contador de histórias. Uma vez que o Editor possui uma lista de fatos limpa e verificada, o Escritor os transforma em uma resposta fluida e legível.
- A Regra de Ouro: Cada frase que o Escritor produz deve ter um "recibo" anexado a ela (uma citação). Você não pode apenas dizer algo; você tem que provar de onde ouviu aquilo. Isso torna a resposta final totalmente rastreável.
2. Por que Eles Venceram (O Prêmio "Avaliação Dinâmica")
Na competição, houve duas maneiras principais de julgar os sistemas:
- O Juiz Robô: Um programa de computador que verifica se a resposta usa as mesmas palavras que a resposta "perfeita".
- O Juiz Humano: Pessoas reais que leem as respostas e escolhem a que mais gostaram.
O Problema com o Juiz Robô:
O NightFeats na verdade pontuou menor no teste do Juiz Robô (especificamente em uma métrica chamada ROUGE-L). Por quê? Porque o NightFeats inclui muitas citações e referências (como "Fonte A, Fonte B"). O Juiz Robô pensou: "Esta resposta tem palavras e números extras demais, não coincide exatamente com a resposta perfeita!".
A Vitória com o Juiz Humano:
Humanos reais, no entanto, amaram o NightFeats. Eles o preferiram em relação a sistemas caros e de alta tecnologia como "Claude-SonnetV2" e "Nova-Pro". Os humanos perceberam que uma resposta com fontes claras e fatos verificados é muito mais confiável do que uma resposta que apenas soa bem, mas que pode ser inventada.
3. A Filosofia Central
O artigo argumenta que construir IA não deve ser apenas sobre enganar um computador para obter uma pontuação alta. Deve ser sobre construir um sistema que:
- Verifica o próprio trabalho (como um verificador de fatos).
- Sabe quando as coisas são antigas (consciência temporal).
- Mostra suas fontes (rastreabilidade de citação).
O Trade-off (A Troca)
O artigo é honesto sobre um ponto negativo: Como o NightFeats precisa enviar o Pesquisador para verificar fatos e o Editor para verificar contradições, leva um pouco mais de tempo para obter uma resposta (cerca de 10–15 segundos) em comparação com um sistema mais rápido e simples (6–8 segundos).
Em Resumo:
O NightFeats é como uma redação de alto nível que se recusa a publicar uma história até que três pessoas diferentes tenham checado os fatos, verificado as datas e anexado recibos a cada afirmação. Embora isso leve um pouco mais de tempo e possa parecer "mais bagunçado" para um scanner de computador, as pessoas reais confiam mais nele porque é honesto, preciso e transparente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.