← Últimos artigos
💬 NLP

NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track

O NightFeats é um sistema RAG de múltiplos agentes e contexto otimizado que conquistou o prêmio de Melhor Avaliação Dinâmica no NeurIPS 2025 ao empregar um pipeline principológico de três fases de recuperação, curadoria e composição para superar baselines proprietários através de transparência arquitetônica e fundamentação de evidências verificáveis em vez de otimização métrica estreita.

Autores originais: Quentin Fever, Naziha Aslam

Publicado 2026-06-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Quentin Fever, Naziha Aslam

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever um relatório perfeito e confiável sobre um tópico complexo, mas tem uma equipe de três especialistas trabalhando juntos em vez de uma única pessoa fazendo tudo sozinha. Isso é essencialmente o que o NightFeats é: uma equipe inteligente de três agentes de IA projetada para responder perguntas com precisão, verificar o próprio trabalho e sempre mostrar o seu "dever de casa" (citações).

A equipe entrou recentemente em uma grande competição chamada MMU-RAGent na NeurIPS 2025. Enquanto outras equipes tentaram vencer apenas fazendo com que suas respostas parecessem as "corretas" em um teste de computador, o NightFeats ganhou um prêmio especial chamado "Melhor Avaliação Dinâmica" (Best Dynamic Evaluation). Isso significa que humanos reais preferiram suas respostas porque elas eram mais confiáveis e fáceis de confiar, mesmo que a pontuação automática do computador não tenha dado os pontos mais altos.

Aqui está como a equipe NightFeats trabalha, dividido em etapas simples:

1. Os Três Especialistas (Os Agentes)

Em vez de uma única IA tentando fazer tudo de uma vez, o NightFeats divide o trabalho em três funções distintas, como uma redação de jornal:

  • O Pesquisador (ResearchAgent): Este é o detetive. Quando você faz uma pergunta, o Pesquisador não apenas pega a primeira coisa que encontra. Ele sai em busca de informações de dois lugares diferentes:

    • A Biblioteca "Fresca": Para notícias ou eventos recentes, ele busca os resultados mais recentes da web.
    • A Biblioteca "Histórica": Para fatos antigos e fundamentais, ele vasculha arquivos massivos.
    • O Truque: Ele usa uma fórmula especial para equilibrar relevância (o quão boa é a resposta) com atualidade (o quão nova ela é). É como um bibliotecário que sabe que um livro de 10 anos atrás pode ser perfeito para história, mas um post de blog de 10 minutos atrás é melhor para o mercado de ações de hoje.
  • O Editor (GeneratorAgent): Este é o verificador de fatos. O Pesquisador envia um monte de documentos para o Editor. O Editor os lê, extrai os fatos principais e procura por conflitos.

    • A Verificação de "Contradição": Se uma fonte diz "O céu é azul" e outra diz "O céu é verde", o Editor não apenas adivinha. Ele sinaliza isso como um problema. Se o conflito for sério, o Editor envia o Pesquisador de volta para buscar mais evidências para resolver a discussão. Ele só faz isso algumas vezes para evitar ficar preso em um loop infinito.
  • O Escritor (WriterAgent): Este é o contador de histórias. Uma vez que o Editor possui uma lista de fatos limpa e verificada, o Escritor os transforma em uma resposta fluida e legível.

    • A Regra de Ouro: Cada frase que o Escritor produz deve ter um "recibo" anexado a ela (uma citação). Você não pode apenas dizer algo; você tem que provar de onde ouviu aquilo. Isso torna a resposta final totalmente rastreável.

2. Por que Eles Venceram (O Prêmio "Avaliação Dinâmica")

Na competição, houve duas maneiras principais de julgar os sistemas:

  1. O Juiz Robô: Um programa de computador que verifica se a resposta usa as mesmas palavras que a resposta "perfeita".
  2. O Juiz Humano: Pessoas reais que leem as respostas e escolhem a que mais gostaram.

O Problema com o Juiz Robô:
O NightFeats na verdade pontuou menor no teste do Juiz Robô (especificamente em uma métrica chamada ROUGE-L). Por quê? Porque o NightFeats inclui muitas citações e referências (como "Fonte A, Fonte B"). O Juiz Robô pensou: "Esta resposta tem palavras e números extras demais, não coincide exatamente com a resposta perfeita!".

A Vitória com o Juiz Humano:
Humanos reais, no entanto, amaram o NightFeats. Eles o preferiram em relação a sistemas caros e de alta tecnologia como "Claude-SonnetV2" e "Nova-Pro". Os humanos perceberam que uma resposta com fontes claras e fatos verificados é muito mais confiável do que uma resposta que apenas soa bem, mas que pode ser inventada.

3. A Filosofia Central

O artigo argumenta que construir IA não deve ser apenas sobre enganar um computador para obter uma pontuação alta. Deve ser sobre construir um sistema que:

  • Verifica o próprio trabalho (como um verificador de fatos).
  • Sabe quando as coisas são antigas (consciência temporal).
  • Mostra suas fontes (rastreabilidade de citação).

O Trade-off (A Troca)

O artigo é honesto sobre um ponto negativo: Como o NightFeats precisa enviar o Pesquisador para verificar fatos e o Editor para verificar contradições, leva um pouco mais de tempo para obter uma resposta (cerca de 10–15 segundos) em comparação com um sistema mais rápido e simples (6–8 segundos).

Em Resumo:
O NightFeats é como uma redação de alto nível que se recusa a publicar uma história até que três pessoas diferentes tenham checado os fatos, verificado as datas e anexado recibos a cada afirmação. Embora isso leve um pouco mais de tempo e possa parecer "mais bagunçado" para um scanner de computador, as pessoas reais confiam mais nele porque é honesto, preciso e transparente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →