NightFeats @ MMU-RAGent NeurIPS 2025: A Context-Optimized Multi-Agent RAG System for the Text-to-Text Track
NightFeats es un sistema RAG de agentes múltiples y optimizado por contexto que ganó el Mejor Mejor Evaluación Dinámica en NeurIPS 2025 mediante el empleo de un pipeline de tres fases basado en principios de recuperación, curación y composición para superar a los baselines propietarios a través de la transparencia arquitectónica y la fundamentación en evidencia verificable en lugar de una optimización de métricas estrecha.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando escribir un informe perfecto y confiable sobre un tema complejo, pero tienes un equipo de tres especialistas trabajando juntos en lugar de una sola persona haciendo todo sola. Eso es esencialmente lo que es NightFeats: un equipo inteligente de tres agentes de IA diseñado para responder preguntas con precisión, revisar su propio trabajo y siempre mostrar su tarea (citas).
El equipo entró recientemente en una gran competición llamada MMU-RAGent en NeurIPS 2025. Mientras otros equipos intentaban ganar simplemente haciendo que sus respuestas parecieran las "correctas" ante un examen computacional, NightFeats ganó un premio especial llamado "Best Dynamic Evaluation" (Mejor Evaluación Dinámica). Esto significa que humanos reales prefirieron sus respuestas porque eran más fiables y fáciles de confiar, incluso si la puntuación automática de la computadora no les otorgaba los puntos más altos.
Así es como trabaja el equipo de NightFeats, desglosado en pasos sencillos:
1. Los Tres Especialistas (Los Agentes)
En lugar de una sola IA intentando hacerlo todo a la vez, NightFeats divide el trabajo en tres roles distintos, como una redacción de noticias:
El Investigador (ResearchAgent): Este es el detective. Cuando le haces una pregunta, el Investigador no solo agarra la primera cosa que encuentra. Sale a buscar información de dos lugares diferentes:
- La Biblioteca "Fresca": Para noticias o eventos recientes, busca en los resultados web más actuales.
- La Biblioteca de la "Historia": Para hechos fundacionales antiguos, profundiza en archivos masivos.
- El Truco: Utiliza una fórmula especial para equilibrar la relevancia (qué tan buena es la respuesta) con la actualidad (qué tan nueva es). Es como un bibliotecario que sabe que un libro de hace 10 años puede ser perfecto para la historia, pero un blog de hace 10 minutos es mejor para el mercado de valores de hoy.
El Editor (GeneratorAgent): Este es el verificador de hechos. El Investigador envía un montón de documentos al Editor. El Editor los lee, extrae los hechos clave y busca conflictos.
- La Verificación de "Contradicción": Si una fuente dice "El cielo es azul" y otra dice "El cielo es verde", el Editor no solo adivina. Marca esto como un problema. Si el conflicto es serio, el Editor envía al Investigador de vuelta a buscar más evidencia para resolver la disputa. Solo hace esto un par de veces para evitar quedarse atrapado en un bucle infinito.
El Escritor (WriterAgent): Este es el narrador. Una vez que el Editor tiene una lista de hechos limpia y verificada, el Escritor los convierte en una respuesta fluida y legible.
- La Regla de Oro: Cada una de las oraciones que produce el Escritor debe tener un "recibo" adjunto (una cita). No puedes simplemente decir algo; tienes que demostrar de dónde lo escuchaste. Esto hace que la respuesta final sea totalmente trazable.
2. Por qué Ganaron (El Premio "Dynamic Evaluation")
En la competición, hubo dos formas principales de juzgar los sistemas:
- El Juez Robot: Un programa de computadora que verifica si la respuesta utiliza las mismas palabras que la respuesta "perfecta".
- El Juez Humano: Personas reales que leen las respuestas y eligen la que más les gusta.
El Problema con el Juez Robot:
NightFeats en realidad obtuvo una puntuación menor en la prueba del Juez Robot (específicamente en una métrica llamada ROUGE-L). ¿Por qué? Porque NightFeats incluye muchas citas y referencias (como "Fuente A, Fuente B"). El Juez Robot pensó: "¡Esta respuesta tiene demasiadas palabras y números extra, no coincide exactamente con la respuesta perfecta!".
El Triunfo con el Juez Humano:
Los humanos reales, sin embargo, amaron a NightFeats. Lo prefirieron por encima de sistemas costosos y de alta tecnología como "Claude-SonnetV2" y "Nova-Pro". Los humanos se dieron cuenta de que una respuesta con fuentes claras y hechos verificados es mucho más confiable que una respuesta que simplemente suena bien pero que podría ser inventada.
3. La Filosofía Central
El artículo sostiene que construir IA no debería tratar solo de engañar a una computadora para que dé una puntuación alta. Debería tratarse de construir un sistema que:
- Revisa su propio trabajo (como un verificador de hechos).
- Sabe cuándo las cosas son viejas (conciencia temporal).
- Muestra sus fuentes (trazabilidad de citas).
El Intercambio (Trade-off)
El artículo es honesto sobre un inconveniente: Debido a que NightFeats tiene que enviar al Investigador a verificar hechos y al Editor a verificar contradicciones, tarda un poco más en obtener una respuesta (unos 10–15 segundos) en comparación con un sistema más rápido y simple (6–8 segundos).
En Resumen:
NightFeats es como una redacción de alto nivel que se niega a publicar una historia hasta que tres personas diferentes hayan verificado los hechos, validado las fechas y adjuntado recibos a cada afirmación. Aunque esto tome un poco más de tiempo y pueda parecer más "desordenado" para un escáner de computadora, la gente real confía más en él porque es honesto, preciso y transparente.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.