← Últimos artículos
💻 computer science

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Este artículo presenta Deepchecks, un marco integral diseñado para abordar los desafíos complejos de evaluar los sistemas de Generación Aumentada por Recuperación (RAG) mediante una evaluación multifacética, un análisis de causas raíz y un monitoreo de producción para garantizar la fiabilidad, la relevancia y la alineación con los requisitos específicos de la aplicación.

Autores originales: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Publicado 2026-05-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente muy inteligente y hablador (un Modelo de Lenguaje Grande, o LLM). Este asistente es excelente escribiendo historias y respondiendo preguntas, pero tiene un mal hábito: a veces inventa cosas completamente, o da respuestas genéricas que no encajan del todo en la situación específica. Esto es como un estudiante que memorizó un libro de texto pero olvidó verificar los detalles específicos de la pregunta del deber, lo que lleva a respuestas seguras pero incorrectas.

Para solucionar esto, los desarrolladores crearon un sistema llamado RAG (Generación Aumentada por Recuperación). Piensa en RAG como darle a ese asistente inteligente una credencial de biblioteca y un bibliotecario.

  1. El Bibliotecario (Recuperación): Antes de que el asistente responda, el bibliotecario busca rápidamente en la biblioteca (una base de datos de documentos) para encontrar las páginas exactas relevantes para la pregunta.
  2. El Asistente (Generación): El asistente lee esas páginas y luego escribe la respuesta, utilizando los libros de la biblioteca como su fuente de verdad.

El Problema:
Incluso con un bibliotecario, el sistema aún puede fallar. El bibliotecario podría sacar los libros equivocados, o el asistente podría ignorar los libros e inventar cosas de todos modos. El artículo explica que verificar si todo este sistema funciona bien es increíblemente difícil porque hay muchas partes móviles.

La Solución: Deepchecks
Los autores presentan Deepchecks, que actúa como un inspector de control de calidad superestricto para estos sistemas RAG. En lugar de simplemente dar una sola calificación de "aprobado/reprobado", Deepchecks descompone el sistema en "propiedades" específicas para verificar, muy parecido a un mecánico de automóviles que revisa diferentes partes de un motor.

Así es como Deepchecks inspecciona el sistema, usando analogías simples:

1. Las Tres Verificaciones Principales (Las "Propiedades")

Deepchecks examina tres cosas específicas para asegurar que la respuesta sea buena:

  • Relevancia de la Recuperación (¿Encontró el bibliotecario los libros correctos?):
    • Analogía: Si preguntas "¿Cómo horneo un pastel?", el bibliotecario no debería entregarte un libro sobre "Cómo reparar un coche". Deepchecks verifica si los documentos recuperados son realmente útiles para la pregunta.
  • Basado en el Contexto (¿Se mantuvo el asistente a los libros?):
    • Analogía: Este es el detector de "alucinaciones". Si el libro dice que el pastel necesita 2 huevos, pero el asistente dice 10 huevos, Deepchecks atrapa esa mentira. Verifica que cada hecho en la respuesta esté realmente respaldado por los documentos que encontró el bibliotecario.
  • Completitud (¿Respondió el asistente toda la pregunta?):
    • Analogía: Si preguntaste "¿Cómo horneo un pastel y a qué temperatura debe estar el horno?", la respuesta no debería decir simplemente "Ponlo en el horno". Deepchecks verifica si el asistente cubrió todas las partes de tu solicitud.

(También hay una Verificación de Seguridad para asegurar que el asistente no sea grosero, no filtre información privada ni diga nada peligroso.)

2. La Puntuación "Holística" (La Calificación Final)

La mayoría de las herramientas solo te dan una lista de puntuaciones para las partes anteriores. Deepchecks da un paso más. Utiliza un "mecanismo de agregación" inteligente (una fórmula aprendida) para combinar todas esas puntuaciones en una sola calificación final: Positiva, Negativa o Desconocida.

  • Positiva: El bibliotecario encontró los libros correctos, y el asistente respondió perfectamente basándose en ellos.
  • Negativa: Algo salió mal (libros equivocados, hechos inventados o respuesta incompleta).
  • Desconocida: No fue terrible, pero no alcanzó del todo la barra alta de "perfecto".

3. Las Herramientas de Detective (Análisis de Causa Raíz)

Si el sistema obtiene una calificación "Negativa", Deepchecks no solo te dice que falló; actúa como un detective para decirte por qué.

  • Analogía: Imagina que un coche se avería. Un mecánico básico dice: "Está roto". Deepchecks dice: "El motor está bien, pero los neumáticos están desinflados".
  • Esto ayuda a los desarrolladores a saber exactamente dónde solucionar el problema: ¿Necesitan un bibliotecario mejor (mejor recuperación)? ¿O necesitan entrenar al asistente para escuchar mejor (mejor generación)?

4. La "Máquina del Tiempo" (Comparación de Versiones y Monitoreo)

Deepchecks también te permite comparar diferentes versiones de tu sistema lado a lado.

  • Analogía: Es como comparar el rendimiento de un coche antes y después de cambiar los neumáticos. ¿Los neumáticos nuevos lo hicieron más rápido?
  • También vigila el sistema mientras se ejecuta en el mundo real. Si el sistema empieza a empeorar con el tiempo (quizás porque los libros de la biblioteca cambiaron o las preguntas de los usuarios cambiaron), Deepchecks levanta una alarma inmediatamente.

Lo que el Artículo Encontró

Los autores probaron Deepchecks frente a otras herramientas populares (como RAGAS y LangSmith) utilizando:

  1. Conjuntos de Datos Públicos: Preguntas de prueba estándar que todos conocen.
  2. Conjuntos de Datos de Clientes: Ejemplos del mundo real de empresas reales (como chats de soporte técnico y revisiones de candidatos a empleos).

El Resultado: Deepchecks fue mejor detectando errores, especialmente en los datos de clientes del mundo real. Mientras que otras herramientas a veces pasaban por alto errores o daban calificaciones inconsistentes, Deepchecks fue más preciso al identificar cuándo el sistema estaba mintiendo (alucinando) o dando respuestas irrelevantes.

En Resumen:
Deepchecks es un kit de herramientas integral que asegura que tu asistente de IA no solo hable con confianza, sino que esté realmente diciendo la verdad basándose en los documentos que le diste. Verifica al bibliotecario, verifica al escritor, verifica la seguridad y te da un boletín de calificaciones claro para que puedas arreglar exactamente lo que está roto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →