How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation
Este artículo evalúa sistemáticamente cinco métodos de detección de alucinaciones ligeros y viables para CPU en tareas de respuesta a preguntas, diálogo y resumen, revelando que el rendimiento depende altamente de la tarea, con los métodos de ensamble sobresaliendo en QA, los detectores de NLI liderando en diálogo y todos los enfoques fallando significativamente en el resumen.