Visual, OCR-Text, and Hybrid Evidence Retrieval for Document Visual Question Answering: A Controlled Failure Analysis
Este estudio demuestra que, si bien la recuperación de páginas basada en lo visual mejora significativamente la selección de evidencia y la calidad de las respuestas derivadas en el Document Visual Question Answering en comparación con los métodos léxicos, persisten brechas sustanciales de rendimiento debido a las limitaciones en la generación de respuestas incluso cuando se proporciona la página correcta, y la fusión híbrida no ofrece ningún beneficio adicional sobre los recuperadores visuales fuertes por sí solos.