Visual, OCR-Text, and Hybrid Evidence Retrieval for Document Visual Question Answering: A Controlled Failure Analysis
Diese Studie zeigt, dass die visuell basierte Seitensuche die Evidenzauswahl und die nachgeschaltete Antwortqualität bei Document Visual Question Answering im Vergleich zu lexikalischen Methoden zwar signifikant verbessert, jedoch erhebliche Leistungsunterschiede bestehen bleiben, da die Antwortgenerierung selbst dann Einschränkungen aufweist, wenn die korrekte Seite bereitgestellt wird, und eine hybride Fusion keinen zusätzlichen Nutzen gegenüber starken visuellen Retrievern allein bietet.