Runtime-Certified Bounded-Error Quantized Attention
Este artículo presenta una arquitectura de caché KV escalonada que habilita la atención cuantizada con error acotado certificado en tiempo de ejecución mediante el cálculo en línea de límites de error para activar la selección de precisión adaptativa y una reversión determinista a FP16, garantizando así la recuperación de salidas de atención densa exactas mientras se mantiene una alta compresión para la inferencia de LLM de contexto largo.