Runtime-Certified Bounded-Error Quantized Attention
Dieser Beitrag stellt eine gestufte KV-Cache-Architektur vor, die eine zur Laufzeit zertifizierte quantisierte Aufmerksamkeit mit begrenztem Fehler ermöglicht, indem online Fehlergrenzen berechnet werden, um eine adaptive Präzisionsauswahl und einen deterministischen FP16-Fallback auszulösen, wodurch eine Wiederherstellung exakter dichter Aufmerksamkeitsergebnisse bei gleichzeitiger Aufrechterhaltung einer hohen Kompression für die Inferenz von LLMs mit langem Kontext garantiert wird.