Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery
यह शोध पत्र यह प्रदर्शित करता है कि जबकि लार्ज रीजनिंग मॉडल्स (Large Reasoning Models) में आक्रामक 2-बिट क्वांटाइजेशन अक्सर दोहराव वाले लूप और विलंबित प्रतिबद्धता (delayed commitment) जैसी जनरेशन पैथोलॉजी के कारण एंड-टू-एंड धीमापन का कारण बनता है, इन समस्याओं को FP16 प्लानिंग और लूप रेस्क्यू जैसे हल्के नियंत्रणों के माध्यम से प्रभावी ढंग से कम किया जा सकता है, जिससे वास्तविक अनुमान गति (real inference speed) को बनाए रखते हुए उच्च सटीकता प्राप्त की जा सकती है।