Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models
यह शोध पत्र प्रकट करता है कि रीजनिंग मॉडल्स का लो-बिट क्वांटाइजेशन, सटीकता को बनाए रखते हुए भी, अक्सर मध्यवर्ती चरणों और पुनरावृत्ति के माध्यम से चेन्स ऑफ थॉट (chains of thought) की लंबाई बढ़ाकर एक छिपी हुई लागत उत्पन्न करता है, जिससे अपेक्षित इन्फरेंस स्पीडअप (inference speedup) निष्प्रभावी हो जाता है और सटीकता मेट्रिक्स के साथ टोकन उपयोग की रिपोर्ट करना आवश्यक हो जाता है।