A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases
प्रतिनिधित्व लेंसों (representation lenses) को परतों के माध्यम से प्रेडिक्टिव रीडआउट सबस्पेस (predictive readout subspaces) के विकास को ट्रैक करने के लिए ज्यामितीय नैदानिक उपकरणों के रूप में पुनरुद्देश्यित करके, यह अध्ययन प्रकट करता है कि बड़े भाषा मॉडल अगले-टोकन भविष्यवाणी (next-token prediction) को तीन विशिष्ट ज्यामितीय चरणों—सीडिंग मल्टीप्लेक्सिंग (Seeding Multiplexing), होइस्टिंग ओवरराइडिंग (Hoisting Overriding), और फोकल कन्वर्जेंस (Focal Convergence)—के माध्यम से संसाधित करते हैं, जहाँ मॉडल की बढ़ती गहराई मुख्य रूप से प्रतिनिधित्व क्षमता का विस्तार करने के बजाय उम्मीदवार विसंयोजन (candidate disambiguation) को बढ़ाती है।