TEMPO: Scaling Test-time Training for Large Reasoning Models
यह शोध पत्र TEMPO का प्रस्ताव करता है, जो एक टेस्ट-टाइम ट्रेनिंग फ्रेमवर्क है जो अनलेबल डेटा पर पॉलिसी रिफाइनमेंट को लेबल किए गए डेटा पर आवधिक क्रिटिक रीकैलिब्रेशन के साथ इंटरलीव करता है ताकि लार्ज रीजनिंग मॉडल्स में प्रदर्शन प्लेटो और डाइवर्सिटी कोलैप्स को दूर किया जा सके, जिससे गणितीय तर्क बेंचमार्क पर महत्वपूर्ण सटीकता लाभ प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र हैं जो दुनिया की सबसे कठिन गणित प्रतियोगिता (जैसे AIME) की तैयारी कर रहे हैं। आपने कड़ी मेहनत की है, लेकिन जैसे ही परीक्षा शुरू होती है, आप उत्तर नहीं देख सकते या अपने शिक्षक से मदद नहीं मांग सकते। आपको केवल उसी पर भरोसा करना है जो आप जानते हैं।
वर्तमान AI के साथ समस्या:
अधिकांश उन्नत AI मॉडल (जिन्हें लार्ज रीजनिंग मॉडल्स कहा जाता है) उन छात्रों की तरह हैं जो परीक्षा शुरू होते ही सीखना बंद कर देते हैं। वे किसी समस्या को सुलझाने के लिए बहुत अधिक मानसिक शक्ति का उपयोग करते हैं, लेकिन वे सीखने के दौरान अपने मस्तिष्क (brain) को वास्तव में बदलते नहीं हैं।
कुछ नए तरीके इस समस्या को ठीक करने की कोशिश करते हैं, जिससे AI परीक्षा देते समय खुद को "ग्रेड" दे सके। वह सोचता है, "हम्म, यह उत्तर सही लग रहा है," और अपने मस्तिष्क को अपडेट करता है।
- खामी: यह एक ऐसे छात्र की तरह है जो गणित में कमजोर है और खुद अपने होमवर्क को ग्रेड दे रहा है। शुरुआत में, वह कुछ चीजें सही कर सकता है। लेकिन जल्द ही, वह अपने गलत उत्तरों के प्रति आश्वस्त होने लगता है। वह खुद को समझाने लगता है, "मुझे यकीन है कि यह सही है!" और अन्य संभावनाओं को तलाशना बंद कर देता है। वह अति-आत्मविश्वास के चक्र में फंस जाता है, उसका प्रदर्शन एक सीमा पर आकर रुक जाता है, और वह बेहतर होना बंद कर देता है। वह रचनात्मक समाधान भी आज़माना बंद कर देता है, केवल उन्हीं कुछ पैटर्नों को दोहराता रहता है जिन्हें वह लगता है कि काम करते हैं।
समाधान: TEMPO
यह शोध पत्र TEMPO (टेस्ट-टाइम एक्सपेक्टेशन-मैक्सिमाइज़ेशन पॉलिसी ऑप्टिमाइज़ेशन) पेश करता है। TEMPO को खुद को ग्रेड देने वाले छात्र के रूप में नहीं, बल्कि एक स्मार्ट, बारी-बारी से आने वाले ट्यूटर (शिक्षक) वाले छात्र के रूप में सोचें।
TEMPO कैसे काम करता है, इसे एक सरल उपमा (analogy) का उपयोग करके यहाँ समझाया गया है:
दो चरणों वाला नृत्य: "ट्यूटर" और "छात्र"
TEMPO काम को दो भूमिकाओं में विभाजित करता है जो बारी-बारी से काम करती हैं:
- छात्र (द पॉलिसी): यह वह AI है जो कठिन, बिना लेबल वाले समस्याओं (परीक्षा के प्रश्नों) को हल करने की कोशिश कर रहा है। यह उत्तर उत्पन्न करता है और उनसे सीखने का प्रयास करता है।
- ट्यूटर (द क्रिटिक): यह एक अलग AI मॉडल है जिसका एकमात्र काम छात्र के उत्तरों को ग्रेड देना है।
सीक्रेट सॉस: "रीकैलिब्रेशन" ब्रेक
अधिकांश अन्य तरीके AI को हमेशा के लिए खुद को ग्रेड देने देते हैं। TEMPO कुछ अलग करता है। यह एक सख्त कार्यक्रम का पालन करता है:
- चरण 1: छात्र समाधान करता है (M-Step)। छात्र कई कठिन, अनसुलझे प्रश्नों पर काम करता है। वह सीखने और सुधार करने के लिए ट्यूटर के वर्तमान ग्रेडिंग कौशल का उपयोग करता है।
- चरण 2: ट्यूटर वास्तविकता की जांच करता है (E-Step)। यही जादुई हिस्सा है। इससे पहले कि छात्र बहुत अधिक आत्मविश्वासी हो जाए, ट्यूटर छात्र के काम को ग्रेड देना बंद कर देता है। इसके बजाय, ट्यूटर सही उत्तरों वाली एक पाठ्यपुस्तक (textbook) पर वापस जाता है (एक लेबल किया गया डेटासेट) और सही ढंग से ग्रेड करना फिर से सीखता है। यह सुनिश्चित करता है कि उसके ग्रेडिंग के मानक भटक न जाएं।
यह क्यों काम करता है:
- "नशे में ग्रेड देने वाले" (Drunk Grader) प्रभाव को रोकता है: यदि ट्यूटर केवल छात्र के काम को ग्रेड देता रहेगा, तो वह अंततः छात्र की गलतियों के साथ सहमत होने लगेगा (क्योंकि छात्र ही एकमात्र उत्तर उत्पन्न कर रहा है)। छात्र के काम को बीच-बीच में "पाठ्यपुस्तक" (सही उत्तरों) के माध्यम से ट्यूटर को मजबूर करके, TEMPO ग्रेडिंग को ईमानदार बनाए रखता है।
- रचनात्मकता को जीवित रखता है: क्योंकि ट्यूटर ईमानदार है, वह केवल "सबसे सामान्य" उत्तर को पुरस्कृत नहीं करता है। वह अच्छे उत्तरों को पुरस्कृत करता है, भले ही वे अद्वितीय हों। यह AI को एक उबाऊ, दोहराव वाले लूप में ढहने से रोकता है।
परिणाम: क्या हुआ?
शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे AIME 2024 और 2025) पर इसका परीक्षण किया।
- पुराना तरीका: AI थोड़ा बेहतर होता था, एक दीवार से टकराता था और फिर सुधार करना बंद कर देता था। वह एक ही उत्तर बार-बार देने भी लगता था।
- TEMPO का तरीका: AI जितना अधिक अभ्यास करता गया, उतना ही स्मार्ट होता गया।
- एक मॉडल (OLMO3-7B) की सटीकता 33% से बढ़कर 51% हो गई।
- दूसरा मॉडल (Qwen3-14B) 42% से बढ़कर 65% हो गया।
इससे भी अधिक प्रभावशाली बात यह है कि जबकि अन्य तरीके लगातार 16 बार एक ही उत्तर देने लगे (डाइवर्सिटी कोलैप्स), TEMPO ने 16 अलग-अलग उच्च-गुणवत्ता वाले समाधान उत्पन्न करना जारी रखा।
बड़ी तस्वीर (The Big Picture)
TEMPO को एक अंधेरे कमरे में अकेले अभ्यास करने (जहाँ आप अपनी बुरी आदतों को मजबूत कर सकते हैं) बनाम एक कोच के साथ अभ्यास करने (जो यह सुनिश्चित करने के लिए कभी-कभी नियम पुस्तिका की जांच करता है कि वे आपको गलत चालें तो नहीं सिखा रहे हैं) के बीच के अंतर के रूप में देखें।
"काम करने" और "नियमों की जांच करने" के बीच बारी-बारी से चलकर, TEMPO को यह क्षमता मिलती है कि वह अपने औपचारिक प्रशिक्षण को समाप्त करने के बाद भी सीखना और सुधारना जारी रख सके, जिससे "टेस्ट टाइम" सीखने के एक नए युग में बदल जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।