← नवीनतम पेपर
🤖 machine learning

TEMPO: Scaling Test-time Training for Large Reasoning Models

यह शोध पत्र TEMPO का प्रस्ताव करता है, जो एक टेस्ट-टाइम ट्रेनिंग फ्रेमवर्क है जो अनलेबल डेटा पर पॉलिसी रिफाइनमेंट को लेबल किए गए डेटा पर आवधिक क्रिटिक रीकैलिब्रेशन के साथ इंटरलीव करता है ताकि लार्ज रीजनिंग मॉडल्स में प्रदर्शन प्लेटो और डाइवर्सिटी कोलैप्स को दूर किया जा सके, जिससे गणितीय तर्क बेंचमार्क पर महत्वपूर्ण सटीकता लाभ प्राप्त होता है।

मूल लेखक: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली छात्र हैं जो दुनिया की सबसे कठिन गणित प्रतियोगिता (जैसे AIME) की तैयारी कर रहे हैं। आपने कड़ी मेहनत की है, लेकिन जैसे ही परीक्षा शुरू होती है, आप उत्तर नहीं देख सकते या अपने शिक्षक से मदद नहीं मांग सकते। आपको केवल उसी पर भरोसा करना है जो आप जानते हैं।

वर्तमान AI के साथ समस्या:
अधिकांश उन्नत AI मॉडल (जिन्हें लार्ज रीजनिंग मॉडल्स कहा जाता है) उन छात्रों की तरह हैं जो परीक्षा शुरू होते ही सीखना बंद कर देते हैं। वे किसी समस्या को सुलझाने के लिए बहुत अधिक मानसिक शक्ति का उपयोग करते हैं, लेकिन वे सीखने के दौरान अपने मस्तिष्क (brain) को वास्तव में बदलते नहीं हैं।

कुछ नए तरीके इस समस्या को ठीक करने की कोशिश करते हैं, जिससे AI परीक्षा देते समय खुद को "ग्रेड" दे सके। वह सोचता है, "हम्म, यह उत्तर सही लग रहा है," और अपने मस्तिष्क को अपडेट करता है।

  • खामी: यह एक ऐसे छात्र की तरह है जो गणित में कमजोर है और खुद अपने होमवर्क को ग्रेड दे रहा है। शुरुआत में, वह कुछ चीजें सही कर सकता है। लेकिन जल्द ही, वह अपने गलत उत्तरों के प्रति आश्वस्त होने लगता है। वह खुद को समझाने लगता है, "मुझे यकीन है कि यह सही है!" और अन्य संभावनाओं को तलाशना बंद कर देता है। वह अति-आत्मविश्वास के चक्र में फंस जाता है, उसका प्रदर्शन एक सीमा पर आकर रुक जाता है, और वह बेहतर होना बंद कर देता है। वह रचनात्मक समाधान भी आज़माना बंद कर देता है, केवल उन्हीं कुछ पैटर्नों को दोहराता रहता है जिन्हें वह लगता है कि काम करते हैं।

समाधान: TEMPO
यह शोध पत्र TEMPO (टेस्ट-टाइम एक्सपेक्टेशन-मैक्सिमाइज़ेशन पॉलिसी ऑप्टिमाइज़ेशन) पेश करता है। TEMPO को खुद को ग्रेड देने वाले छात्र के रूप में नहीं, बल्कि एक स्मार्ट, बारी-बारी से आने वाले ट्यूटर (शिक्षक) वाले छात्र के रूप में सोचें।

TEMPO कैसे काम करता है, इसे एक सरल उपमा (analogy) का उपयोग करके यहाँ समझाया गया है:

दो चरणों वाला नृत्य: "ट्यूटर" और "छात्र"

TEMPO काम को दो भूमिकाओं में विभाजित करता है जो बारी-बारी से काम करती हैं:

  1. छात्र (द पॉलिसी): यह वह AI है जो कठिन, बिना लेबल वाले समस्याओं (परीक्षा के प्रश्नों) को हल करने की कोशिश कर रहा है। यह उत्तर उत्पन्न करता है और उनसे सीखने का प्रयास करता है।
  2. ट्यूटर (द क्रिटिक): यह एक अलग AI मॉडल है जिसका एकमात्र काम छात्र के उत्तरों को ग्रेड देना है।

सीक्रेट सॉस: "रीकैलिब्रेशन" ब्रेक
अधिकांश अन्य तरीके AI को हमेशा के लिए खुद को ग्रेड देने देते हैं। TEMPO कुछ अलग करता है। यह एक सख्त कार्यक्रम का पालन करता है:

  • चरण 1: छात्र समाधान करता है (M-Step)। छात्र कई कठिन, अनसुलझे प्रश्नों पर काम करता है। वह सीखने और सुधार करने के लिए ट्यूटर के वर्तमान ग्रेडिंग कौशल का उपयोग करता है।
  • चरण 2: ट्यूटर वास्तविकता की जांच करता है (E-Step)। यही जादुई हिस्सा है। इससे पहले कि छात्र बहुत अधिक आत्मविश्वासी हो जाए, ट्यूटर छात्र के काम को ग्रेड देना बंद कर देता है। इसके बजाय, ट्यूटर सही उत्तरों वाली एक पाठ्यपुस्तक (textbook) पर वापस जाता है (एक लेबल किया गया डेटासेट) और सही ढंग से ग्रेड करना फिर से सीखता है। यह सुनिश्चित करता है कि उसके ग्रेडिंग के मानक भटक न जाएं।

यह क्यों काम करता है:

  • "नशे में ग्रेड देने वाले" (Drunk Grader) प्रभाव को रोकता है: यदि ट्यूटर केवल छात्र के काम को ग्रेड देता रहेगा, तो वह अंततः छात्र की गलतियों के साथ सहमत होने लगेगा (क्योंकि छात्र ही एकमात्र उत्तर उत्पन्न कर रहा है)। छात्र के काम को बीच-बीच में "पाठ्यपुस्तक" (सही उत्तरों) के माध्यम से ट्यूटर को मजबूर करके, TEMPO ग्रेडिंग को ईमानदार बनाए रखता है।
  • रचनात्मकता को जीवित रखता है: क्योंकि ट्यूटर ईमानदार है, वह केवल "सबसे सामान्य" उत्तर को पुरस्कृत नहीं करता है। वह अच्छे उत्तरों को पुरस्कृत करता है, भले ही वे अद्वितीय हों। यह AI को एक उबाऊ, दोहराव वाले लूप में ढहने से रोकता है।

परिणाम: क्या हुआ?

शोधकर्ताओं ने कठिन गणितीय समस्याओं (जैसे AIME 2024 और 2025) पर इसका परीक्षण किया।

  • पुराना तरीका: AI थोड़ा बेहतर होता था, एक दीवार से टकराता था और फिर सुधार करना बंद कर देता था। वह एक ही उत्तर बार-बार देने भी लगता था।
  • TEMPO का तरीका: AI जितना अधिक अभ्यास करता गया, उतना ही स्मार्ट होता गया।
    • एक मॉडल (OLMO3-7B) की सटीकता 33% से बढ़कर 51% हो गई।
    • दूसरा मॉडल (Qwen3-14B) 42% से बढ़कर 65% हो गया।

इससे भी अधिक प्रभावशाली बात यह है कि जबकि अन्य तरीके लगातार 16 बार एक ही उत्तर देने लगे (डाइवर्सिटी कोलैप्स), TEMPO ने 16 अलग-अलग उच्च-गुणवत्ता वाले समाधान उत्पन्न करना जारी रखा।

बड़ी तस्वीर (The Big Picture)

TEMPO को एक अंधेरे कमरे में अकेले अभ्यास करने (जहाँ आप अपनी बुरी आदतों को मजबूत कर सकते हैं) बनाम एक कोच के साथ अभ्यास करने (जो यह सुनिश्चित करने के लिए कभी-कभी नियम पुस्तिका की जांच करता है कि वे आपको गलत चालें तो नहीं सिखा रहे हैं) के बीच के अंतर के रूप में देखें।

"काम करने" और "नियमों की जांच करने" के बीच बारी-बारी से चलकर, TEMPO को यह क्षमता मिलती है कि वह अपने औपचारिक प्रशिक्षण को समाप्त करने के बाद भी सीखना और सुधारना जारी रख सके, जिससे "टेस्ट टाइम" सीखने के एक नए युग में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →