← नवीनतम पेपर
🤖 AI

Closing the Loop on Latent Reasoning via Test-Time Reconstruction

यह शोध पत्र ReLAT को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) टेस्ट-टाइम ट्रेनिंग पद्धति है जो मध्यवर्ती लेटेंट अवस्थाओं (intermediate latent states) से मूल क्वेरी को पुनर्गठित करके लेटेंट रीजनिंग में सुधार करती है ताकि यह सुनिश्चित किया जा सके कि कार्य-प्रासंगिक जानकारी संरक्षित रहे, जिससे गणितीय, ज्ञान और कोड जनरेशन बेंचमार्क पर प्रदर्शन में उल्लेखनीय वृद्धि होती है।

मूल लेखक: Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

प्रकाशित 2026-06-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiaopeng Yuan, Haibo Jin, Ye Yu, Peng Kuang, Lijun Yu, Yushun Dong, Haohan Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणितीय समस्या या कोडिंग चुनौती।

समस्या: "ब्लैक बॉक्स" शॉर्टकट

पारंपरिक रूप से, जब AI इन समस्याओं को हल करने की कोशिश करता है, तो वह अपने आप से ज़ोर-ज़ोर से बात करता है। वह अपनी सोच के हर चरण को सादे अंग्रेजी में लिखता है (जैसे कि एक इंसान नोटबुक में लिखता है)। यह बहुत अच्छा है क्योंकि आप उन नोट्स को पढ़ सकते हैं और देख सकते हैं कि क्या AI भटक गया या वह कोई नियम भूल गया। हालांकि, उन सभी शब्दों को लिखने में बहुत समय और कंप्यूटर पावर लगती है (जैसे कि एक बहुत लंबी फोन कॉल के लिए भुगतान करना)।

समय बचाने के लिए, शोधकर्ताओं ने AI को एक "गुप्त कोड" (जिसे लेटेंट रीजनिंग कहा जाता है) में सोचने की अनुमति देना शुरू कर दिया। पूरी वाक्य रचना लिखने के बजाय, AI अपने विचारों को अपने मस्तिष्क के भीतर अदृश्य, संकुचित संख्याओं (compressed numbers) के रूप में रखता है। यह बहुत तेज़ और कुशल है।

लेकिन यहाँ एक पेच है: क्योंकि ये विचार अदृश्य हैं, AI के पास यह जाँचने का कोई तरीका नहीं है कि क्या वह अभी भी सही रास्ते पर है। यह आँखें बंद करके कार चलाने जैसा है, इस भरोसे के साथ कि आपने गलती से गाड़ी गड्ढे में नहीं मोड़ दी है। यदि AI पहेली को हल करते समय कोई महत्वपूर्ण नियम भूल जाता है, तो उसे तब तक पता नहीं चलेगा जब तक कि वह गलत उत्तर नहीं दे देता। पेपर इसे एक "ओपन लूप" कहता है—AI सोचता है, फिर उत्तर देता है, और बीच में कोई सुरक्षा जाँच नहीं होती।

समाधान: ReLAT (द "मेमोरी टेस्ट")

लेखक एक नई विधि प्रस्तावित करते हैं जिसे ReLAT (Reconstruction-Guided Latent Reasoning At Test Time) कहा जाता है।

ReLAT को एक ऐसे मेमोरी टेस्ट के रूप में सोचें जो AI खुद को उत्तर देने से पहले देता है।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

  1. सेटअप: आप AI को एक कठिन गणितीय समस्या ( "प्रश्न") देते हैं।
  2. गुप्त विचार: AI तेज़ी से अपने विचार को उस अदृश्य "गुप्त कोड" ( "लेटेंट थॉट") में संकुचित करता है।
  3. मेमोरी टेस्ट (लूप): अंतिम उत्तर देने की अनुमति मिलने से पहले, AI को केवल उस गुप्त कोड का उपयोग करके मूल प्रश्न को फिर से बनाने (rebuild) की कोशिश करनी होती है।
    • यदि AI उस गुप्त कोड से प्रश्न को पूरी तरह से फिर से बना लेता है, तो यह साबित करता है कि उसने सभी नियमों और शर्तों को याद रखा है। वह परीक्षण में पास हो जाता है।
    • यदि AI प्रश्न को फिर से बनाने में विफल रहता है (शायद वह एक संख्या या शर्त भूल गया), तो वह जानता है कि उसका "गुप्त विचार" त्रुटिपूर्ण था।
  4. सुधार: यदि AI मेमोरी टेस्ट में विफल रहता है, तो वह अपनी स्मृति में होने वाले रिसाव (leak) को ठीक करने के लिए उस विफलता का उपयोग करके अपनी आंतरिक सेटिंग्स को तेज़ी से समायोजित करता है (जिसे "टेस्ट-टाइम ट्रेनिंग" कहा जाता है)।
  5. उत्तर: केवल मेमोरी टेस्ट पास करने के बाद ही वह अंतिम उत्तर उत्पन्न करता है।

यह एक बड़ी बात क्यों है

लेखक का दावा है कि यह विधि "ओपन लूप" (अंधेरे में गाड़ी चलाना) को "क्लोज्ड लूप" (एक GPS के साथ गाड़ी चलाना जो लगातार आपकी स्थिति की जाँच करता है) में बदल देती है।

  • यह आत्म-सुधारात्मक (Self-Correcting) है: AI को अपना काम जाँचने के लिए किसी इंसान की ज़रूरत नहीं है। वह अपने विचारों को सत्यापित करने के लिए मूल प्रश्न का ही उपयोग करता है।
  • यह कुशल है: पुराने तरीकों के विपरीत जहाँ AI लंबे पैराग्राफ लिखने के लिए टेक्स्ट का उपयोग करता था (जो धीमा और महंगा था), ReLAT यह जाँच अदृश्य, संकुचित संख्याओं का उपयोग करके करता है।
  • यह काम करता है: लेखकों ने कठिन गणित प्रतियोगिताओं (जैसे AIME), कोडिंग कार्यों और चिकित्सा संबंधी प्रश्नों पर इसका परीक्षण किया। उन्होंने पाया कि ReLAT ने मानक AI, टेक्स्ट-आधारित जाँच और अन्य "गुप्त कोड" विधियों की तुलना में सटीकता में काफी सुधार किया। उदाहरण के लिए, एक कठिन गणित परीक्षण पर, इसने AI के स्कोर को 56.7% से बढ़ाकर 73.3% कर दिया।

मुख्य निष्कर्ष

ReLAT तेज़, अदृश्य AI सोच को अधिक विश्वसनीय बनाने का एक तरीका है। यह AI को यह साबित करने के लिए मजबूर करता है कि वह विषय से भटका नहीं है, यह कहकर कि उसे अंतिम समाधान देने से पहले अपने छिपे हुए विचारों से मूल समस्या को "दोबारा खेलना" (replay) होगा। यह सुनिश्चित करने जैसा है कि घर से निकलने से पहले आपने अपनी खरीदारी की सूची नहीं भूल दी है, लेकिन इसे बिना कुछ लिखे पलक झपकते ही किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →