← नवीनतम पेपर
💬 NLP

LatentRevise: Learning from Zero-Hit Reasoning

LatentRevise सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) में सैंपलिंग बाधा को संबोधित करता है, जो विफल तर्क उपसर्गों (failed reasoning prefixes) के इनपुट एम्बेडिंग्स को स्वर्ण उत्तरों (gold answers) की ओर अनुकूलित करके किया जाता है, जिससे सूचनात्मक आत्म-चिंतनशील प्रक्षेपवक्र (self-reflective trajectories) उत्पन्न होते हैं जो गणितीय बेंचमार्क पर मॉडल के प्रदर्शन में सुधार करते हैं।

मूल लेखक: Yiqiu Guo, Xueting Han, Qi Jia, Guangtao Zhai, Jing Bai

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiqiu Guo, Xueting Han, Qi Jia, Guangtao Zhai, Jing Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक बहुत ही कठिन गणित का सवाल हल करना सिखा रहे हैं। आप उन्हें एक संकेत (prompt) देते हैं, और वे उसे हल करने की कोशिश करते हैं। लेकिन चाहे वे कितनी भी बार कोशिश करें (मान लीजिए 32 बार), वे हर बार गलत उत्तर ही पाते हैं।

AI ट्रेनिंग की दुनिया में, इसे "Zero-Hit" परिदृश्य कहा जाता है। यहाँ AI पूरी तरह से विफल हो गया है।

समस्या: "डेड एंड" (Dead End)

आमतौर पर, जब कोई AI इस तरह बुरी तरह विफल होता है, तो ट्रेनिंग सिस्टम हार मान लेता है। वह कहता है, "चूंकि 32 प्रयासों में से एक भी सही नहीं था, इसलिए यहाँ कोई उपयोगी सबक नहीं है। चलिए इस समस्या को छोड़ देते हैं और अगली समस्या पर चलते हैं।"

यह पेपर तर्क देता है कि यह एक गलती है। ये "डेड एंड" वास्तव में सोने की खानें हैं। AI इस समस्या को हल कर सकता है, लेकिन वह अभी तक अपने सीमित प्रयासों के भीतर सही रास्ता नहीं खोज पाया है। पेपर इसे "सैंपलिंग फ्रंटियर" (Sampling Frontier) कहता है—वह सीमा जहाँ तक AI वर्तमान में पहुँच सकता है।

समाधान: "LatentRevise" (जादुई संपादन)

लेखक LatentRevise नामक एक विधि पेश करते हैं। AI को और अधिक कठिन प्रयास करने के लिए कहने या उसे सही उत्तर दिखाने के लिए किसी "सुपर-टीचर" को नियुक्त करने के बजाय, LatentRevise AI को अपने विचारों को पूरा लिखने से पहले ही अपने विचारों को संपादित (edit) करके अपनी गलतियों को सुधारने की अनुमति देता है।

यह इस प्रकार काम करता है, एक सरल उदाहरण का उपयोग करते हुए:

1. असफल ड्राफ्ट (The Failed Draft)

AI एक कहानी (समाधान) लिखना शुरू करता है। वह एक तर्क के जाल में फंस जाता है और एक गलत अंत लिख देता है।

  • पुराना तरीका: पूरे ड्राफ्ट को कूड़ेदान में फेंक दें।
  • LatentRevise का तरीका: AI को रोक दें। कहानी की शुरुआत (reasoning prefix) को सुरक्षित रखें लेकिन यह समझ लें कि जिस रास्ते पर वह चल रहा है वह एक खाई की ओर ले जाता है।

2. "घोस्ट" एडिट (The "Ghost" Edit)

AI को शून्य से एक नई कहानी लिखने के लिए कहने के बजाय, LatentRevise उसके "मस्तिष्क" (उसके आंतरिक गणित, या latent space) में जाता है और उसके विचार प्रक्रिया के पहले कुछ शब्दों में बदलाव करता है।

इसे एक GPS की तरह समझें। AI गाड़ी चला रहा है और उसने गलत मोड़ ले लिया है।

  • मानक AI: वह तब तक गाड़ी चलाता रहता है जब तक कि वह डेड एंड पर न पहुँच जाए, फिर शुरुआत से फिर से प्रयास करता है।
  • LatentRevise: GPS को एहसास होता है कि वर्तमान मार्ग बेकार है। यह ड्राइवर को केवल "अधिक मेहनत करने" के लिए नहीं कहता; यह रूट के शुरुआती निर्देशांकों (coordinates) को बस इतना सूक्ष्म रूप से बदल देता है कि कार स्वाभाविक रूप से बिना दुर्घटनाग्रस्त हुए सही गंतव्य की ओर मुड़ सके।

3. संपादन के तीन नियम (The Three Rules of the Edit)

यह सुनिश्चित करने के लिए कि यह "घोस्ट एडिट" AI को अर्थहीन मशीन न बना दे, पेपर तीन विशिष्ट नियमों (gradients) का उपयोग करता है:

  1. गलती से दूर हटें: "उस रास्ते पर न जाएं जो आपने अभी लिया था और जो गलत उत्तर की ओर ले गया।"
  2. सत्य की ओर खिंचें: "सही अंतिम उत्तर (जिसे हम जानते हैं) की ओर धीरे से मुड़ें।"
  3. स्वाभाविक बनाए रखें: "सुनिश्चित करें कि नया रास्ता अभी भी सामान्य मानवीय भाषा की तरह लगे, न कि रोबोटिक शोर की तरह।"

4. सुरक्षा जाल (The "Vocabulary Hull")

यह एक महत्वपूर्ण तकनीकी विवरण है जिसे सरल बनाया गया है: जब आप AI के आंतरिक गणित में बदलाव करते हैं, तो आप एक ऐसा "विचार" बनाने का जोखिम उठाते हैं जो किसी वास्तविक शब्द (जैसे कि कोई ऐसा रंग जो अस्तित्व में ही नहीं है) के अनुरूप नहीं होता।

LatentRevise के पास एक सुरक्षा घेरा (guardrail) है। यह हर सूक्ष्म बदलाव को उन वास्तविक शब्दों के "पड़ोस" (neighborhood) के भीतर रहने के लिए मजबूर करता है जिन्हें AI पहले से जानता है। कल्पना कीजिए कि आप एक कमरे में फर्नीचर को व्यवस्थित कर रहे हैं। आप सोफे को हिला सकते हैं, लेकिन आप उसे तैरते हुए बादल में नहीं बदल सकते। आपको इसे वास्तविक फर्नीचर के रूप में बनाए रखना होगा। यह सुनिश्चित करता है कि AI के नए विचार अभी भी समझने योग्य हों।

परिणाम: कचरे से खजाना बनाना

इस "एडिट" के बाद, AI कहानी को फिर से लिखता है। इस बार, क्योंकि शुरुआती विचार को थोड़ा समायोजित किया गया था, AI:

  • एक अलग रास्ता अपनाता है।
  • अक्सर रुककर कहता है, "रुको, मुझे इस पर फिर से विचार करने दो" (स्व-चिंतन/self-reflection)।
  • अंततः सही उत्तर तक पहुँच जाता है।

पेपर दिखाता है कि ये "रिकवर किए गए" (recovered) किस्से अविश्वसनीय रूप से मूल्यवान हैं। जब AI को इन नए बचाए गए उदाहरणों पर प्रशिक्षित किया जाता है, तो वह कठिन गणितीय समस्याओं को हल करने में बहुत बेहतर हो जाता है, यहाँ तक कि उन समस्याओं में भी जिन्हें वह पहले 100% बार विफल रहा था।

यह सिर्फ "अधिक प्रयास करने" से बेहतर क्यों है?

आप सोच सकते हैं, "क्यों न हम AI को 32 के बजाय 100 बार प्रयास करने दें?"

  • अधिक प्रयास करना महंगा और धीमा है। यह एक छात्र को 100 निबंध लिखने के लिए कहने जैसा है इस उम्मीद में कि शायद एक सही हो जाए।
  • LatentRevise एक स्मार्ट संपादक की तरह है जो पहले ड्राफ्ट को ठीक करता है ताकि छात्र को केवल एक अच्छा निबंध लिखने की आवश्यकता हो। यह कम कंप्यूटिंग पावर के साथ बेहतर परिणाम प्राप्त करता है।

संक्षेप में: LatentRevise AI को सिखाता है कि असफल होना अंत नहीं है। अपने प्रारंभिक विचारों को चुपचाप संपादित करके, AI उन समस्याओं में छिपे सही रास्ते को खोज सकता है जिन्हें वह पहले असंभव समझता था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →