← नवीनतम पेपर
🤖 AI

GPO: Learning from Critical Steps to Improve LLM Reasoning

यह शोध पत्र गाइडेड पिवोटल ऑप्टिमाइज़ेशन (GPO) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग रणनीति है जो एडवांटेज एस्टीमेशन के माध्यम से रीजनिंग ट्राजेक्टरीज के भीतर महत्वपूर्ण चरणों की पहचान करके और इन पिवोटल क्षणों पर लर्निंग को प्राथमिकता देकर LLM रीजनिंग को बेहतर बनाती है, जिससे विभिन्न ऑप्टिमाइज़ेशन विधियों और बेंचमार्क में प्रदर्शन में उल्लेखनीय सुधार होता है।

मूल लेखक: Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी थोड़ा विचलित होने वाले छात्र (AI) को एक जटिल गणित की समस्या हल करना या एक कोड प्रोग्राम लिखना सिखा रहे हैं। छात्र अपने समाधान को चरणों की एक लंबी सूची के रूप में लिखने का प्रयास करता है, जैसे कि कोई रेसिपी हो।

आमतौर पर, जब छात्र उत्तर गलत देता है, तो हम पूरी रेसिपी को देखते हैं, कहते हैं, "यह गलत है," और उन्हें बिल्कुल शुरुआत से फिर से करने के लिए कहते हैं। लेकिन यह शोध पत्र तर्क देता है कि यह अक्षम (inefficient) है। अक्सर, छात्र ने शुरुआत में एक छोटी सी, महत्वपूर्ण गलती की होती है—जैसे किसी संख्या को गलत पढ़ लेना या किसी तारीख को भ्रमित कर देना—और उसके बाद के सभी चरण केवल एक टूटी हुई नींव को ठीक करने का एक तार्किक लेकिन व्यर्थ प्रयास होते हैं।

लेखक इस नई विधि को GPO (Guided Pivotal Optimization) कहते हैं। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "महत्वपूर्ण चरण" का जासूस (The "Critical Step" Detective)

पुराने तरीके में, AI अपने तर्क के हर चरण को समान रूप से महत्वपूर्ण मानता है। GPO एक जासूस की तरह कार्य करता है। यह छात्र के चरणों की लंबी सूची को देखता है और पूछता है: "ट्रेन ठीक किस जगह पटरी से उतरी?"

यह एक गणितीय उपकरण (जिसे "एडवांटेज फंक्शन" कहा जाता है) का उपयोग करता है ताकि तर्क के पथ को स्कैन किया जा सके और उस एक विशिष्ट चरण की पहचान की जा सके जहाँ तर्क भटक गया था। यह वह "महत्वपूर्ण चरण" है। यह वह क्षण है जहाँ, यदि छात्र ने एक अलग मोड़ लिया होता, तो वह समस्या को सही ढंग से हल कर सकता था।

  • सादृश्य (Analogy): कल्पना कीजिए कि एक हाइकर (पदमयात्री) पर्वत शिखर तक पहुँचने की कोशिश कर रहा है। वह रास्ते के एक मोड़ पर गलत मोड़ ले लेता है। पुराना तरीका कहता है, "तुम शिखर तक नहीं पहुँचे, वापस कार के पास जाओ और फिर से शुरू करो।" GPO कहता है, "तुम शिखर तक इसलिए नहीं पहुँचे क्योंकि तुमने 2 मील पीछे उस मोड़ पर गलत रास्ता चुना था। चलो तुम्हें वापस उसी मोड़ पर टेलीपोर्ट करते हैं और एक अलग रास्ता आज़माने के लिए देखते हैं।"

2. "समय-यात्रा" रीसेट (The "Time-Travel" Reset)

एक बार जब GPO उस महत्वपूर्ण गलती को ढूंढ लेता है, तो यह केवल AI को फिर से प्रयास करने के लिए नहीं कहता। यह वास्तव में AI की याददाश्त को उस सटीक क्षण पर रीसेट कर देता है जहाँ गलती हुई थी।

यह कहता है, "ठीक है, तुम चरण 3 पर हो। तुमने यहाँ एक बुरा निर्णय लिया। अब, जो कुछ भी तुमने चरण 3 के बाद लिखा है उसे भूल जाओ। चलिए चरण 3 से नए सिरे से शुरुआत करते हैं और देखते हैं कि क्या हम आगे बढ़ने के लिए कोई बेहतर रास्ता खोज सकते हैं।"

  • सादृश्य: एक वीडियो गेम के बारे में सोचें। यदि आप एक गड्ढे में गिर जाते हैं, तो पुराना तरीका आपको पूरा लेवल फिर से शुरू करने के लिए मजबूर करता है। GPO आपको गड्ढे के किनारे पर ही 'रिस्पॉन' (respawn) करता है, जिससे आपको उन सुरक्षित हिस्सों को दोबारा खेलने में समय बर्बाद किए बिना, जिन्हें आपने पहले ही महारत हासिल कर ली है, सही ढंग से कूदने का दूसरा मौका मिलता है।

3. "महत्वपूर्ण क्षणों" से सीखना (Learning from the "Pivotal Moments")

इसके बाद AI इस "रीसेट और पुनः प्रयास" का कई बार अभ्यास करता है। यह विशेष रूप से उन पेचीदा, उच्च-दांव वाले क्षणों को संभालने के लिए सीखता है जहाँ निर्णय सबसे अधिक मायने रखता है।

  • सादृश्य: यदि आप टेनिस खेलना सीख रहे हैं, तो आप केवल बार-बार पूरे मैच नहीं खेलते। आप विशेष रूप से अपने 'सर्व' (serve) पर ध्यान केंद्रित कर सकते हैं, जो वह "महत्वपूर्ण चरण" है जो अंक की शुरुआत करता है। GPO AI को अपने "सर्व" (महत्वपूर्ण तर्क चरण) का बार-बार अभ्यास करने के लिए मजबूर करता है जब तक कि वह इसे सही ढंग से न कर ले, बजाय इसके कि वह केवल रैंडम गेम खेलता रहे।

उन्होंने क्या पाया?

शोधकर्ताओं ने गणित की समस्याओं, विज्ञान के प्रश्नों और तर्क संबंधी पहेलियों सहित सात अलग-अलग प्रकार के कठिन पहेलियों का उपयोग करके इस विधि का परीक्षण किया। उन्होंने GPO का उपयोग करने वाले AI की तुलना मानक प्रशिक्षण विधियों का उपयोग करने वाले AI से की।

  • परिणाम: GPO के साथ प्रशिक्षित AI इन समस्याओं को हल करने में काफी बेहतर हो गया। यह केवल थोड़ा बेहतर नहीं हुआ; इसने सटीकता में एक बड़ी छलांग लगाई।
  • मानवीय जाँच (Human Check): उन्होंने वास्तविक मनुष्यों से भी AI की गलतियों को देखने और यह अनुमान लगाने के लिए कहा कि महत्वपूर्ण त्रुटि कहाँ थी। उन्होंने पाया कि मनुष्य और GPO विधि अधिकांश समय "महत्वपूर्ण चरणों" पर सहमत थे। यह साबित करता है कि यह विधि केवल एक रैंडम अनुमान नहीं है; यह वास्तव में उन क्षणों को ढूंढ रही है जहाँ मनुष्य कहेंगे, "आह, यहीं से यह गलत हुआ था।"

मुख्य निष्कर्ष (The Bottom Line)

पेपर का दावा है कि AI को उन चीजों को फिर से सीखने में समय बर्बाद करने से रोककर, जिन्हें वह पहले से जानता है, और इसके बजाय अपनी ऊर्जा उन विशिष्ट क्षणों पर केंद्रित करके जहाँ वह अटक जाता है, हम इसे बहुत अधिक स्पष्ट रूप से सोचने और कठिन समस्याओं को हल करने के लिए सिखा सकते हैं। यह अभ्यास करने का एक स्मार्ट तरीका है, जो पूरी श्रृंखला के बजाय श्रृंखला की कमजोर कड़ियों पर ध्यान केंद्रित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →