← नवीनतम पेपर
🤖 AI

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

यह शोध पत्र CEDAR-GRPO को प्रस्तुत करता है, जो एक प्रक्रिया-जागरूक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो अंतिम-उत्तर की शुद्धता को एबडक्टिव रिवॉर्ड्स (abductive rewards) के साथ जोड़कर बड़े भाषा मॉडलों में सामान्य एबडक्टिव तर्क क्षमता को बढ़ाता है, जिससे बेस मॉडल्स और केवल शुद्धता-आधारित प्रशिक्षण की तुलना में 11 अनदेखे कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस के विशाल परिदृश्य में, शोधकर्ता लगातार मशीनों को यह सिखाने की कोशिश कर रहे हैं कि वे केवल एक वाक्य में अगले शब्द की भविष्यवाणी कैसे करें, न कि केवल यह कि वे मनुष्यों की तरह कैसे सोचें। सोचने के सबसे मानवीय तरीकों में से एक को 'एबडक्टिव रीजनिंग' (abductive reasoning) या अपवर्तक तर्क कहा जाता है। यह सुरागों या अवलोकनों के एक समूह को देखने और उनके लिए सबसे संभावित स्पष्टीकरण खोजने के लिए पीछे की ओर काम करने की मानसिक प्रक्रिया है। यह वह तरीका है जिससे एक डॉक्टर कुछ लक्षणों के आधार पर यह पता लगाता है कि रोगी के साथ क्या गलत है, कैसे एक जासूस बिखरे हुए सबूतों से अपराध की पुनर्रचना करता है, या कैसे एक इंजीनियर उस मशीन का निदान करता है जो अचानक काम करना बंद कर देती है। लंबे समय तक, वैज्ञानिक बड़े भाषा मॉडलों (large language models) को इसे अच्छी तरह से करने के लिए प्रशिक्षित करने के लिए संघर्ष करते रहे हैं। जबकि ये मॉडल तथ्यों को याद रखने या सख्त तार्किक नियमों का पालन करने में उत्कृष्ट हैं, वे अधूरी जानकारी से छिपे हुए कारणों का अनुमान लगाने के लिए कहे जाने पर अक्सर लड़खड़ा जाते हैं। वे गलत कारणों से सही उत्तर का अनुमान लगाने लगते हैं, या वे ऐसे तथ्य बना लेते हैं जो सुनने में तर्कसंगत लगते हैं लेकिन वास्तव में दिए गए साक्ष्यों के अनुकूल नहीं होते हैं।

शरीफ प्रौद्योगिकी संस्थान और तेहरान विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने का बीड़ा उठाया। वे जानना चाहते थे कि क्या वे इन एआई मॉडलों को एबडक्टिव रीजनिंग में बेहतर बनने के लिए प्रशिक्षित कर सकते हैं, ताकि वे केवल उन विशिष्ट पहेलियों को याद करने के बजाय नए, अनदेखे समाधानों को हल करने में सक्षम हो सकें जिन पर उन्हें प्रशिक्षित किया गया है। उन्होंने CEDAR-GRPO नामक एक नई प्रशिक्षण विधि विकसित की। मॉडल को केवल अंतिम उत्तर सही होने के लिए पुरस्कृत करने के बजाय, उन्होंने एक ऐसी प्रणाली डिजाइन की जो मॉडल को इस बात के लिए भी पुरस्कृत करती है कि वह वहां तक कैसे पहुँचा। यह प्रणाली मॉडल की विचार प्रक्रिया के बारे में दो विशिष्ट चीजों की जांच करती है: पहला, क्या मॉडल ने वास्तव में प्रदान किए गए साक्ष्यों के हर एक विवरण को देखा और समझाया, और दूसरा, क्या मॉडल ने अपने तर्क को सही दिशा में आगे बढ़ाया, यानी अवलोकनों से शुरू होकर निष्कर्ष की ओर निर्माण किया, न कि एक निष्कर्ष से शुरू होकर साक्ष्यों को उसमें फिट करने की कोशिश की।

इसका परीक्षण करने के लिए, शोधकर्ताओं ने चार अलग-अलग ओपन-सोर्स भाषा मॉडलों को लिया और उन्हें कार्यों के एक सावधानीपूर्वक मिश्रित सेट पर प्रशिक्षित किया। इन कार्यों में एक छोटी कहानी के लिए सबसे अच्छे स्पष्टीकरण को चुनने से लेकर डेटा में एक पैटर्न की व्याख्या करने वाले कोड लिखने तक सब कुछ शामिल था। महत्वपूर्ण रूप से, उन्होंने केवल मॉडलों को उत्तर नहीं दिखाए; उन्होंने सुदृढीकरण सीखने (reinforcement learning) की एक तकनीक का उपयोग किया जो एक कोच की तरह कार्य करती थी, जो मॉडलों को उनके तर्क के चरणों पर फीडबैक देती थी। मॉडल ने सीखा कि एक सही उत्तर पर्याप्त नहीं था यदि उन्होंने किसी प्रमुख विवरण को अनदेखा कर दिया था या यदि उनका तर्क उल्टा था। इस प्रशिक्षण के बाद, शोधकर्ताओं ने मॉडलों का परीक्षण ग्यारह पूरी तरह से अलग कार्यों पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था। इन नए कार्यों में चिकित्सा स्थितियों का निदान करने से लेकर कंप्यूटर कोड को डीबग करना, जटिल रहस्यों को सुलझाना और लंबी, जटिल कहानियों को समझना तक शामिल था।

परिणामों ने व्यापक स्तर पर स्पष्ट सुधार दिखाया। इस नई विधि से प्रशिक्षित मॉडल अपने मूल संस्करणों और केवल अंतिम उत्तर सही होने के लिए प्रशिक्षित मॉडलों की तुलना में बेहतर प्रदर्शन करते हैं। औसतन, नई विधि ने मूल मॉडलों की तुलना में 7.4 प्रतिशत अंक और केवल शुद्धता के लिए प्रशिक्षित मॉडलों की तुलना में 2.7 अंक का सुधार किया। कुछ विशिष्ट मामलों में, सुधार 30.8 अंक तक उच्च था। अधिक महत्वपूर्ण बात यह है कि शोधकर्ताओं ने मॉडल द्वारा सोचते समय लिखे गए वास्तविक पाठ का विश्लेषण किया। उन्होंने पाया कि प्रशिक्षित मॉडल अधिक सतर्क जांचकर्ताओं की तरह व्यवहार कर रहे थे। वे किसी उत्तर पर स्थिर होने से पहले विभिन्न संभावनाओं को खोजने, गलत विचारों को स्पष्ट रूप से खारिज करने और अनिश्चितता होने पर स्वीकार करने की अधिक संभावना रखते थे। उन्होंने अस्पष्ट धारणाओं पर भरोसा करने के बजाय अपने निष्कर्षों को सीधे दिए गए विशिष्ट तथ्यों से जोड़ने की बहुत मजबूत आदत भी दिखाई।

अध्ययन ने इस सफलता के कई वैकल्पिक स्पष्टीकरणों को भी खारिज कर दिया। शोधकर्ताओं ने सिद्ध किया कि सुधार केवल मॉडलों को अधिक उदाहरण देखने से या सामान्य तर्क क्षमता में वृद्धि से नहीं आया है। जब उन्होंने मॉडलों को सामान्य तर्क डेटा के समान मात्रा में प्रशिक्षित किया जो एबडक्टिव कार्यों पर केंद्रित नहीं था, तो मॉडल विशिष्ट परीक्षणों पर उसी स्तर का सुधार नहीं दिखा सके। यह सुझाव देता है कि मॉडल को उनकी तर्क प्रक्रिया के लिए पुरस्कृत करने का विशिष्ट तरीका ही मुख्य कारक था। निष्कर्ष बताते हैं कि एबडक्टिव रीजनिंग को एक सामान्य कौशल के रूप में मजबूत किया जा सकता है जो विभिन्न क्षेत्रों में स्थानांतरित होता है, न कि एक संकीर्ण ट्रिक के रूप में जो केवल विशिष्ट प्रकार की पहेलियों पर काम करती है। मॉडलों को साक्ष्यों का सम्मान करने और अवलोकन से स्पष्टीकरण तक एक तार्किक पथ का पालन करने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसी आर्टिफिशियल इंटेलिजेंस बनाने की दिशा में एक महत्वपूर्ण कदम उठाया है जो वास्तव में दुनिया को समझ सकती है और उसकी व्याख्या कर सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →