Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs
यह शोध पत्र FREIA को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड (unsupervised) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो विकसित होती तर्क क्षमताओं के अनुकूल गतिशील रूप से ढलने के लिए फ्री एनर्जी-ड्रिवन रिवॉर्ड (Free Energy-Driven Reward) और एडेप्टिव एडवांटेज शेपिंग (Adaptive Advantage Shaping) का लाभ उठाता है, जिससे यह बिना ग्राउंड-ट्रुथ सुपरविजन के गणितीय तर्क जैसे कार्यों में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल गणितीय समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं, लेकिन आपके पास उत्तर कुंजी (answer key) वाला कोई शिक्षक नहीं है। आप उसे यह नहीं बता सकते कि "सही" है या "गलत"। आपके पास केवल छात्र के अपने प्रयास ही उपलब्ध हैं। यह अनसुपरवाइज्ड लर्निंग (unsupervised learning) की चुनौती है।
यह शोध पत्र FREIA नामक एक नई विधि पेश करता है ताकि इन AI छात्रों को बिना भ्रमित हुए या अटके, अपने आप सीखने में मदद मिल सके। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है।
समस्या: "इको चैंबर" और "लोन वुल्फ" (The Echo Chamber and The Lone Wolf)
जब एक AI बिना शिक्षक के सीखने की कोशिश करता है, तो वह आमतौर पर दो तरह के जाल में फंस जाता है:
- इको चैंबर (सहमति का जाल - Consensus Trap): AI खुद से एक सवाल 10 बार पूछता है। यदि 9 बार वह "4" कहता है और 1 बार वह "13" (सही उत्तर) कहता है, तो वह मान लेता है कि "4" सही होना चाहिए क्योंकि सब सहमत थे। वह उस सही अल्पसंख्यक उत्तर को अनदेखा कर देता है क्योंकि वह लोकप्रिय नहीं था।
- लोन वुल्फ (आत्मविश्वास का जाल - Confidence Trap): AI एक गलत उत्तर के प्रति बहुत आश्वस्त हो जाता है। चूंकि उसे यकीन है, इसलिए वह उस उत्तर के लिए खुद को पुरस्कृत करता है, भले ही वह गलत हो। वह आत्मविश्वास से गलत होने के चक्र में फंस जाता है।
मौजूदा विधियाँ अक्सर एक "स्थिर" (static) नियम पुस्तिका का उपयोग करती हैं। वे हर स्थिति के साथ एक जैसा व्यवहार करती हैं, चाहे AI अभी शुरुआत कर रहा हो या वह पहले से ही विशेषज्ञ हो। इससे AI या तो बहुत अधिक अन्वेषण (explore) करने लगता है (समय बर्बाद करता है) या बहुत जल्दी अन्वेषण करना बंद कर देता है (फंस जाता है)।
समाधान: FREIA (द स्मार्ट कोच)
लेखकों ने FREIA बनाया है, जो एक स्मार्ट कोच की तरह काम करता है जो छात्र के प्रदर्शन के आधार पर अपनी रणनीति बदलता है। यह दो मुख्य उपकरणों का उपयोग करता है:
1. "फ्री एनर्जी" रिवॉर्ड सिस्टम (FER)
इसे एक डायनेमिक स्कोरिंग सिस्टम के रूप में सोचें जो दो प्रतिस्पर्धी लक्ष्यों के बीच संतुलन बनाता है: सहमति (Agreement) और जिज्ञासा (Curiosity)।
- अवधारणा: कल्पना करें कि AI 100 लोगों (उसके अपने द्वारा उत्पन्न उत्तरों) के साथ एक कमरे में है।
- जब कमरा अराजक हो (कम आत्मविश्वास - Low Confidence): यदि उत्तर इधर-उधर बिखरे हुए हैं (कुछ 4 कहते हैं, कुछ 13, कुछ 99), तो AI जानता है कि वह अभी तक उत्तर नहीं जानता। कोच कहता है, "भीड़ का पीछा मत करो! जिज्ञासु बनो। दुर्लभ, अद्वितीय उत्तरों को पुरस्कृत करो क्योंकि हमें नए विचारों की खोज करने की आवश्यकता है।"
- जब कमरा शांत हो (उच्च आत्मविश्वास - High Confidence): यदि 99 लोग "13" कहते हैं और केवल एक "4" कहता है, तो AI काफी आश्वस्त है कि वह सही है। कोच कहता है, "बहुत अच्छा! बहुमत के साथ बने रहें। हमें अब और अन्वेषण करने की आवश्यकता नहीं है; आइए इस सही उत्तर को लॉक कर दें।"
यह प्रणाली फ्री एनर्जी प्रिंसिपल (Free Energy Principle) पर आधारित है, जो मूल रूप से यह कहने का एक तरीका है: "आश्चर्य को कम करें।" यदि AI अपने स्वयं के उत्तरों से आश्चर्यचकित होता है, तो वह अन्वेषण करता है। यदि वह आश्चर्यचकित नहीं है, तो वह अपने ज्ञान को सुदृढ़ करता है।
2. एडेप्टिव एडवांटेज शेपिंग (AAS)
यह लर्निंग सिग्नल्स के लिए एक ट्रैफिक कंट्रोलर है।
- समस्या: कभी-कभी, शुद्ध भाग्य से, AI को जल्दी ही एक "लकी ब्रेक" मिलता है और उसे सही उत्तर मिल जाता है, लेकिन यह महज एक इत्तेफाक है। यदि सिस्टम इस इत्तेफाक को एक बड़ी जीत मानता है, तो AI ओवरफिट (इत्तेफाक को रट लेना) कर सकता है और सीखना बंद कर सकता है।
- समाधान: AAS पुरस्कारों के "आकार" (shape) को देखता है।
- यदि पुरस्कार अजीब तरह से झुके हुए हैं (Positive Skew): इसका मतलब है कि कुछ बड़ी जीत हैं और कई हार। कोच कहता है, "रुको, वह बड़ी जीत शायद एक इत्तेफाक हो सकती है। आइए इनाम को कम करें ताकि तुम बहुत उत्साहित होकर अन्वेषण करना बंद न कर दो।"
- यदि पुरस्कार ज्यादातर उच्च हैं (Negative Skew): इसका मतलब है कि AI बहुत अच्छा कर रहा है, लेकिन शायद वह उन कुछ बार के लिए बहुत सख्त हो रहा है जब उसने छोटी सी गलती की थी। कोच कहता है, "उस एक छोटी सी गलती के लिए खुद पर बहुत सख्त न हों। आगे बढ़ते रहें।"
यह क्यों काम करता है (परिणाम)
शोधकर्ताओं ने नौ अलग-अलग डेटासेट्स पर FREIA का परीक्षण किया, जिसमें कठिन गणितीय समस्याएं, SQL कोड जनरेशन और ज्योमेट्री शामिल हैं।
- उपमा: कल्पना करें कि एक दौड़ है जहाँ अन्य धावक भ्रमित होने के कारण गोल-गोल घूम रहे हैं। FREIA वह धावक है जो मानचित्र की जांच करता है, महसूस करता है कि वे कब खो गए हैं, और सही रास्ता खोजने के लिए दिशा बदलता है।
- परिणाम: FREFA ने अन्य "अनसुपरवाइज्ड" विधियों को लगातार पछाड़ दिया। गणित के कार्यों में, इसने अन्य विधियों की तुलना में AI की सटीकता में महत्वपूर्ण सुधार (0.5 से 3.5 अंक) किया। इसने सही उत्तर खोजने में सफलता प्राप्त की, भले ही "बहुमत का वोट" गलत था, जहाँ अन्य विधियाँ विफल रही थीं।
सारांश
FREIA खुद को सिखाने के लिए AI का एक नया तरीका है। भीड़ का अंधाधुंध पीछा करने या अपने आत्मविश्वास पर अंधा विश्वास करने के बजाय, यह एक स्मार्ट, एडेप्टिव सिस्टम का उपयोग करता है जो जानता है कि कब जिज्ञासु होना है और कब निर्णायक होना है। यह AI को बुरी आदतों में फंसने से रोकता है और उसे सत्य खोजने में मदद करता है, भले ही वहां कोई दूसरा (कोई मानव शिक्षक) न हो जो उसे बता सके कि उत्तर क्या है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।