← नवीनतम पेपर
🤖 machine learning

PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark

यह शोध पत्र PsiLogic को प्रस्तुत करता है, जो एक अराजता-जागरूक (chaos-aware) ऑप्टिमाइज़र है जो मैन्युअल वॉर्मअप शेड्यूल्स के बिना शुरुआती प्रशिक्षण को स्थिर करने के लिए एक सक्रिय रद्दीकरण पद (active cancellation term) के साथ Adam को गतिशील रूप से संवर्धित करता है, जो NLP और विज़न बेंचमार्क में Adam, AdamW और Lion की तुलना में एक कठोर, पुनरुत्पादनीय क्रॉस-डोमेन मूल्यांकन में सांख्यिकीय रूप से महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करता है।

मूल लेखक: Ali Sultonov

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali Sultonov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

सीखने वाली मशीनों का महान संतुलन (The Great Balancing Act of Learning Machines)

कल्पना कीजिए कि आप एक रोबोट को हजारों तस्वीरें दिखाकर बिल्ली पहचानना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, रोबोट एक "मस्तिष्क" का उपयोग करता है जो गणित से बना है, और वह हर बार एक नई तस्वीर देखने पर अपनी आंतरिक सेटिंग्स में सूक्ष्म समायोजन करके सीखता है। इस प्रक्रिया को 'ट्रेनिंग' (प्रशिक्षण) कहा जाता है, और वह उपकरण जो यह तय करता है कि वे समायोजन कितने बड़े या छोटे होने चाहिए, उसे ऑप्टिमाइज़र (optimizer) कहा जाता है। ऑप्टिमाइज़र को रोबोट के शिक्षक के रूप में सोचें। यदि शिक्षक बहुत सख्त है, तो रोबोट धीरे सीखता है; यदि शिक्षक बहुत उदार है, तो रोबोट भ्रमित हो जाता है और जो उसने अभी सीखा है उसे भूल जाता है।

वर्षों से, AI की दुनिया में सबसे लोकप्रिय शिक्षक Adam नामक एक विधि रही है। यह एक बहुत ही अनुभवी कोच की तरह है जो यह जानता है कि रोबोट के कदमों को उसके वर्तमान दौड़ने की गति के आधार पर कैसे समायोजित किया जाए। हालाँकि, इसमें एक पेंच है: यह कोच उन्हीं नियमों का उपयोग करता है चाहे रोबोट अभी शुरुआत ही क्यों न कर रहा हो (जहाँ सब कुछ अराजक, अस्त-व्यस्त और शोर भरा होता है) या वह लगभग समाप्त होने ही वाला हो (जहाँ चीजें शांत और स्थिर होती हैं)। वास्तविक दुनिया में, हम जानते हैं कि किसी नए कार्य की शुरुआत आमतौर पर एक अराजक उथल-पुथल होती है, जबकि समापन शांत होता है। जिस शोध पत्र को आप पढ़ने जा रहे हैं, वह एक सरल प्रश्न पूछता है: क्या होगा यदि हमारे रोबोट का शिक्षक यह महसूस कर सके कि चीजें कब अराजक हैं और उसके अनुसार अपना व्यवहार बदल सके? यह एक नए अध्ययन का केंद्र है जो AI मॉडल को प्रशिक्षित करने के एक स्मार्ट तरीके की खोज कर रहा है, जिसका लक्ष्य उन्हें शुरुआत के शोर में खोए बिना तेजी से और अधिक विश्वसनीय रूप से सिखाना है।


PsiLogic से मिलिए: अराजकता को पहचानने वाला कोच

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिनका नेतृत्व स्वतंत्र शोधकर्ता अली सुल्तोनोव (Ali Sultonov) ने किया है, PsiLogic (या Ψ\PsiLogic) नामक एक नया ऑप्टिमाइज़र पेश किया है। आप इसे प्रसिद्ध Adam ऑप्टिमाइज़र के एक अपग्रेड के रूप में देख सकते हैं, लेकिन एक विशेष सुपरपावर के साथ: एक "अराजकता डिटेक्टर" (chaos detector)।

कल्पना कीजिए कि आप कार चला रहे हैं। जब आप एक ठंडी सुबह पहली बार इंजन शुरू करते हैं, तो कार लड़खड़ा सकती है, हिल सकती है और अजीब आवाजें निकाल सकती है। यदि आप तुरंत एक्सीलेटर को पूरा दबा देते हैं, तो आप इंजन को बंद (stall) कर सकते हैं। लेकिन एक बार जब इंजन गर्म हो जाता है और सुचारू रूप से चलने लगता है, तो आप सामान्य रूप से गाड़ी चला सकते हैं। Adam जैसे मानक ऑप्टिमाइज़र ठंडे, लड़खड़ाते इंजन के साथ भी वैसा ही व्यवहार करते हैं जैसा वे सुचारू, गर्म इंजन के साथ करते हैं—वे बस एक्सीलेटर दबाते रहते हैं। हालाँकि, PsiLogic एक स्मार्ट ड्राइवर की तरह है जो इंजन के हिलने को महसूस करता है। जब कार लड़खड़ा रही होती है (प्रशिक्षण का "अराजक" प्रारंभिक चरण), तो PsiLogic धीरे से एक्सीलेटर से पैर हटा लेता है और ब्रेक लगा देता है ताकि कार नियंत्रण से बाहर होकर न घूम जाए। जैसे-जैसे इंजन गर्म होता है और सवारी सुचारू होती जाती है (अंत के पास "स्थिर" चरण), ब्रेक हट जाते हैं, और कार बिल्कुल वैसे ही चलती है जैसे वह सामान्य रूप से चलती है।

यह कैसे काम करता है?
शोध पत्र बताता है कि प्रशिक्षण के शुरुआती चरणों के दौरान, AI की सीखने के पीछे का गणित बहुत शोर भरा और अप्रत्याशable होता है। PsiLogic इस शोर के "वॉल्यूम" (आवाज़ के स्तर) पर नज़र रखता है। यह डेटा कितना जंगली या अनियंत्रित है, इसे मापने के लिए यह दो अलग-अलग "थर्मामीटर" (गणितीय औसत) का उपयोग करता है। यदि अल्पकालिक थर्मामीटर दीर्घकालिक थर्मामीटर की तुलना में बहुत अधिक बढ़ जाता है, तो सिस्टम जान जाता है कि अराजकता हो रही है। इसके बाद यह एक "कैंसलेशन टर्म" (cancellation term) को सक्रिय करता है—जो एक फैंसी तरीका है यह कहने का कि यह सीखने के कदमों को छोटा करने के लिए एक डैम्पिंग फोर्स (damping force) जोड़ता है। यह अपने आप होता है, बिना मानव प्रशिक्षक द्वारा कोई टाइमर या शेड्यूल सेट किए। यह एक इम्प्लिसिट वॉर्मअप (implicit warmup) है: सिस्टम खुद जानता है कि कब सावधान रहना है और कब साहसी होना है।

बड़ा परीक्षण: FairBench
यह देखने के लिए कि क्या यह नया विचार वास्तव में काम करता है, शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने एक कठोर परीक्षण मैदान बनाया जिसे वे FairBench कहते हैं। वे यह सुनिश्चित करना चाहते थे कि वे एक ऑप्टिमाइज़र को दूसरे की तुलना में बेहतर लर्निंग रेट देकर धोखाधड़ी न कर रहे हों। इसलिए, उन्होंने प्रत्येक ऑप्टिमाइज़र (Adam, AdamW, Lion, और PsiLogic) को बिल्कुल समान शुरुआती बिंदु दिया और उन्हें अपनी सर्वोत्तम गति खोजने दी। उन्होंने उन्हें चार अलग-अलग "अरेना" (कार्यों) पर परखा:

  1. NLP (भाषा): एक मॉडल को कहानी में अगले शब्द की भविष्यवाणी करना सिखाना।
  2. ViT (दृष्टि/विज़न): एक मॉडल को चित्र पहचानना सिखाना।
  3. ResNet (दृष्टि/विज़न): एक अन्य इमेज रिकग्निशन कार्य।
  4. Diffusion (कला): एक मॉडल को शोर (noise) से चित्र बनाना सिखाना।

उन्होंने इन परीक्षणों को एक शक्तिशाली NVIDIA H100 कंप्यूटर पर चलाया, और परिणामों की पुष्टि के लिए प्रत्येक प्रयोग को तीन बार दोहराया।

उन्हें क्या मिला?
परिणाम काफी रोमांचक थे, लेकिन लेखक इस बारे में बहुत ईमानदार थे कि PsiLogic कहाँ चमकता है और कहाँ नहीं।

  • जीत: चार में से तीन क्षेत्रों में, PsiLogic शीर्ष पर रहा।

    • Language (NLP) कार्य में, इसने 7.79 की "परप्लेक्सिटी" (एक स्कोर जहाँ कम होना बेहतर है) प्राप्त की, जो AdamW के 8.17 से बेहतर थी। शोधकर्ताओं का कहना है कि यह अंतर सांख्यिकीय रूप से महत्वपूर्ण है, जिसका अर्थ है कि यह एक वास्तविक सुधार है और कोई इत्तेफाक नहीं।
    • ViT (Vision) कार्य में, PsiLogic ने 0.244 की सटीकता प्राप्त की, जो AdamW के 0.223 से काफी अधिक है।
    • ResNet कार्य में, इसने 0.222 सटीकता हासिल की, जो मानक Adam ऑप्टिमाइज़र के 0.172 से बेहतर थी।
  • टाई (बराबरी):

    • Diffusion (इमेज जनरेशन) कार्य में, PsiLogic ने मानक विधियों के समान प्रदर्शन किया। अंतर इतना कम था कि यह सांख्यिकीय रूप से एक "टाई" था।
    • ResNet कार्य में, विशेष रूप से AdamW की तुलना में, परिणाम एक "संख्यात्मक टाई" (0.222 बनाम 0.219) थे जो सांख्यिकीय रूप से महत्वपूर्ण नहीं थे।

चुनौती: गति (Speed)
शोध पत्र एक कमी के बारे में बहुत पारदर्शी है। हालांकि PsiLogic कुछ मामलों में बेहतर सीखता है, लेकिन यह धीमा है। ViT कार्य पर, इसे AdamW की तुलना में एक सिंगल स्टेप पूरा करने में 1.79 गुना अधिक समय लगा। लेखक बताते हैं कि ऐसा इसलिए नहीं है क्योंकि गणित कठिन है, बल्कि इसलिए क्योंकि उनका वर्तमान कंप्यूटर कोड अभी पूरी तरह से अनुकूलित (optimized) नहीं है। उनका मानना ​​है कि भविष्य में बेहतर कोड लिखकर इस गति की कमी को ठीक किया जा सकता है, लेकिन फिलहाल, यह एक ट्रेड-ऑफ है: आपको बेहतर परिणाम मिल सकते हैं, लेकिन इसमें थोड़ा अधिक समय लग सकता है।

निष्कर्ष (The Bottom Line)
यह शोध पत्र सुझाव देता है कि हमारे AI शिक्षकों में एक "अराजकता डिटेक्टर" जोड़कर, हम उन्हें सीखने के शुरुआती अराजक दिनों में भ्रमित हुए बिना आगे बढ़ने में मदद कर सकते हैं। PsiLogic यह दावा नहीं करता कि यह हर समस्या के लिए पूर्ण समाधान है (उदाहरण के लिए, यह इमेज जनरेशन प्रतियोगिता नहीं जीत सका), लेकिन यह दिखाता है कि प्रशिक्षण प्रक्रिया के "मिजाज" के प्रति संवेदनशील होना भाषा और इमेज रिकग्निशन कार्यों में बेहतर प्रदर्शन की ओर ले जा सकता है। शोधकर्ताओं ने अपना सारा कोड और डेटा सार्वजनिक कर दिया है, जिससे अन्य लोग उनके काम की जांच कर सकें और देख सकें कि क्या वे भी वही परिणाम प्राप्त कर सकते हैं। यह ऐसे AI की ओर एक आशाजनक कदम है जो जानता है कि कब कोमल होना है और कब साहसी, और यह सब अपने स्वयं के सीखने के शोर को सुनकर संभव होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →