← नवीनतम पेपर
🤖 machine learning

Affinity Is Not Enough: Recovering the Free Energy Principle in Mixture-of-Experts

यह शोध पत्र प्रस्तावित करता है कि मिक्सचर-ऑफ़-एक्सपर्ट्स मॉडल्स में मानक एफिनिटी-आधारित रूटिंग डोमेन ट्रांज़िशन के समय विफल हो जाती है, और यह प्रदर्शित करता है कि फ्री एनर्जी प्रिंसिपल से प्रेरित तंत्रों—विशेष रूप से टेम्पोरल मेमोरी, प्रिसिजन-वेटेड गेटिंग, और एन्टिसिपेटरी रूटिंग—को एकीकृत करने से विशेषज्ञ चयन की सटीकता और भविष्य कहनेवाला प्रदर्शन नाटकीय रूप से सुधर सकता है, क्योंकि यह मॉडल को वितरण संबंधी बदलावों (डिस्ट्रीब्यूशनल शिफ्ट्स) के होने से पहले ही उन्हें पहचानने और उनके लिए तैयार होने में सक्षम बनाता है।

मूल लेखक: Man Yung Wong (Russell)

प्रकाशित 2026-05-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Man Yung Wong (Russell)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चार विशेषज्ञ गाइडों ( "विशेषज्ञों") की एक टीम के साथ एक विशाल, बदलते हुए परिदृश्य में यात्रा कर रहे हैं। आपका काम हर कदम के लिए सही गाइड चुनना है।

वर्तमान AI सिस्टम में (जिसे Mixture-of-Experts या MoE कहा जाता है), गाइड चुनने वाला व्यक्ति एक ऐसे पर्यटक की तरह है जिसके पास न तो कोई नक्शा है, न दिशा-सूचक यंत्र (compass) और न ही कोई याददाश्त। वे केवल वर्तमान में अपने पैरों के नीचे की जमीन को देखते हैं ताकि यह तय किया जा सके कि किसे काम पर रखना है।

यह लेख तर्क देता है कि यह एक घातक दोष है। यदि आप एक जंगल में चल रहे हैं और अचानक ज़मीन रेगिस्तान में बदलने वाली है, तो एक ऐसा गाइड जो केवल वर्तमान पेड़ को देखता है, वह "जंगल के गाइड" को ही चुनता रहेगा। उन्हें तब तक पता नहीं चलेगा कि बदलाव आने वाला है जब तक कि बहुत देर न हो जाए।

रसेल वोंग (Russell Wong) सुझाव देते हैं कि हमें इस "हायरिंग मैनेजर" को अपग्रेड करने की आवश्यकता है, जो मस्तिष्क के काम करने के तरीके (विशेष रूप से, Free Energy Principle) से प्रेरित तीन सरल तरकीबों का उपयोग करता है। यह लेख इन अपग्रेड्स को रोजमर्रा के उपमाओं (analogies) का उपयोग करके कैसे समझाता है, यहाँ दिया गया है:

1. समस्या: "भुलक्कड़ पर्यटक" (The Amnesiac Tourist)

वर्तमान AI रूटिंग स्टेटलेस (stateless) है। यह पिछले 100 कदमों में जो कुछ भी हुआ उसे भूल जाता है।

  • परिणाम: जब AI "बिल्लियों" के बारे में बात करने से "कारों" के बारे में बात करने पर स्विच करता है, तो यह अक्सर विशेषज्ञों को तुरंत बदलने में विफल रहता है। पेपर के प्रयोगों में, स्विच के ठीक उसी क्षण, AI ने सही विशेषज्ञ को 0.6% संभावना दी। यह लगभग पूरी तरह से गलत था।
  • उपमा: यह एक ऐसे शेफ की तरह है जो केवल अपने मुँह में मौजूद चम्मच भर सूप का स्वाद लेता है, इस बात को नजरअंदाज करते हुए कि उसने अभी-अभी पूरे बाल्टी भर नमक डाला है। वह यह अनुमान नहीं लगा सकता कि सूप बहुत नमकीन होने वाला है जब तक कि वह पहले ही बर्बाद न हो जाए।

2. समाधान: हायरिंग मैनेजर के लिए तीन नए उपकरण

पेपर इन सुधारों को करने के लिए तीन हल्के बदलावों का प्रस्ताव देता है।

A. टेम्पोरल मेमोरी (The "Backpack" - बैग)

  • क्या है: केवल वर्तमान कदम को देखने के बजाय, सिस्टम एक "बैकपैक" (जिसे membrane potential कहा जाता है) लेकर चलता है जो पिछले कुछ कदमों की एक भारित स्मृति (weighted memory) रखता है।
  • उपमा: कल्पना कीजिए कि हायरिंग मैनेजर अब एक बैकपैक लेकर चलता है। यदि वे 30 मिनट से जंगल में चल रहे हैं, तो बैकपैक "जंगल की धूल" से भारी हो जाता है। भले ही उनके पैर के नीचे की जमीन जंगल जैसी दिख रही हो, भारी बैकपैक उन्हें बताता है, "हम यहाँ लंबे समय से हैं; हम जल्द ही यहाँ से जाने वाले हैं।"
  • परिणाम: AI सही गति से जानकारी को "भूलना" सीख जाता है। यदि परिदृश्य तेजी से बदलता है, तो बैकपैक जल्दी खाली हो जाता है। यदि परिदृश्य स्थिर है, तो यह इसे लंबे समय तक थामे रखता है। अकेले इसने स्विच पकड़ने की AI की क्षमता को 0.6% से बढ़ाकर 30% कर दिया।

B. प्रिसिजन-वेटेड गेटिंग (The "Trust Score" - विश्वास स्कोर)

  • क्या है: सिस्टम ट्रैक करता है कि हाल ही में प्रत्येक विशेषज्ञ कितना विश्वसनीय रहा है। यदि कोई विशेषज्ञ बार-बार गलतियाँ करता है, तो सिस्टम उनके "ट्रस्ट स्कोर" (प्रिसिजन) को कम कर देता है और उन्हें सुनने से रुक जाता है, भले ही वे वर्तमान शब्द के लिए एक अच्छा फिट लग रहे हों।
  • उपमा: कल्पना कीजिए कि आपके पास चार गाइड हैं। गाइड A जंगलों में महान है लेकिन रेगिस्तानों में बहुत खराब है। गाइड B इसके विपरीत है। वर्तमान सिस्टम गाइड A को इसलिए चुनता है क्योंकि वह एक जंगल में खड़ा है। नया सिस्टम कहता है, "रुको, गाइड A ने 5 मिनट पहले एक बड़ी गलती की थी जब हम रेगिस्तान के पास थे। मैं उनका ट्रस्ट स्कोर कम कर रहा हूँ। मैं उन्हें तभी चुनूँगा जब वे 100% सुनिश्चित हों।"
  • परिणाम: यह AI को तब अनुकूलित करने में मदद करता है जब विशेषज्ञ अविश्वसनीय हो जाते हैं। यह एक विश्वसनीय विशेषज्ञ बनाम एक अविश्वसनीय विशेषज्ञ पर सिस्टम के भरोसे में 31 गुना अंतर पैदा करता है।

C. एन्टिसिपेटरी रूटिंग (The "Crystal Ball" - क्रिस्टल बॉल/भविष्यवाणी)

  • क्या है: सिस्टम यह अनुमान लगाने की कोशिश करता है कि अगला कदम कैसा दिखेगा और उस अगले कदम के लिए विशेषज्ञ को चुनता है, न कि वर्तमान कदम के लिए।
  • उपमा: एक सामान्य पर्यटक उस पथ के लिए गाइड चुनता है जिस पर वह अभी है। एक एन्टिसिपेटरी पर्यटक आगे के रास्ते को देखता है और अगले मोड़ के लिए गाइड चुनता है।
  • सावधानी: पेपर ने पाया कि एक "क्रिस्टल बॉल" तब काम नहीं करती जब पर्यटक के पास कोई याददाश्त न हो। यदि आप अतीत को याद किए बिना भविष्य की भविष्यवाणी करने की कोशिश करते हैं, तो आप यह नहीं बता सकते कि बदलाव कब आ रहा है।
  • जादुई संयोजन: जब आप Backpack (Memory) को Crystal Ball (Prediction) के साथ मिलाते हैं, तो सिस्टम सुपरह्यूमन बन जाता है। बैकपैक "जंगल की धूल" से भर जाता है, और क्रिस्टल बॉल उस संतृप्ति (saturation) को पढ़कर कहती है, "हम जंगल की धूल से भरे हुए हैं; रेगिस्तान आना तय है!"
  • परिणाम: यह संयोजन सुपर-एडिटिव (super-additive) है।
    • केवल बैकपैक: +30% सुधार।
    • केवल क्रिस्टल बॉल: +0% सुधार (यह अंधा था)।
    • बैकपैक + क्रिस्टल बॉल: +74% सुधार।
    • मिलकर, उन्होंने एक आदर्श "ओरेकल" (एक पूर्ण गाइड) और AI के बीच के अंतर को 75% तक कम कर दिया।

3. यह क्यों मायने रखता है (The "Navigation" Metaphor)

पेपर निष्कर्ष निकालता है कि वर्तमान AI केवल वर्तमान के प्रति प्रतिक्रिया (reacting) दे रहा है। यह एक ऐसी मशीन है जो कहती है, "यह शब्द एक बिल्ली जैसा दिखता है, इसलिए मैं बिल्ली विशेषज्ञ का उपयोग करूँगा।"

नया सिस्टम नेविगेट (navigate) करता है। यह कहता है:

  1. मैं कहाँ रहा हूँ? (Backpack/Memory: "मैं लंबे समय से जंगल में हूँ।")
  2. मैं किस पर भरोसा कर सकता हूँ? (Trust Score: "रेगिस्तान का गाइड विश्वसनीय है; जंगल का गाइड थक गया है।")
  3. मैं कहाँ जा रहा हूँ? (Crystal Ball: "अगला परिदृश्य रेगिस्तान में बदल रहा है।")

मुख्य निष्कर्ष (The Bottom Line)

पेपर का दावा है कि इन तीन सरल, कम लागत वाले तंत्रों (मेमोरी, ट्रस्ट और प्रेडिक्शन) को जोड़कर, हम AI को उन क्षणों में "खो जाने" से रोक सकते हैं जब यह सबसे महत्वपूर्ण होता है: जब विषय बदलता है।

उनके परीक्षणों में, इस अपग्रेड ने काम पूरा करने के लिए आवश्यक विशेषज्ञों की संख्या को एक असंभव संख्या (सैकड़ों) से घटाकर एक बहुत छोटी, प्रबंधनीय संख्या (3 या 4) में बदल दिया। यह एक भ्रमित पर्यटक को एक कुशल नाविक में बदल देता है।

नोट: पेपर यह दावा नहीं करता है कि यह सभी AI समस्याओं को ठीक करता है या चिकित्सा निदान (medical diagnosis) पर लागू होता है। यह सख्ती से भाषा निर्माण (language generation) के दौरान "रूटिंग" (यह निर्णय लेना कि AI के किस हिस्से का उपयोग किया जाए) को स्मार्ट बनाने पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →