← नवीनतम पेपर
💬 NLP

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

यह शोध पत्र Agent-Dice प्रस्तुत करता है, जो एक पैरामीटर फ्यूजन फ्रेमवर्क है जो ज्यामितिक सर्वसम्मति फ़िल्टरिंग (geometric consensus filtering) और वक्रता-आधारित वेटिंग (curvature-based weighting) के माध्यम से ज्ञान अपडेट को अलग करके साझा अर्थों (shared semantics) और कार्य-विशिष्ट हस्तक्षेप (task-specific interference) के बीच प्रभावी ढंग से संतुलन बनाकर LLM-आधारित निरंतर शिक्षण (continual learning) में स्थिरता-प्लास्टिसिटी दुविधा को संबोधित करता है।

मूल लेखक: Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Agent-Dice" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके किया गया स्पष्टीकरण दिया गया है।

बड़ी समस्या: "भुलक्कड़ छात्र" (The "Forgetful Student")

कल्पना कीजिए कि आपने एक प्रतिभाशाली छात्र (एक AI एजेंट) को काम पर रखा है ताकि वह हर हफ्ते एक नया कौशल सीख सके।

  • सप्ताह 1: उसने एक बेहतरीन केक बनाना सीखा।
  • सप्ताह 2: उसने कार का इंजन ठीक करना सीखा।
  • सप्ताह 3: उसने एक पोर्ट्रेट पेंट करना सीखा।

वास्तविक दुनिया में, जब यह छात्र कार का इंजन ठीक करना सीखने की कोशिश करता है, तो वह अनजाने में केक बनाना "भूल" सकता है। वह भ्रमित हो जाता है क्योंकि बेकिंग के निर्देश (मैदा मिलाना) और इंजन ठीक करने (बोल्ट कसना) के निर्देश एक-दूसरे के विपरीत लगते हैं। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है।

AI में, इसे स्टेबिलिटी-प्लास्टिसिटी डिलेमा (Stability-Plasticity Dilemma) के रूप में जाना जाता है:

  • स्टेबिलिटी (स्थिरता): जो आप पहले से जानते हैं उसे बनाए रखना (केक बनाना न भूलें)।
  • प्लास्टिसिटी (लचीलापन): कुछ नया सीखने के लिए पर्याप्त लचीला होना (इंजन सीखें)।

अधिकांश वर्तमान AI एजेंट उस भुलक्कड़ छात्र की तरह हैं: यदि आप उन्हें बहुत अधिक नई चीजें सिखाते हैं, तो वे पुरानी चीजें खो देते हैं।


समाधान: Agent-Dice (द "स्मार्ट टीम कैप्टन")

लेखकों ने Agent-Dice नामक एक नई विधि बनाई है। AI को एक समय में एक चीज़ सीखने देने और बेहतर होने की उम्मीद करने के बजाय, Agent-Dice एक बुद्धिमान टीम कैप्टन की तरह काम करता है जो विशेषज्ञों के एक समूह का प्रबंधन करता है।

यहाँ बताया गया है कि Agent-Dice कैसे काम करता है, जिसे दो सरल चरणों में विभाजित किया गया है:

चरण 1: "मतदान प्रणाली" (जियोमेट्रिक कंसेंसस - Geometric Consensus)

कल्पना कीजिए कि AI ने किसी समस्या को हल करने के तीन अलग-अलग तरीके सीख लिए हैं, लेकिन वे सभी असहमत हैं।

  • विशेषज्ञ A कहता है: "नोब को बाएँ (Left) घुमाएं।"
  • विशेषज्ञ B कहता है: "नोब को बाएँ (Left) घुमाएं।"
  • विशेषज्ञ C (जो भ्रमित है) कहता है: "नोब को दाएँ (Right) घुमाएं।"

यदि AI उनकी सलाह का औसत निकालता है, तो वह नोब को आधा घुमा सकता है, जिससे कुछ भी नहीं होगा।
Agent-Dice की तरकीब: यह बहुमत के वोट (majority vote) को देखता है। यह देखता है कि दो विशेषज्ञ "बाएँ" पर सहमत हैं और एक असहमत है। यह भ्रमित विशेषज्ञ (विशेषज्ञ C) को पूरी तरह से अनदेखा कर देता है।

  • उपमा: यह एक जूरी (Jury) की तरह है। यदि 10 जूरी सदस्य "दोषी" कहते हैं और 1 "निर्दोष" कहता है, तो जूरी बीच का रास्ता नहीं निकालती; वे स्पष्ट सहमति के साथ चलते हैं। यह AI को "शोर" या विरोधाभासी निर्देशों से भ्रमित होने से रोकता है।

चरण 2: "कॉन्फिडेंस मीटर" (कर्वेचर वेटिंग - Curvature Weighting)

अब जब टीम ने दिशा (बाएँ घुमाएं) पर सहमति बना ली है, तो उन्हें कितनी जोर से धक्का देना चाहिए?

  • विशेषज्ञ A बहुत आत्मविश्वासी है और कहता है, "इसे ज़ोर से घुमाओ!" (यह एक बड़ा, साहसिक अपडेट है)।
  • विशेषज्ञ B हिचकिचा रहा है और कहता है, "शायद बस एक छोटा सा मोड़?" (यह एक छोटा, सतर्क अपडेट है)।

Agent-Dice देखता है कि सीखने का रास्ता कितना "खड़ी ढलान" (steep) वाला है। यदि कोई विशेषज्ञ एक बहुत बड़ा बदलाव कर रहा है, तो इसका मतलब है कि उसने एक बहुत ही महत्वपूर्ण, उच्च-विश्वास वाली अंतर्दृष्टि (insight) प्राप्त की है।
Agent-Dice की तरकीब: यह उन विशेषज्ञों को अधिक महत्व (weight) देता है जो बड़े, आत्मविश्वासी कदम उठा रहे हैं, लेकिन केवल तभी जब वे बहुमत के साथ सहमत हों।

  • उपमा: कल्पना कीजिए कि हाइकर्स (hikers) का एक समूह शिखर खोजने की कोशिश कर रहा है। यदि तीन हाइकर एक खड़ी और स्पष्ट राह पर तेज़ी से दौड़ रहे हैं, और एक व्यक्ति एक सपाट, धुंधले रास्ते पर धीरे चल रहा है, तो समूह का लीडर (Agent-Dice) सबको दौड़ने वालों का अनुसरण करने के लिए कहता है। वे "ढलान" या "तीव्रता" को महत्व के संकेत के रूप में भरोसा करते हैं।

यह एक बड़ी बात क्यों है?

आमतौर पर, AI को नई चीजें सिखाने के लिए भारी कंप्यूटिंग पावर की आवश्यकता होती है और अक्सर यह उसके पुराने कौशल को खराब कर देता है। Agent-Dice तीन तरीकों से खेल बदल देता है:

  1. यह एक "मर्ज" है, न कि "रीराइट": पूरे मस्तिष्क को शुरू से फिर से प्रशिक्षित करने के बजाय, Agent-Dice विभिन्न कार्यों से प्राप्त "अपडेट्स" (नया ज्ञान) को सावधानीपूर्वक मिलाता है।
  2. यह सुपर फास्ट है: पेपर दिखाता है कि यह प्रक्रिया एक शक्तिशाली कंप्यूटर पर एक मिनट से भी कम समय लेती है (या एक सामान्य लैपटॉप पर लगभग 10 मिनट)। यह एक पूर्ण "सर्जरी" के बजाय एक त्वरित "चेक-अप" करने जैसा है।
  3. यह हर जगह काम करता है: उन्होंने दो बहुत अलग प्रकार के AI पर इसका परीक्षण किया:
    • GUI एजेंट्स: AI जो आपके फोन या कंप्यूटर स्क्रीन पर बटन क्लिक करता है (जैसे एक डिजिटल असिस्टेंट)।
    • टूल-यूज़ एजेंट्स: AI जो बाहरी उपकरणों का उपयोग करता है (जैसे वेब सर्च करना या कैलकुलेटर का उपयोग करना)।

निचोड़ (The Bottom Line)

Agent-Dice एक चतुर विधि है जो AI एजेंटों को उनके पुराने कौशल को भूले बिना नए कौशल सीखने में मदद करती है। यह एक स्मार्ट फ़िल्टर की तरह काम करके ऐसा करता है:

  1. यह भ्रमित करने वाली, विरोधाभासी सलाह को फ़िल्टर (बाहर) कर देता है (जिसे "शोर" कहा जाता है)।
  2. यह उस मजबूत, साझा ज्ञान को एम्प्लीफाई (बढ़ावा) देता है जिस पर सभी सहमत होते हैं।

ऐसा करके, AI एक वास्तविक "लाइफलॉन्ग लर्नर" बन जाता है जो अपनी याददाश्त खोए बिना हर दिन स्मार्ट होता जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →