← नवीनतम पेपर
🤖 AI

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection

यह शोध पत्र RoCo-ACE को प्रस्तुत करता है, जो एक रोलआउट-कंडीशन्ड ऑनलाइन डिस्टिलेशन फ्रेमवर्क है जो संदर्भ-समर्थित टोकन (reference-supported tokens) के लिए डिस्टिलेशन वेट्स को गतिशील रूप से पुनर्वितरित करके और स्पार्स एंकोर्ड करेक्शन (sparse anchored corrections) लागू करके प्रीट्रेन्ड MLLMs में ज्ञान इंजेक्शन को बढ़ाता है, जिससे मॉडल के मूल व्यवहार प्रतिधारण (behavioral retention) को प्रभावी ढंग से संरक्षित करते हुए श्रेष्ठ इंजेक्टेड-नॉलेज सटीकता प्राप्त की जाती है।

मूल लेखक: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

प्रकाशित 2026-07-29
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक सुपर-स्मार्ट रोबोट दोस्त है जिसने लाइब्रेरी की लगभग हर किताब पढ़ ली है और लाखों तस्वीरें देखी हैं। यह रोबोट बातचीत करने, पहेलियाँ सुलझाने और जो वह देखता है उसका वर्णन करने में माहिर है। लेकिन इसमें एक पेच है: दुनिया हर दिन बदलती है। नई फिल्में आती हैं, वैज्ञानिक खोजें होती हैं, और प्रसिद्ध लोग नए काम करते हैं। यदि आप अपने रोबोट दोस्त को इन ताज़ा तथ्यों के बारे में जानना चाहते हैं, तो आपको उसे सिखाना होगा। लेकिन एक विशाल रोबोट को सिखाना मुश्किल है। यदि आप उसे बस एक नया तथ्य रटने के लिए मजबूर करते हैं, तो हो सकता है कि वह अपने पुराने कौशल भूल जाए, जैसे बिल्ली का चित्र बनाना या सुरक्षा संबंधी प्रश्न का उत्तर देना। यह एक शतरंज के ग्रैंडमास्टर को एक नई चाल सिखाने जैसा है, लेकिन इस प्रक्रिया में वह खेल खेलना ही भूल जाता है। यह शोध पत्र ठीक इसी समस्या पर काम करता है: कैसे एक बुद्धिमान रोबंत के मस्तिष्क में नए, विशिष्ट तथ्यों को इस तरह डाला जाए जिससे उसके पुराने, भरोसेमंद कौशल खराब न हों।

इस अध्ययन के पीछे के शोधकर्ताओं ने, जो एंट ग्रुप (Ant Group) और विश्वविद्यालयों के मॉडल्स के साथ काम कर रहे हैं, महसूस किया कि इन रोबोट्स को सिखाने के सामान्य तरीके थोड़े अनाड़ी थे। एक तरीका ऐसा है जैसे रोबोट को शब्द-दर-शब्द पाठ्यपुस्तक की नकल करने के लिए मजबूर करना; वह तथ्य तो सीख जाता है, लेकिन वह एक उबाऊ रोबोट की तरह व्यवहार करने लगता है और अपना व्यक्तित्व खो देता है। दूसरा तरीका बहुत सावधान रहने की कोशिश करता है और मस्तिष्क के केवल बहुत छोटे हिस्सों को ही बदलता है, लेकिन अक्सर यह मुख्य बिंदु को ही चूक जाता है, जिससे नए तथ्य आधे-अधूरे ही सीखे जाते हैं। यान होंग (Yan Hong) और जुन लैन (Jun Lan) के नेतृत्व में टीम ने एक चतुर नई रणनीति विकसित की जिसे RoCo-ACE कहा जाता है। इसे एक "स्मार्ट हाइलाइटर" सिस्टम के रूप में समझें। रोबोट को पूरी पाठ्यपुस्तक रटने के देने के बजाय, वे रोबोट को पहले प्रश्न का उत्तर देने देते हैं। फिर, वे रोबोट के उत्तर की तुलना शिक्षक के "सही" उत्तर से करते हैं।

यहाँ जादू का कमाल है: सिस्टम रोबोट के उत्तर को देखता है और पूछता है, "क्या शिक्षक की मदद ने इस विशिष्ट शब्द को अधिक संभावित बनाया?" यदि रोबोट ने एक सही तथ्य (जैसे कि एक विशिष्ट तिथि या नाम) का अनुमान लगाया और शिक्षक की उपस्थिति ने उस अनुमान को और भी मजबूत बना दिया, तो सिस्टम उस शब्द को 'हाई-फाइव' देता है और रोबोट को उसे अच्छी तरह याद रखने के लिए कहता है। लेकिन यदि रोबोट केवल सामान्य शब्दों का उपयोग कर रहा है (जैसे "एफ़िल टॉवर" के बजाय "एक बड़ी इमारत"), तो सिस्टम उन्हें अनदेखा कर देता है। यही RoCo वाला हिस्सा है। फिर, ACE वाला हिस्सा आता है। कभी-कभी, रोबोट नया तथ्य पूरी तरह से मिस कर देता है। ACE सिस्टम एक कोमल धक्के की तरह काम करता है, जो कहता है, "हे, तुम संग्रहालय का नाम भूल गए! चलो बस उस एक छूटे हुए हिस्से को ठीक करते हैं।" इन दोनों को मिलाकर, रोबोट स्वाभाविक रूप से बातचीत करने या सुरक्षित रहने की अपनी क्षमता खोए बिना नए तथ्यों को सटीक रूप से सीखता है।

टीम ने तीन अलग-अलग प्रकार के ज्ञान अपडेट्स पर इसका परीक्षण किया, जिसमें मशहूर हस्तियों की खबरें से लेकर विज्ञान के तथ्य तक शामिल थे। उन्होंने पाया कि अन्य तरीकों की तुलना में RoCo-ACE नए तथ्यों को सिखाने में सबसे बेहतर था। एक परीक्षण में, इसने रोबोट की ज्ञान सटीकता को 27.6 तक बढ़ा दिया (जबकि मानक "पाठ्यपुस्तक की नकल करने" वाले तरीके के लिए यह 20.1 थी)। महत्वपूर्ण रूप से, जबकि अन्य तरीकों के कारण रोबोट अपने पुराने कौशल भूल गया (जिससे उसका सामान्य प्रदर्शन स्कोर गिरकर 31.8 तक आ गया), RoCo-ACE ने रोबोट के सामान्य कौशल को लगभग वहीं बनाए रखा जहाँ वे शुरू में थे, जो कि लगभग 56.5 था। यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण एक बहुत बेहतर संतुलन प्रदान करता है: आपको नई जानकारी भी मिलती है और रोबोट अपना मानसिक संतुलन भी नहीं खोता। यह उन रोबोट्स की ओर एक कदम है जो अपनी पहचान खोए बिना हर दिन नई चीजें सीखते रह सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →