← नवीनतम पेपर
💻 computer science

Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning

यह शोध पत्र Vision-EKIPL का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (Reinforcement Learning) ढांचा है जो प्रशिक्षण के दौरान बाहरी सहायक मॉडलों से उच्च-गुणवत्ता वाले कार्यों को सम्मिलित करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की दृश्य तर्क क्षमताओं को बढ़ाता है, जिससे अन्वेषण स्थान का विस्तार होता है, अभिसरण (convergence) में तेजी आती है, और अत्याधुनिक तरीकों की तुलना में 5% तक प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

प्रकाशित 2026-05-07
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Chaoyang Wang, Zeyu Zhang, Meng Meng, Xu Zhou, Haiyun Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (जिसे पॉलिसी मॉडल कहा जाता है) को जटिल दृश्य पहेलियों (visual puzzles) को हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि 3D दृश्य में वस्तुओं को गिनना या यह समझना कि आकार कैसे चलते हैं।

समस्या: "इको चैंबर" (गूँज कक्ष) का जाल

पारंपरिक रूप से, जब हम इन छात्रों को रीइन्फोर्समेंट लर्निंग (RL) नामक विधि का उपयोग करके प्रशिक्षित करते हैं, तो हम उन्हें अपने आप में कई उत्तर उत्पन्न करने के लिए कहते हैं। फिर हम सबसे अच्छे उत्तरों को पुरस्कृत करते हैं और खराब उत्तरों को दंडित करते हैं।

लेख तर्क देता है कि यह एक छात्र को केवल अपने स्वयं के नोट्स पढ़कर परीक्षा के लिए अध्ययन करने के लिए कहने जैसा है। वे जो पहले से जानते हैं उसे दोहराने में बेहतर हो सकते हैं, लेकिन वे एक "छत" (ceiling) से टकरा जाते हैं। वे समस्याओं को हल करने के नए, चतुर तरीके नहीं खोज पाते क्योंकि वे एक इको चैंबर में फंसे हुए हैं, जहाँ वे केवल अपने ही सीमित मस्तिष्क से विचारों को चुन रहे हैं। यह प्रशिक्षण को धीमा बनाता है और उनकी बुद्धिमत्ता की सीमा को सीमित करता है।

समाधान: Vision-EKIPL (एक "विशेषज्ञ पैनल" दृष्टिकोण)

लेखक एक नया ढांचा प्रस्तावित करते हैं जिसे Vision-EKIPL कहा जाता है। इसे छात्र को अध्ययन करने में मदद करने के लिए बाहरी विशेषज्ञों (जैसे GPT-4 या Gemini) के एक पैनल को नियुक्त करने के रूप में समझें।

यह इस प्रकार काम करता है, चरण-दर-चरण:

  1. समूह अध्ययन सत्र (The Group Study Session): केवल छात्र द्वारा उत्तर उत्पन्न करने के बजाय, सिस्टम दो स्रोतों से संभावित उत्तरों का एक समूह एकत्र करता है:
    • छात्र के अपने प्रयास।
    • "बाहरी विशेषज्ञों" (सहायक मॉडलों) द्वारा उत्पन्न उच्च-गुणवत्ता वाले उत्तर
  2. ग्रेडिंग (The Grading): एक शिक्षक (रिवॉर्ड फंक्शन) इन सभी उत्तरों को ग्रेड देता है। क्या छात्र ने गोलों (spheres) की सही संख्या गिनी? क्या उन्होंने सही प्रारूप का उपयोग किया?
  3. चयन (The Selection): सिस्टम इस मिश्रित समूह में से शीर्ष प्रदर्शन करने वाले उत्तरों को चुनता है। महत्वपूर्ण बात यह है कि यदि किसी विशेषज्ञ मॉडल ने एक चतुर समाधान खोजा है जिसे छात्र चूक गया था, तो उस समाधान को भी "शीर्ष चयन" में शामिल किया जाता है।
  4. पाठ (The Lesson): छात्र इस "सर्वश्रेष्ठ में से सर्वश्रेष्ठ" समूह से सीखता है। वे केवल अपनी गलतियों से नहीं सीख रहे हैं; उन्हें विशेषज्ञों के ज्ञान और तर्क रणनीतियों से समृद्ध किया जा रहा है।

उपमा: शतरंज का खिलाड़ी

कल्पना कीजिए कि एक शतरंज का खिलाड़ी बेहतर बनने की कोशिश कर रहा है।

  • पुराना तरीका (Standard RL): खिलाड़ी अपने खिलाफ ही 100 गेम खेलता है, कुछ जीतता है, और यह समझने की कोशिश करता है कि उसने क्या सही किया। वह शायद वही सुरक्षित, उबाऊ चालें चलते रहने के कारण फंस सकता है क्योंकि उसने कभी वह शानदार, जोखिम भरी चाल नहीं देखी जो उसे जिता सकती थी।
  • Vision-EKIPL: खिलाड़ी अपने खिलाफ 10 गेम खेलता है, लेकिन उसे ग्रैंडमास्टर्स द्वारा खेले गए 10 गेम देखने का भी मौका मिलता है। सिस्टम खिलाड़ी और ग्रैंडमास्टर्स दोनों के सर्वोत्तम मूव्स को चुनता है। खिलाड़ी फिर उन शीर्ष मूव्स का अध्ययन करता है। वह न केवल अपनी शैली सीखता है, बल्कि विशेषज्ञों की शानदार, जटिल रणनीतियों को भी सीखता है, जिससे उसकी कौशल की सीमा बहुत ऊपर तक बढ़ जाती है।

इस शोध पत्र ने क्या पाया

लेखकों ने विजुअल रीजनिंग कार्यों (जैसे वस्तुओं को गिनना, ज्यामिति को समझना और चलते हुए आकारों को ट्रैक करना) पर इस पद्धति का परीक्षण किया। उन्होंने पाया कि:

  • स्मार्ट परिणाम: Vision-EKIPL के साथ प्रशिक्षित मॉडल ने मानक तरीकों से प्रशिक्षित मॉडलों की तुलना में पहेलियों को बेहतर ढंग से हल किया, और पिछले "स्टेट-ऑफ-द-आर्ट" को लगभग 5% से पछाड़ दिया।
  • तेजी से सीखना: क्योंकि मॉडल को विशेषज्ञों से तुरंत अच्छे उत्तर देखने को मिलते हैं, इसलिए उसे अनुमान लगाने में समय बर्बाद करने की आवश्यकता नहीं होती है। वह तेजी से सीखता है और अधिक कुशलता से अभ्यासांतर (converge) होता है।
  • छत को तोड़ना (Breaking the Ceiling): सबसे महत्वपूर्ण निष्कर्ष यह है कि इस पद्धति ने वास्तव में मॉडल की तर्क सीमा (reasoning boundary) का विस्तार किया। जबकि मानक RL विधियाँ कभी-कभी मॉडलों को कम रचनात्मक (केवल सुरक्षित, ज्ञात रास्तों पर टिके रहना) बना देती हैं, Vision-EKIPL ने मॉडल को उन जटिल तरीकों को खोजने में मदद की जिन्हें वह अपने आप नहीं खोज सकता था।

संक्षेप में

Vision-EKIPL एक प्रशिक्षण पद्धति है जो AI मॉडलों को शून्य में सीखने से रोकती है। "विशेषज्ञ" AI मॉडलों के उच्च-गुणवत्ता वाले विचारों को अपने स्वयं के विचारों के साथ मिलाकर, यह उन्हें गहराई से सोचने, कठिन दृश्य पहेलियों को हल करने और बहुत तेजी से सीखने के लिए प्रशिक्षित करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →