IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents
यह शोध पत्र इनपुट एट्रिब्यूशन-अवेयर पॉलिसी ऑप्टिमाइज़ेशन (IAPO) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो मल्टीमॉडल स्मॉल लैंग्वेज मॉडल्स में टूल-कॉलिंग क्षमताओं को बढ़ाने के लिए उनके इनपुट एट्रिब्यूशन को एक अधिक शक्तिशाली शिक्षक के साथ संरेखित करता है, जिससे स्पार्स बाइनरी रिवॉर्ड्स की सीमाओं को दूर किया जा सके और विजुअल क्वेश्चन अनसरिंग कार्यों पर प्रदर्शन में सुधार किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी तस्वीर: एक छोटे रोबोट को औज़ार इस्तेमाल करना सिखाना
कल्पना कीजिए कि आपके पास एक छोटा, स्मार्ट रोबोट (एक "Small Multimodal Agent") है जिसे चार्ट और टेबल से जुड़े पहेलियों को सुलझाना है। इन पहेलियों को सुलझाने के लिए, रोबोट के पास छह विशेष औज़ारों वाला एक टूलबॉक्स है, जैसे कि एक "हाइलाइटर," एक "मास्क," या एक "मैग्निफाइंग ग्लास" (आवर्धक लेंस)।
रोबोट का काम एक चार्ट को देखना, यह तय करना है कि सही डेटा को हाइलाइट करने के लिए कौन सा औज़ार उपयोग करना है, और फिर एक प्रश्न का उत्तर देना है।
समस्या:
जब शोधकर्ताओं ने इस छोटे रोबोट को मानक तरीकों (जिन्हें GRPO कहा जाता है) का उपयोग करके सिखाने की कोशिश की, तो रोबोट संघर्ष करने लगा। यह एक छात्र को केवल परीक्षा के अंत में ग्रेड देने जैसा था।
- यदि छात्र अंतिम उत्तर सही देता था, तो उसे "A" ग्रेड मिलता था, भले ही उसने बहुत अंदाज़े से या गलत औज़ारों का उपयोग करके वहां तक पहुँचा हो।
- यदि उत्तर गलत होता था, तो उसे "F" ग्रेड मिलता था, भले ही उसने सही औज़ारों का उपयोग किया हो लेकिन एक छोटी सी गणितीय त्रुटि कर दी हो।
क्योंकि रोबोट केवल अंतिम ग्रेड की परवाह करता था, इसलिए उसने बुरी आदतें सीख लीं। वह कभी-कभी चार्ट की गलत पंक्तियों पर "हाइलाइटर" का उपयोग कर देता था, जो कि संयोगवश सही होता था, और फिर भी सही उत्तर मिल जाता था। वह यह नहीं सीख पाया कि वह क्यों सही था, इसलिए वह उस सफलता को भरोसेमंद तरीके से दोहरा नहीं सका।
समाधान: IAPO (द "टीचर'स आई" मेथड)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे IAPO (Input Attribution-Aware Policy Optimization) कहा जाता है। इसे एक छोटे रोबोट को एक सुपर-स्मार्ट टीचर देने के रूप में सोचें जो रोबोट द्वारा उठाए गए हर कदम पर नज़र रखता है।
यहाँ बताया गया है कि IAPO कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:
1. "क्यों" की जाँच (Input Attribution)
केवल अंतिम उत्तर की जाँच करने के बजाय, IAPO पूछता है: "इमेज या टेक्स्ट के किस हिस्से ने रोबोट को यह तय करने के लिए प्रेरित किया कि उसे इस विशिष्ट टूल का उपयोग करना चाहिए?"
- उपमा: कल्पना कीजिए कि रोबोट एक अपराध स्थल की फोटो देख रहा है एक जासूस की तरह।
- खराब जासूस: एक रैंडम लाल जूते की ओर इशारा करता है और कहता है, "कातिल ने लाल जूते पहने थे!" (उसने सही उत्तर किस्मत से प्राप्त किया, लेकिन तर्क गलत था)।
- अच्छा जासूस: दरवाजे की ओर जाने वाले कीचड़ भरे पदचिह्नों की ओर इशारा करता है और कहता है, "कातिल दरवाजे से आया था।" (तर्क सबूतों से मेल खाता है)।
IAPO एक गणितीय ट्रिक जिसे Integrated Gradients कहा जाता है, का उपयोग यह मापने के लिए करता है कि रोबोट ने प्रॉम्प्ट के विभिन्न हिस्सों पर कितना "ध्यान" दिया। क्या उसने "Year" कॉलम पर ध्यान केंद्रित किया जहाँ उसे करना चाहिए था? या क्या वह "Name" कॉलम से विचलित हो गया था?
2. शिक्षक की छाया (The Teacher's Shadow)
छोटे रोबोट (छात्र) को एक बड़े, शक्तिशाली शिक्षक (एक बड़ा AI मॉडल जो पहले से ही इस कार्य में बहुत कुशल है) के साथ जोड़ा जाता है।
- शिक्षक उसी चार्ट को देखता है और तय करता है कि कौन सा टूल उपयोग करना है।
- शिक्षक यह भी दिखाता है कि निर्णय लेने के लिए उसने इमेज के ठीक किन हिस्सों को देखा था।
- IAPO छात्र के "अटेंशन मैप" की तुलना शिक्षक के "अटेंशन मैप" से करता है।
3. नया स्कोरकार्ड
रोबोट को एक नया स्कोर मिलता है। अब यह केवल उत्तर सही होने के बारे में नहीं है।
- पुराना स्कोर: क्या आपने उत्तर सही दिया? (हाँ/नहीं)।
- नया IAPO स्कोर: क्या आपने उत्तर सही दिया और क्या आपने उन्हीं सुरागों को देखा जिन पर शिक्षक ने देखा था?
यदि रोबोट सही टूल का उपयोग करता है लेकिन इमेज के गलत हिस्से को देखता है, तो उसे दंड (penalty) मिलता है। उसे शिक्षक के साथ अपनी "सोचने की प्रक्रिया" को संरेखित (align) करना सीखना होगा।
छोटे रोबोटों के लिए यह क्यों महत्वपूर्ण है
शोध से पता चला कि छोटे रोबोट (Small Language Models) केवल अंतिम उत्तर से सीखने में विशेष रूप से खराब होते हैं। उन्हें अंदाज़े लगाने के लिए आसानी से बहकाया जा सकता है।
IAPO का उपयोग करके:
- वे तेज़ी से सीखते हैं: वे अंदाज़ा लगाना बंद कर देते हैं और सही सबूतों पर ध्यान देना शुरू कर देते हैं।
- वे कम गलतियाँ करते हैं: रोबोट चार्ट की गलत पंक्तियों पर "हाइलाइटर" का उपयोग करना बंद कर देता है।
- वे बेहतर सामान्यीकरण (generalize) करते हैं: यहाँ तक कि जब वे किसी नए प्रकार के चार्ट को देखते हैं जिसे उन्होंने पहले नहीं देखा है, तो उन्हें पता होता है कि सही सुरागों को कैसे ढूँढना है क्योंकि उन्होंने केवल उत्तर नहीं, बल्कि प्रक्रिया सीखी है।
परिणाम
शोधकर्ताओं ने एक छोटे रोबोट (Qwen2.5-VL-3B) पर इसका परीक्षण किया।
- IAPO से पहले: रोबोट ठीक था, लेकिन वह अक्सर गलत टूल्स का उपयोग करता था या विचलित हो जाता था।
- IAPO के बाद: रोबोट की सटीकता (accuracy) छह अलग-अलग टेस्ट सेट्स में लगभग 3% बढ़ गई।
AI की दुनिया में, 3% की छलांग एक बहुत बड़ी बात है। इसका मतलब है कि रोबोट दृश्य पहेलियों को हल करने के लिए अपने औज़ारों का उपयोग करने में काफी अधिक विश्वसनीय हो गया है, क्योंकि उसे केवल सही उत्तर की उम्मीद करने के बजाय सही चीजों को देखने के लिए सिखाया गया था।
सारांश
IAPO को एक ऐसे ट्यूटर के रूप में समझें जो न केवल आपके अंतिम निबंध को ग्रेड देता है, बल्कि आपके रूपरेखा (outline) और शोध नोट्स पर भी नज़र रखता है। यदि आप एक शानदार निबंध लिखते हैं लेकिन आपके शोध नोट्स अव्यवस्थित और अप्रासंगिक हैं, तो ट्यूटर आपसे अपने शोध की प्रक्रिया को सुधारने के लिए कहता है। यह सुनिश्चित करता है कि जब आप अगली बार निबंध लिखें, तो आप इसे सही तरीके से करें, हर बार।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।