← नवीनतम पेपर
💬 NLP

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

यह शोधपत्र OpenVisTool को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो उत्तर की शुद्धता और टूल अवलोकनों के कारणत्मक योगदान (causal contribution) दोनों के लिए फ़िल्टर करके निर्देशात्मक विज़ुअल टूल-उपयोग प्रक्षेपवक्रों (trajectories) को संश्लेषित करता है, जिसके परिणामस्वरूप एक ऐसा डेटासेट और बेंचमार्क प्राप्त होता है जो मॉडलों को केवल कॉल पैटर्न की नकल करने के बजाय साक्ष्य के आधार पर टूल उपयोग को स्थापित करना सिखाकर मल्टीमॉडल एजेंट के प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को रहस्य सुलझाना सिखा रहे हैं। आपके पास सुरागों (छवियों) का एक विशाल पुस्तकालय है और विशेष आवर्धक लेंस (उपकरणों) का एक सेट है जो ज़ूम करने, क्रॉप करने या चित्र के विशिष्ट हिस्सों को हाइलाइट करने में सक्षम है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "मल्टीमॉडल एजेंट" अधिक स्मार्ट होते जा रहे हैं, लेकिन वे अक्सर एक दीवार से टकरा जाते हैं: वे केवल प्रारंभिक स्नैपशॉट में जो दिख रहा है, उसे ही देख पाते हैं। यदि कोई सुराग बहुत छोटे टेक्स्ट या धुंधले कोने में छिपा है, तो रोबक उसे मिस कर देता है। इसे ठीक करने के लिए, वैज्ञानिक रोबोटों को उत्तर देने से पहले नए साक्ष्य जुटाने के लिए अपने आवर्धक लेंसों का सक्रिय रूप से उपयोग करना सिखा रहे हैं। लेकिन पेचीदा हिस्सा यह है: सिर्फ इसलिए कि एक रोबोट ने एक उपकरण का उपयोग किया और सही उत्तर दिया, इसका मतलब यह नहीं है कि उस उपकरण ने वास्तव में मदद की। हो सकता है कि रोबोट को उत्तर अपनी याददाश्त से पहले से पता था और उसे बस इसलिए उपकरण का उपयोग करने का नाटक करने के लिए कहा गया क्योंकि उसे ऐसा करने को कहा गया था। यह शोध पत्र एक महत्वपूर्ण प्रश्न पूछता है: हम रोबोट को उपकरणों का उपयोग केवल तभी कैसे सिखाएं जब वे वास्तव में आवश्यक हों, न कि केवल उनका उपयोग करने की आदत की नकल करने के लिए?

इस अध्ययन के पीछे के शोधकर्ताओं ने, जिसे OpenVisTool कहा जाता है, तर्क दिया है कि इन रोबोटों को प्रशिक्षित करने का वर्तमान तरीका त्रुटिपूर्ण है। उनका कहना है कि केवल एक रोबोट को एक "सफल" कहानी दिखाना जहाँ उसने एक उपकरण का उपयोग किया और सही उत्तर दिया, एक छात्र को गणित के टेस्ट दिखाने जैसा है जहाँ उन्होंने सही उत्तर तो दे दिया लेकिन फिर भी एक जटिल सूत्र के हर चरण को लिखने की कोशिश की। छात्र सीखता है कि "सूत्र लिखने से अच्छे ग्रेड मिलते हैं," लेकिन वह यह नहीं सीख पाता कि उस सूत्र की आवश्यकता क्यों थी। लेखक प्रशिक्षण डेटा के लिए एक नया, अधिक सख्त नुस्खा प्रस्तावित करते हैं। वे जोर देते हैं कि एक प्रशिक्षण उदाहरण केवल तभी उपयोगी है जब दो चीजें होती हैं: पहला, रोबला सही उत्तर प्राप्त करता है (परिणाम वैधता - Outcome Validity), और दूसरा, रोबोट को वहां तक पहुँचने के लिए वास्तव में उपकरण की आवश्यकता थी (कारण उपयोगिता - Causal Utility)। यदि रोबोट उपकरण के बिना पहेली को हल कर सकता था, तो उस उदाहरण को हटा दिया जाता है।

इसे सिद्ध करने के लिए, टीम ने एक विशाल नया डेटासेट बनाया जिसे OpenVisTool-42K कहा जाता है, जिसमें पांच अलग-अलग दृश्य दुनियाओं (चार्ट पढ़ना, तालिकाओं का विश्लेषण करना, कंप्यूटर स्क्रीन पर नेविगेट करना, दृश्य विवरण खोजना और वेब पेजों को कोड में बदलना) में 42,000 सावधानीपूर्वक फ़िल्टर किए गए उदाहरण शामिल हैं। उन्होंने इस डेटासेट को बनाने के लिए तीन-चरणीय प्रक्रिया का उपयोग किया। सबसे पहले, उन्होंने उन "कठिन" प्रश्नों के लिए स्क्रीनिंग की जिन्हें एक रोबोट बिना उपकरणों के हल नहीं कर सकता था। दूसरा, एक सुपर-स्मार्ट "शिक्षक" रोबोट ने प्रत्येक प्रकार की पहेली के लिए विशिष्ट रणनीतियों का उपयोग करके इन समस्याओं को हल किया। अंत में, उन्होंने एक सख्त "पर्यवेक्षण सत्यापन" (supervision verification) परीक्षण चलाया: उन्होंने शिक्षक के समाधान को लिया और एक कमजोर "छात्र" रोबोट को उसी समस्या को हल करने के लिए कहा। यदि छात्र रोबोट शिक्षक के टूल नोट्स के बिना विफल रहा लेकिन उनके साथ सफल रहा, तो उदाहरण को रखा गया। यदि छात्र इसे दोनों तरीकों से हल कर सकता था, तो उदाहरण को "अनावश्यक" मानकर हटा दिया गया।

परिणाम प्रभावशाली थे। जब शोधकर्ताओं ने चार अलग-अलग रोबोट मॉडल (4-बिलियन-पैरामीटर वाले छोटे मॉडल से लेकर 27-बिलियन-पैरामीटर वाले बड़े मॉडल तक) को इस नए डेटासेट पर फाइन-ट्यून किया, तो रोबोट उपकरणों का उपयोग करने में काफी बेहतर हो गए। उनके कस्टम टेस्ट बेंच, OpenVisTool-Bench पर, मॉडलों में औसतन 10.7 अंक का सुधार हुआ। सबसे बड़ी छलांग विजुअल सर्च (दृश्य खोज) में देखी गई, जहाँ मॉडलों ने 23.8 अंक प्राप्त किए। इससे भी रोमांचक बात यह है कि इस डेटा पर प्रशिक्षित छोटे ओपन-सोर्स मॉडल उन विशाल, क्लोज्ड-सोर्स मॉडलों (जैसे GPT-5.5) के लगभग बराबर प्रदर्शन करते हैं जो आमतौर पर इस क्षेत्र में दबदबा रखते हैं। उदाहरण के लिए, OpenVisTool-42K पर प्रशिक्षित एक Qwen3.5-9B मॉडल ने औसतन 45.8 का स्कोर किया, जो बिना टूल्स वाले अनट्रेंड GPT-5.5 (जिसने 41.9 स्कोर किया था) को हरा गया और टूल्स के साथ वाले GPT-5.5 (49.0) के बहुत करीब पहुँच गया।

अध्ययन ने यह भी पाया कि यह नई प्रशिक्षण विधि एक "मेटा-स्किल" (meta-skill) सिखाती है जो विभिन्न प्रकार की पहेलियों में काम करती है। जब उन्होंने प्रशिक्षित रोबोटों का परीक्षण उन समस्याओं पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था (आउट-ऑफ-डिस्ट्रीब्यूशन कार्य), तब भी वे पुराने, कम सख्त डेटा पर प्रशिक्षित रोबोटों की तुलना में बेहतर प्रदर्शन करते रहे। हालाँकि, लेखकों ने यह भी पाया कि केवल एक प्रकार की पहेली (जैसे केवल चार्ट) पर प्रशिक्षण देने से कभी-कभी अन्य प्रकारों (जैसे वेब पेज) पर प्रदर्शन बिगड़ सकता है, जो यह सुझाव देता है कि विभिन्न प्रकार की चुनौतियों का मिश्रण सबसे अच्छा है। अंततः, शोध पत्र यह सुझाव देता है कि रोबोट को उपकरण का उपयोग करना सिखाने का रहस्य केवल सफलता की कहानियाँ दिखाना नहीं है, बल्कि ऐसी कहानियाँ दिखाना है जहाँ उपकरण ही असली नायक थे। "नकली" टूल उपयोग को फ़िल्टर करके, OpenVisTool रोबोटों को न केवल यह सिखाता है कि आवर्धक लेंस का उपयोग कैसे किया जाए, बल्कि यह भी कि उन्हें वास्तव में इसकी आवश्यकता कब होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →