← नवीनतम पेपर
💻 computer science

DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning

यह शोध पत्र DWIM को प्रस्तुत करता है, जो एक नवीन ढांचा है जो विसंगति-जागरूक वर्कफ़्लो जनरेशन (discrepancy-aware workflow generation) के माध्यम से व्यवहार्य प्रशिक्षण डेटा निकालने और प्रभावी टूल कार्यों की नकल करने में मॉडलों को निर्देशित करने के लिए इंस्ट्रक्ट-मास्किंग फाइन-ट्यूनिंग (instruct-masking fine-tuning) का उपयोग करके कंपोजिशनल विज़ुअल रीजनिंग को बढ़ाता है, जिससे फ्रोजन एलएलएम (frozen LLMs) की सीमाओं को पार किया जा सकता है और अत्याधुनिक प्रदर्शन प्राप्त किया जा सकता है।

मूल लेखक: Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि किसी भीड़भाड़ वाले बगीचे की तस्वीर में सटीक रूप से कितने सेब हैं यह पता लगाना या यह समझाना कि एक कुत्ता टोपी क्यों पहने हुए है। आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे विजुअल रीजनिंग (Visual Reasoning) कहा जाता है।

लंबे समय तक, AI ने यह सब एक साथ करने की कोशिश की (जैसे कि कोई इंसान तुरंत पूरा उत्तर अनुमान लगा लेता है)। लेकिन हाल ही में, स्मार्ट AI ने एक "टूलबेल्ट" (औजारों की पेटी) वाला दृष्टिकोण अपनाना शुरू कर दिया है: यह समस्या को छोटे चरणों में तोड़ता है, विभिन्न उपकरणों (जैसे कैलकुलेटर, आवर्धक लेंस, या सर्च इंजन) का उपयोग करके प्रत्येक हिस्से को हल करता है।

हालाँकि, इस नए दृष्टिकोण के साथ एक बड़ी समस्या थी। AI का "दिमाग" (एक लार्ज लैंग्वेज मॉडल या LLM) जमा हुआ (frozen) था। यह एक ऐसे शानदार शेफ की तरह था जिसने हर कुकबुक तो पढ़ ली है, लेकिन उसने कभी किसी विशिष्ट सेट के औजारों के साथ वास्तविक रसोई में काम नहीं किया है। वह सिद्धांत में जानता था कि चाकू का उपयोग कैसे किया जाता है, लेकिन जब उसने वास्तव में टमाटर काटने की कोशिश की, तो वह अपनी उंगली काट सकता था या चाकू गिरा सकता था क्योंकि वह वास्तव में यह नहीं समझ पाया था कि औजार व्यावहारिक रूप से कैसे काम करते हैं।

यह शोध पत्र एक नई प्रणाली पेश करता है जिसे DWIM कहा जाता है (जिसका अर्थ है Do What I Mean, हालांकि यहाँ यह उनके विशिष्ट तरीके के लिए एक संक्षिप्त नाम है)। DWIM को एक अति-बुद्धिमान कुकिंग इंस्ट्रक्टर (खाना पकाने का प्रशिक्षक) के रूप में समझें जो AI को बिना किसी गड़बड़ी के वास्तव में अपने औजारों का उपयोग करना सिखाता है।

DWIM कैसे काम करता है, इसे दो सरल भागों में विभाजित किया गया है:

1. "रीथिंक" रणनीति (विसंगति-जागरूक वर्कफ़्लो जनरेशन)

कल्पना कीजिए कि आप एक रोबोट को केक बनाना सिखा रहे हैं।

  • पुराना तरीका: आप रोबोट को बताते हैं, "आटा मिलाएं, अंडे डालें, बेक करें।" यदि रोबोट केक जला देता है क्योंकि ओवन बहुत गर्म था, तो पुराना सिस्टम बस कहता है, "यह प्रयास विफल रहा, इसे फेंक दें," और फिर से कोशिश करता है। यह बहुत सारा समय और डेटा बर्बाद करता है।
  • DWIM का तरीका: रोबोट के पास एक "रीथिंक" (पुनर्विचार) बटन होता है। यदि वह बैटर मिलाता है और ओवन का फीडबैक कहता है, "रुको, तापमान गलत है," तो रोबोट हार नहीं मानता। वह रुकता है, कहता है, "ओह, मुझे गलती समझ आ गई! ओवन बहुत गर्म है," और फिर वह इसे ठीक करने के लिए अपना अगला कदम बदल देता है

DWIM इस "रीथिंक" क्षमता का उपयोग बेहतर प्रशिक्षण डेटा (training data) उत्पन्न करने के लिए करता है। असफल प्रयासों को फेंकने के बजाय, यह उन क्षणों को सहेजता है जहाँ AI ने महसूस किया कि एक उपकरण काम नहीं कर रहा था और खुद को सुधारा। यह "कैसे करें" के बेहतर मार्गदर्शिकाओं का एक समृद्ध पुस्तकालय बनाता है, जो AI को न केवल यह सिखाता है कि क्या करना है, बल्कि यह भी कि चीजें गलत होने पर उसे कैसे संभालना है।

2. "हाइलाइट और लर्न" रणनीति (इंस्ट्रक्ट-मास्किंग ट्यूनिंग)

एक बार जब AI के पास इन "रीथिंक" कहानियों का पुस्तकालय हो जाता है, तो DWIM को AI को यह सिखाने की आवश्यकता होती है कि अच्छे हिस्सों को याद रखे और बुरे हिस्सों को अनदेखा करे।

  • पुराना तरीका: आप AI को बेकिंग की आपदा की पूरी कहानी दिखाते हैं और कहते हैं, "इस पूरे क्रम को याद करो।" AI गलती से सफलता (जैसे "ओवन को 350 डिग्री पर सेट करें") के साथ गलती (जैसे "केक को 500 डिग्री पर ओवन में रखें") को भी सीख सकता है।
  • DWIM का तरीका: कल्पना कीजिए कि यह "मैड लिब्स" (Mad Libs) खेल है। शिक्षक कहानी लेता है, सफल चरणों को छिपा (mask) देता है (जैसे "ओवन को 350 पर सेट करें"), और AI से पूछता है: "संदर्भ के आधार पर, यहाँ क्या होना चाहिए था?"
    • वे हिस्से जो छिपे नहीं थे (गलतियाँ और "रीथिंक" के क्षण) दृश्यमान छोड़े गए हैं ताकि AI देख सके, "ओह, वह चरण गलत था।"
    • छिपे हुए हिस्से वे "सही" चालें हैं जिन्हें AI को अनुमान लगाना है।

यह AI को केवल प्रभावी कार्यों पर ध्यान केंद्रित करने और शोर (noise) को अनदेखा करना सीखने के लिए मजबूर करता है। यह केवल उन प्रश्नों का अभ्यास करने जैसा है जिन्हें आपने सही हल किया है, जबकि गलत उत्तरों को केवल यह समझने के लिए देखते हैं कि वे क्यों गलत थे, बिना उन्हें याद किए।

परिणाम

शोध पत्र दिखाता है कि यह विधि AI को उसके औजारों का उपयोग करने में बहुत बेहतर बनाती है।

  • पहले: AI उस छात्र की तरह था जो सिद्धांत जानता था लेकिन व्यावहारिक परीक्षा में विफल रहा क्योंकि उसे औजारों को कैसे संभालना है, यह नहीं पता था।
  • बाद में: AI एक अनुभवी शेफ की तरह है जो जानता है कि कौन सा औजार कब उठाना है, उसका उपयोग कैसे करना है, और यदि वह टूट जाए तो उसे कैसे ठीक करना है।

लेखकों ने कई अलग-अलग विजुअल पहेलियों (वस्तुओं को गिनना, छवियों के बारे में प्रश्नों के उत्तर देना, फोटो में विशिष्ट चीजों को ढूंढना) पर इसका परीक्षण किया। उन्होंने पाया कि उनकी विधि, DWIM, पिछले सभी शीर्ष तरीकों को पीछे छोड़ देती है, भले ही AI को परीक्षण के दौरान देखने के लिए कोई अतिरिक्त "चीट शीट" (उदाहरण) न दी गई हो। इसने सीखा कि अधिक कुशल कैसे बनना है, कम गलतियाँ करना और उन समस्याओं को हल करना जो उसने पहले कभी नहीं देखी थीं।

संक्षेप में: DWIM AI को केवल अंदाज़ा लगाने के बजाय अपनी गलतियों से वास्तविक समय में सीखना सिखाता है, जिससे एक अनाड़ी औजार-उपयोगकर्ता एक कुशल शिल्पकार में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →