← नवीनतम पेपर
💻 computer science

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Lang2Act एक नवीन ढांचा है जो कठोर, पूर्व-निर्धारित बाहरी उपकरणों को स्व-उद्भूत भाषाई टूलचेन से बदलकर विजन-लैंग्वेज मॉडल्स की सूक्ष्म दृश्य तर्क क्षमता को बढ़ाता है, जिसे दृश्य जानकारी को संरक्षित करने और महत्वपूर्ण प्रदर्शन लाभ प्राप्त करने के लिए दो-चरणीय सुदृढीकरण शिक्षण (Reinforcement Learning) प्रक्रिया के माध्यम से अनुकूलित किया गया है।

मूल लेखक: Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

प्रकाशित 2026-04-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Lang2Act पेपर का विवरण दिया गया है, जिसे सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

मुख्य विचार: AI को बिना तस्वीर को तोड़े "बारीकी से देखना" सिखाना

कल्पना कीजिए कि आप एक विशाल, जटिल मानचित्र (टेक्स्ट, चार्ट और छवियों से भरा एक दस्तावेज़) का उपयोग करके किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक शानदार जासूस (AI) है जो बहुत बुद्धिमान है, लेकिन कभी-कभी मानचित्र के कोनों में छिपे छोटे, महत्वपूर्ण विवरणों को पढ़ने में संघर्ष करता है।

पुराने तरीकों की समस्या:
पिछले AI सिस्टमों ने इस समस्या को हल करने के लिए जासूस को कैंची और एक आवर्धक लेंस (magnifying glass) देने की कोशिश की।

  • कैंची (क्रॉपिंग/काटना): यदि AI को लगता कि मानचित्र का कोई विशिष्ट हिस्सा महत्वपूर्ण है, तो वह उस हिस्से को करीब से देखने के लिए उसे भौतिक रूप से काटकर अलग कर देता था।
  • दोष: यह जोखिम भरा है। यदि जासूस गलत हिस्सा काट देता है, या उसे बहुत छोटा काट देता है, तो वे अनजाने में उस उत्तर को ही फेंक सकते हैं जिसे वे ढूंढ रहे थे। यह एक किताब को व्यक्तिगत अक्षरों को काटकर पढ़ने की कोशिश करने जैसा है; आप संदर्भ (context) खो देते हैं, और कहानी बिखर जाती है। साथ ही, कैंची "कठोर" (rigid) होती है—वे केवल सीधी रेखाओं में काट सकती हैं, जिससे चित्र की सूक्ष्मता (nuance) छूट जाती है।

Lang2Act का समाधान:
जासूस को कैंची देने के बजाय, शोधकर्ताओं (Lang2Act) ने जासूस को एक नई सुपरपावर सिखाई: मैजिक लैंग्वेज टूलकिट (जादुगत भाषाई उपकरण किट)।

छवि को भौतिक रूप से काटने के बजाय, जासूस विशेष "भाषाई उपकरणों" का उपयोग करके छवि से बात करना सीखता है।

  • उपमा: कल्पना कीजिए कि जासूस के पास कुछ जादुई कमांड हैं जैसे "ऊपरी दाएं कोने में संख्या पढ़ें" या "इन दो बार (bars) की ऊंचाई की तुलना करें।"
  • यह कैसे काम करता है: जब जासूस कहता है, "संख्या पढ़ें," तो AI वास्तव में छवि को नहीं काटता है। इसके बजाय, वह आंतरिक रूप से अपना ध्यान उस विशिष्ट स्थान पर केंद्रित करता है, डेटा को "पढ़ता" है, और परिणाम को अपनी नोटबुक में लिख लेता है। छवि पूरी, अखंड और संदर्भ से भरपूर रहती है।

उन्होंने AI को कैसे सिखाया (दो-चरणीय प्रशिक्षण)

शोधकर्ताओं ने केवल AI को कमांड की सूची नहीं थमा दी। उन्होंने इसे दो चरणों वाली प्रशिक्षण प्रक्रिया के माध्यम से अपने स्वयं के उपकरण आविष्कार करना सिखाया, जैसे कि दो स्तरों वाला एक वीडियो गेम:

स्तर 1: "स्व-खोज" चरण (Action RL)

  • उपमा: एक बच्चे की कल्पना करें जो खिलौनों की दुकान में है। उसे बताया जाता है, "इस पहेली को हल करने का सबसे अच्छा तरीका खोजो।" बच्चा कई अलग-अलग चीजें आज़माता है—ब्लॉक को एक के ऊपर एक रखना, उन्हें लुढ़काना, उन्हें फेंकना।
  • AI ने क्या किया: AI को कई प्रश्न दिए गए और उसे "ज़ोर से सोचने" (think out loud) की अनुमति दी गई। उसने छवियों को देखने के कई तरीके आज़माए। शोधकर्ताओं ने देखा कि किन "विचारों" ने सही उत्तर तक पहुँचाया।
  • परिणाम: उन्होंने सबसे सफल "विचारों" को एकत्र किया और उन्हें एक टूलबॉक्स (औजारों का डिब्बा) में बदल दिया। उदाहरण के लिए, उन्होंने देखा कि AI "उच्चतम मान वाली पंक्ति का पता लगाएं" कहने में बहुत अच्छा है, इसलिए उन्होंने इसे एक स्थायी टूल बना दिया।

स्तर 2: "मास्टर क्लास" चरण (Tool-Based RL)

  • उपमा: अब जब बच्चे के पास सिद्ध टूल्स का एक टूलबॉक्स है, तो उसे एक कठिन पहेली दी जाती है। उसे कहा जाता है, "आपको इस पहेली को हल करने के लिए इन विशिष्ट टूल्स का उपयोग करना होगा।"
  • AI ने क्या किया: AI को इस नए टूलबॉक्स का उपयोग करके जटिल प्रश्नों को हल करने के लिए प्रशिक्षित किया गया। उसने टूल्स को एक साथ जोड़ना सीखा: "पहले, चार्ट का पता लगाएं। दूसरे, संख्याओं को पढ़ें। तीसरे, उनकी तुलना करें।"
  • पुरस्कार: यदि AI ने सही उत्तर पाने के लिए टूल्स का सही उपयोग किया, तो उसे एक "गोल्ड स्टार" (पुरस्कार) मिला। यदि उसने टूल के उपयोग में गलती की, तो उसे कोई स्टार नहीं मिला।

यह एक गेम-चेंजर क्यों है

  1. कोई टूटी हुई छवियां नहीं: क्योंकि AI भौतिक रूप से क्रॉप (काटता) नहीं है, इसलिए वह कभी भी आसपास का संदर्भ नहीं खोता। वह सूक्ष्म विवरण पर ध्यान केंद्रित करते हुए भी पूरी तस्वीर देख सकता है।
  2. लचीली सोच: पुराने तरीकों की कठोर कैंची के विपरीत, ये "भाषाई उपकरण" अनुकूल हो सकते हैं। यदि AI को दो चीजों की तुलना करने की आवश्यकता है, तो वह "तुलना करने" (compare) वाले टूल का उपयोग करता है। यदि उसे किसी नाम को खोजने की आवश्यकता है, तो वह "टेक्स्ट पढ़ने" (read text) वाले टूल का उपयोग करता है। यह एक स्विस आर्मी नाइफ (Swiss Army knife) होने जैसा है न कि केवल एक जोड़ी कैंची के।
  3. कम मतिभ्रम (Hallucination): "मतिभ्रम" तब होता है जब AI भ्रमित होने के कारण चीजें बना देता है। चूंकि Lang2Act AI को उत्तर देने से पहले अपने टूल्स का उपयोग करके विशिष्ट डेटा को "देखने" के लिए मजबूर करता है, इसलिए यह अनुमान लगाने के बजाय वास्तविक साक्ष्यों पर निर्भर रहता है।

वास्तविक दुनिया का परिणाम

अपने परीक्षणों में, Lang2Act एक ऐसे जासूस की तरह था जो उन रहस्यों को सुलझा सकता था जिन्होंने सबको उलझा दिया था।

  • परीक्षण: उन्होंने AI को जटिल दस्तावेज़ों (जैसे वित्तीय रिपोर्ट या वैज्ञानिक स्लाइड) के बारे में प्रश्न दिए।
  • परिणाम: Lang2-Act ने अगली सर्वश्रेष्ठ विधि की तुलना में 4% अधिक सही उत्तर प्राप्त किए।
  • "क्यों": एक उदाहरण में, एक पुराने तरीके ने चार्ट पर "ज़ूम इन" करने की कोशिश की लेकिन गलती से उत्तर "43%" को काट दिया, जिससे उसने "56%" का अनुमान लगाया (जो कि गलत था)। Lang2Act ने बस पूरी छवि से "43%" को "पढ़ा" और इसे सही ढंग से प्राप्त किया।

सारांश

Lang2Act छवियों को देखने का एक नया तरीका है। छवियों को काटने (जो कि अव्यवस्थित और त्रुटिपूर्ण है) के बजाय, यह AI को छवि के हिस्सों की ओर इशारा करने, पढ़ने और तुलना करने के लिए विशेष शब्दों का उपयोग करना सिखाता है। यह चित्र को पूर्ण रखता है, AI को अधिक स्पष्ट रूप से सोचने में मदद करता है, और बहुत अधिक स्मार्ट उत्तरों की ओर ले जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →