← नवीनतम पेपर
💻 computer science

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

यह शोधपत्र बीकन (Beacon) को प्रस्तुत करता है, जो एक नवीन एजेंटिक विजुअल रीजनिंग मॉडल है, जो आवश्यकता-जागरूक अनुकूलन योग्य पुरस्कारों (Necessity-Aware Adaptive Rewards) और संकेत-निर्देशित क्षमता विस्तार (Hint-Guided Capability Expansion) वाले एक सुदृढीकरण शिक्षण ढांचे के माध्यम से मोड अनुकूलनशीलता (Mode Adaptiveness) और टूल प्रभाव (Tool Effect) में मौजूदा मॉडलों की सीमाओं को संबोधित करते हुए समग्र प्रदर्शन में सुधार करता है।

मूल लेखक: Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

प्रकाशित 2026-07-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट दोस्त है जो तस्वीरों को देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। यह रोबोट "मल्टीमॉडल एआई" (multimodal AI) नामक एक क्षेत्र का हिस्सा है, जहाँ कंप्यूटर टेक्स्ट और छवियों दोनों को समझना सीखते हैं। आमतौर पर, जब यह रोबोट किसी कठिन तस्वीर को देखता है, तो वह केवल अपने दिमाग (टेक्स्ट रीजनिंग) का उपयोग करके पहेली सुलझाने की कोशिश करता है। लेकिन कभी-कभी, पहेली केवल सोचने के लिए बहुत कठिन होती है; इसे "औजारों" के एक जोड़े की आवश्यकता होती है, जैसे कि ज़ूम करने के लिए आवर्धक लेंस (magnifying glass), चीजों को गिनने के लिए कैलकुलेटर, या छवि के एक हिस्से को काटने के लिए कैंची। इसे "एजेंटिक विजुअल रीजनिंग" (agentic visual reasoning) कहा जाता है। वैज्ञानिक मुख्य सवाल यह नहीं पूछ रहे हैं कि "क्या रोबोट औजारों का उपयोग कर सकता है?" बल्कि यह है कि "क्या रोबोट को पता है कि उनका उपयोग कब करना है?" यदि रोबोट अखरोट तोड़ने के लिए हथौड़ा उठा लेता है, तो वह समय बर्बाद करता है और शायद अखरोट को तोड़ भी सकता है। यदि वह काउंटर के बजाय अपनी आँखों से एक हजार छोटे बिंदुओं को गिनने की कोशिश करता है, तो वह गलत उत्तर दे सकता है। हम इसकी परवाह इसलिए करते हैं क्योंकि हम चाहते हैं कि हमारे एआई सहायक कुशल और सटीक हों, न कि केवल व्यस्त।

यहाँ आता है बीकन (Beacon), एक नया प्रकार का एआई मॉडल जिसे उन शोधकर्ताओं द्वारा बनाया गया है जिन्होंने महसूस किया कि वर्तमान "औजार उपयोग करने वाले" रोबोट थोड़े अनाड़ी होते हैं। वे हर चीज़ पर अपने औजारों का उपयोग करने लगते हैं, यहाँ तक कि सरल कार्यों पर भी जिन्हें वे अपनी आँखों से बंद करके हल कर सकते थे, और वे अक्सर तब विफल हो जाते हैं जब उन्हें मदद के बिना हल करना वास्तव में असंभव होता है। इस पेपर के लेखक, जो विश्वविद्यालयों और क्लिंग (Kling) टीम के एक समूह हैं, ने एक स्मार्ट रोबot बनाने का निर्णय लिया जो बिल्कुल जानता है कि कब औजारों को नीचे रखना है और कब उन्हें उठाना है।

उन्होंने पाया कि मौजूदा मॉडल एक ऐसे छात्र की तरह हैं जो 2+22+2 जैसे सरल जोड़ के लिए भी कैलकुलेटर का उपयोग करते रहते हैं, जिससे समय बर्बाद होता है और कभी-कभी वे मशीन पर बहुत अधिक निर्भर होने के कारण मूर्खतापूर्ण गलतियाँ करते हैं। वहीं दूसरी ओर, जब उन्हें वास्तव में कठिन गणित की समस्या का सामना करना पड़ता है, तो ये समान छात्र कैलकुलेटर का उपयोग करना ही भूल जाते हैं। शोधकर्ताओं ने इस व्यवहार को मापा और पाया कि कई वर्तमान मॉडलों के लिए, कठिन समस्याओं पर औजारों द्वारा दी जाने वाली "मदद" अक्सर आसान समस्याओं पर उनके द्वारा पहुँचाए गए "नुकसान" द्वारा लगभग पूरी तरह से रद्द कर दी जाती है।

इसे ठीक करने के लिए, उन्होंने बीकन को "रिनफोर्समेंट लर्निंग" (Reinforcement Learning) नामक एक विशेष प्रशिक्षण पद्धति का उपयोग करके बनाया। इसे एक कुत्ते को बहुत विशिष्ट नियमों के साथ प्रशिक्षित करने जैसा समझें। सबसे पहले, उन्होंने मॉडल को औजारों (जैसे छवि को क्रॉप करने या पिक्सेल को गिनने के लिए पायथन कोड लिखना) का उपयोग करना बहुत अभ्यास के माध्यम से सिखाया। फिर, उन्होंने इसे यह सिखाने के लिए दो चतुर तरीके पेश किए कि कब उनका उपयोग करना है:

  1. "आवश्यकता-जागरूक" पुरस्कार (The "Necessity-Aware" Reward): कल्पना कीजिए कि एक शिक्षक जो आपको गोल्ड स्टार देता है यदि आप बिना कैलकुलेटर के एक समस्या हल करते हैं, लेकिन यदि आप कैलकुलेटर का उपयोग केवल तभी करते हैं जब समस्या वास्तव में बहुत कठिन हो, तो आपको सिल्वर स्टार भी देता है। यदि आप एक आसान समस्या पर कैलकुलेटर का उपयोग करते हैं, तो आपको कोई स्टार नहीं मिलता। यह मॉडल को कठिन कामों के लिए अपने औजारों को बचाकर रखने के लिए सिखाता है।
  2. "संकेत-निर्देशित" विस्तार (The "Hint-Guided" Expansion): कभी-कभी, एक समस्या इतनी कठिन होती है कि मॉडल अटक जाता है और हार मान लेता है। हार मानने के बजाय, शोधकर्ताओं ने एक सुपर-स्मार्ट "विशेषज्ञ" मॉडल (एक जीनियस ट्यूटर की तरह) को एक संकेत लिखने के लिए कहा जो रोबोट को यह मार्गदर्शन दे कि समस्या को हल करने के लिए औजार का उपयोग कैसे किया जाए, बिना उत्तर बताए। रोबोट फिर उस संकेत के साथ समस्या को हल करने का अभ्यास करता है, रणनीति सीखता है, और अंततः बिना संकेत के इसे अपने आप करने में सक्षम हो जाता है।

परिणाम प्रभावशाली हैं। 13 अलग-अलग चुनौतीपूर्ण बेंचमार्क (ट्रैक पर मार्बल्स गिनने से लेकर बैडमिंटन स्कोर का पता लगाने तक) पर परीक्षण किए जाने पर, बीकन सबसे अच्छा प्रदर्शन करने वाला ओपन-सोर्स मॉडल बना। इसने न केवल औजारों का उपयोग करने में बेहतर प्रदर्शन किया; बल्कि यह चुनने में भी बेहतर हुआ कि उन्हें कब उपयोग करना है। डेटा दिखाता है कि बीकन ने अपने बेस वर्जन की तुलना में औसत 6.07 अंक का सुधार किया। इससे भी महत्वपूर्ण बात यह है कि इसने +3.14% का "टूल गेन" दिखाया, जिसका अर्थ है कि औजारों ने वास्तव में उन समस्याओं को हल करने में मदद की जिन्हें वह पहले हल नहीं कर सकता था, बिना आसान समस्याओं को बिगाड़े।

संक्षेप में, यह पेपर सुझाव देता है कि स्मार्ट एआई का भविष्य केवल अधिक औजारों के होने या सामान्य रूप से अधिक स्मार्ट होने के बारे में नहीं है; यह इस बुद्धिमत्ता के बारे में है कि कब एक औजार की ओर हाथ बढ़ाना है और कब अपने स्वयं के निर्णय पर भरोसा करना है। बीककन साबित करता है कि सही प्रशिक्षण के साथ, एआई एक विचारशील साथी बनने में सक्षम है, न कि केवल एक उन्मत्त औजार चलाने वाला।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →