← नवीनतम पेपर
💻 computer science

Getting to the Point: Why Pointing Improves LVLMs

यह शोध पत्र प्रदर्शित करता है कि एक स्पष्ट "पॉइंट-देन-काउंट" (बिंदु-फिर-गणना) तंत्र को शामिल करने से बड़े विजन-लैंग्वेज मॉडल्स की ज़ीरो-शॉट काउंटिंग सटीकता और आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण में महत्वपूर्ण सुधार होता है, क्योंकि यह ओवरफिटिंग के बजाय स्थानिक जानकारी का लाभ उठाकर मजबूत कौशल सीखने के लिए स्थानिक सूचना का उपयोग करता है, हालांकि यह उत्पन्न किए गए पॉइंटिंग निर्देशांकों की विश्वसनीयता में कुछ स्थानिक पूर्वाग्रहों को भी प्रकट करता है।

मूल लेखक: Simone Alghisi, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

प्रकाशित 2026-03-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Simone Alghisi, Massimo Rizzoli, Seyed Mahed Mousavi, Giuseppe Riccardi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा लापरवाह रोबोट सहायक है जिसका नाम VisionBot है। VisionBot चित्रों का वर्णन करने में माहिर है ("वह एक बिल्ली है!") और सरल प्रश्नों के उत्तर देने में भी ("क्या बिल्ली सो रही है?")। लेकिन जब आप इससे कोई कठिन गणितीय प्रश्न पूछते हैं जैसे, "इस चित्र में कितने लाल सितारे हैं?", तो VisionBot अक्सर गलत उत्तर देता है। वह "5" का अनुमान लगा सकता है जबकि वास्तव में वहां "7" होते हैं, या वह बिना वास्तव में देखे बस एक संख्या का भ्रम पैदा कर सकता है।

यह शोध पत्र आपको VisionBot को एक नया करतब सिखाने के बारे में बता रहा है: उत्तर देने से पहले इशारा करना (Pointing before answering)।

यहाँ शोधकर्ताओं द्वारा की गई खोजों का सरल विवरण दिया गया, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

समस्या: "अनुमान लगाने का खेल" (The "Guessing Game")

आमतौर पर, जब आप VisionBot को चीजों को गिनने के लिए कहते हैं, तो वह सीधे उत्तर पर पहुँचने की कोशिश करता है। यह एक छात्र से गणित का सवाल हल करने के लिए कहने जैसा है बिना अपना काम दिखाए। वे भाग्यशाली हो सकते हैं, लेकिन यदि संख्याएँ बड़ी हो जाती हैं या चित्र अव्यवस्थित हो जाता है, तो वे अनुमान लगाने लगते हैं।

शोधकर्ताओं ने VisionBot को सिखाने के दो तरीके आजमाए:

  1. सीधे गिनना (Direct Counting - "अंतर्ज्ञान" वाला दृष्टिकोण): आप पूछते हैं, "कितने सितारे हैं?" और बॉट बस कहता है, "सात।"
  2. पहले इशारा करना फिर गिनना (Point-then-Count - "अपना काम दिखाने" वाला दृष्टिकोण): आप पूछते हैं, "कितने सितारे हैं?" और बॉट को पहले स्क्रीन पर हर एक सितारे की ओर इशारा करना होता है (जैसे प्रत्येक पर एक बिंदु बनाना), और फिर अंतिम उत्तर देने के लिए उन बिंदुओं को गिनना होता है।

बड़ी खोज: इशारा करना एक महाशक्ति है (Pointing is a Superpower)

शोधकर्ताओं ने पाया कि "पहले इशारा करना फिर गिनना" वाला तरीका गेम-चेंजर साबित हुआ। यहाँ बताया गया है कि क्यों, तीन सरल रूपकों (metaphors) का उपयोग करते हुए:

1. "उंगलियों पर गिनने" का उदाहरण (कौशल सीखना बनाम रटना)

एक बच्चे को गिनना सिखाने की कल्पना करें।

  • सीधे गिनना उन्हें यह याद रखने जैसा है कि "सेब वाले एक चित्र का अर्थ 'तीन' शब्द है।" यदि आप उन्हें 10 सेबों वाला चित्र दिखाते हैं, तो वे घबरा जाते हैं क्योंकि उन्होंने पहले ऐसा कभी नहीं देखा। वे केवल पैटर्न को रट रहे हैं।
  • पहले इशारा करना फिर गिनना उन्हें अपनी उंगलियों का उपयोग करना सिखाने जैसा है। वे एक सेब की ओर इशारा करते हैं, "एक" कहते हैं, अगले की ओर इशारा करते हैं, "दो" कहते हैं। भले ही वे 100 सेब देखें, वे इशारा करने और गिनने की प्रक्रिया जानते हैं।

शोधपत्र में पाया गया कि जब रोबोट को पहले इशारा करना सिखाया गया, तो उन्होंने वास्तव में गिनती का कौशल सीख लिया। जब शोधकर्ताओं ने उन्हें उन चित्रों को दिखाया जिनमें वस्तुओं की संख्या बहुत अधिक थी (जैसे 15 या 18 वस्तुएं), तो "पहले इशारा करो और फिर गिनो" वाले रोबोट सही रहे, जबकि "सीधे गिनने" वाले रोबोट बुरी तरह विफल रहे। इशारा करने ने उन्हें केवल विशिष्ट उत्तरों को रटने के बजाय एक सामान्य नियम सीखने के लिए मजबूर किया।

2. "नक्शा बनाम गंतव्य" का उदाहरण (यह क्यों काम करता है)

इशारा करने से क्या मदद मिलती है? शोधकर्ताओं ने एक दिलचस्प प्रयोग किया जहाँ उन्होंने रोबोट को इशारा करने के लिए कहा, लेकिन वास्तविक निर्देशांक (coordinates) देने के बजाय, उन्होंने बस इसे "X, X, X" कहने के लिए कहा।

  • परिणाम: रोब सहित रोबोट गिनती करने में बहुत खराब हो गया।
  • निष्कर्ष: जादू इशारा करने के कार्य में नहीं था, बल्कि स्थानिक जानकारी (spatial information) (नक्शे) में था।

इसे किसी को दिशा निर्देश देने जैसा समझें।

  • सीधे गिनना: "दुकान पर जाओ।" (रोबोट को रास्ता अनुमान लगाना पड़ता है)।
  • पहले इशारा करना फिर गिनना: "लाल घर की ओर चलो, फिर नीले घर की ओर, फिर हरे घर की ओर।" (रोबोट एक स्पष्ट नक्शा/रास्ता फॉलो करता है)।

रोबोट को निर्देशांकों की एक सूची (नक्शा) बनाने के लिए मजबूर करके, यह उत्तर तक पहुँचने के लिए एक संरचित मार्ग बनाता है। यह एक बिखरे हुए दृश्य पहेली को टेक्स्ट की एक व्यवस्थित सूची में बदल देता है जिसे आसानी से गिना जा सकता है।

3. "बहरूपों को पहचानना" का उदाहरण (विकर्षणों को संभालना)

वास्तविक जीवन अस्त-व्यस्त होता है। कल्पना कीजिए कि एक चित्र में 5 लाल सितारे और 50 नीले गोले हैं। एक "सीधे गिनने" वाला रोबोट भ्रमित हो सकता है और नीले गोलों को भी गिन सकता है।

  • "पहले इशारा करना फिर गिनना" वाले रोबोट शोर-शराबे (distractions) को अनदेखा करने में बहुत बेहतर थे। क्योंकि उन्हें पहले विशिष्ट लाल सितारों की ओर शारीरिक रूप से "इशारा" करना था, इसलिए उनके द्वारा नीले गोलों से धोखा खाने की संभावना कम थी। यह एक सुरक्षा गार्ड की तरह है जो एक-एक करके आईडी चेक करता है; वे भीड़ से विचलित नहीं होते।

कमी: यह पूर्ण नहीं है

शोधकर्ताओं ने कुछ खामियां भी पाईं, जैसे एक बेहतरीन इंजन में ढीले स्क्रू ढूंढना:

  • "आलसी" रोबोट: कभी-कभी, रोबोट सही सितारों की ओर इशारा करता था, लेकिन फिर उन्हें सही ढंग से गिनना भूल जाता था। यह एक ऐसे छात्र की तरह था जिसने अपने होमवर्क पर सभी सही चरण तो लिखे लेकिन अंतिम उत्तर गलत लिख दिया।
  • "कोने" का पक्षपात (Corner Bias): कुछ रोबोट चित्र के बीच में चीजों की ओर इशारा करने में बहुत अच्छे थे लेकिन जब वस्तुएं कोनों में होती थीं तो वे लापरवाह हो जाते थे। यह एक ऐसे कैमरे की तरह है जिसका केंद्र में फोकस बहुत अच्छा है लेकिन किनारों पर धुंधला हो जाता है।
  • "अंधा" रोबोट: एक आश्चर्यजनक मोड़ में, शोधकर्ताओं ने पाया कि एक बार जब रोबोट ने निर्देशांकों की सूची बना ली, तो उसने लगभग चित्र को देखना ही बंद कर दिया। वह बस टेक्स्ट निर्देशांकों की सूची को गिन रहा था। यह एक ऐसे शेफ की तरह था जो सामग्री को चखता है, उन्हें सूची में लिखता है, और फिर बिना दोबारा देखे केवल उस सूची को गिनता है।

निष्कर्ष

यह शोध पत्र सिद्ध करता है कि यदि आप चाहते हैं कि एक AI बुद्धिमान और विश्वसनीय हो, तो केवल उत्तर न मांगें। पहले उसे अपना काम दिखाने के लिए कहें।

लार्ज विजन-लैंग्वेज मॉडल्स को गिनने से पहले वस्तुओं की ओर "इशारा" करने के लिए मजबूर करके, हम केवल एक बेहतर उत्तर नहीं प्राप्त कर रहे हैं; हम AI को एक मौलिक कौशल सिखा रहे हैं जो इसे उन नई, कठिन और जटिल स्थितियों को संभालने में मदद करता है जिन्हें उसने पहले कभी नहीं देखा है। यह एक ऐसे रोबोट के बीच का अंतर है जो एक स्क्रिप्ट रटता है और एक ऐसे रोबोट के बीच जो वास्तव में समस्या को हल करना जानता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →