← नवीनतम पेपर
💬 NLP

Quantifying and extending the coverage of spatial categorization data sets

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल (large language models) टोपोलॉजिकल रिलेशंस पिक्चर सीरीज़ (Topological Relations Picture Series - TRPS) के रणनीतिक विस्तार को निर्देशित करने के लिए मानवीय स्थानिक वर्गीकरण लेबल के साथ प्रभावी ढंग से संरेखित हो सकते हैं, जिसके परिणामस्वरूप 42 दृश्यों वाला एक नया डेटासेट प्राप्त होता है जो पिछले विस्तारों की तुलना में स्थानिक संबंधों के बेहतर कवरेज की पेशकश करता है।

मूल लेखक: Wanchun Li, Alexandra Carstensen, Yang Xu, Terry Regier, Charles Kemp

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanchun Li, Alexandra Carstensen, Yang Xu, Terry Regier, Charles Kemp

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "चीजें कहाँ हैं" की पूरी दुनिया का नक्शा बनाने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि विभिन्न देशों के लोग मेज पर रखे कप, पिंजरे में बैठे पक्षी या दीवार पर पड़ती छाया की स्थिति का वर्णन कैसे करते हैं।

दशकों से, शोधकर्ताओं ने एक विशिष्ट "फोटो एल्बम" जिसका नाम TRPS (टोपोलॉजिकल रिलेशंस पिक्चर सीरीज़) है, का उपयोग करने के लिए किया है। इसमें विभिन्न स्थितियों में वस्तुओं को दर्शाने वाले 71 चित्र हैं। लेकिन समस्या यह है: यह एल्बम अधूरा है। यह ऐसा है जैसे आप केवल तट के कुछ चित्रों का उपयोग करके पूरे महासागर का मानचित्र बनाने की कोशिश कर रहे हों। यह स्थानिक भाषा (spatial language) के विशाल क्षेत्रों को छोड़ देता है, विशेष रूप से अंग्रेजी के अलावा अन्य भाषाओं के लिए।

यह शोध पत्र इस बारे में है कि कैसे लेखकों ने आर्टिफिशियल इंटेलिजेंस (विशेष रूप से लार्ज लैंग्वेज मॉडल्स या LLMs) का उपयोग करके इस नक्शे को ठीक करने, इसके लापता हिस्सों को भरने और यह पता लगाने के लिए किया कि कौन से नए चित्र और भाषाएं आगे जोड़ना सबसे महत्वपूर्ण है।

यहाँ उनके दृष्टिकोण का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "लुप्त पहेली के टुकड़े" (The Missing Puzzle Pieces)

मौजूदा 71 चित्रों को एक ऐसी पहेली के रूप में सोचें जो केवल किनारों को दिखाती है। शोधकर्ता जानते हैं कि स्थान का वर्णन करने के कई और तरीके हैं (जैसे "के बीच में," "के नीचे," "के बाईं ओर," या "के बाहर"), लेकिन उनके पास उन सभी के लिए चित्र नहीं हैं।

  • चुनौती: एक पूर्ण नक्शा बनाने के लिए, उन्हें सैकड़ों नए चित्र जोड़ने होंगे और उन्हें दर्जनों भाषाओं में टेस्ट करना होगा। इसे मैन्युअल रूप से करना (चित्र बनाने और उन्हें लेबल करने के लिए मनुष्यों को काम पर रखना) बहुत धीमा और महंगा है।

2. समाधान: "AI इंटर्न" (The AI Intern)

लेखकों ने एक AI (विशेष रूप से जेमिनी नामक एक मॉडल) को एक सुपर-फास्ट रिसर्च असिस्टेंट के रूप में उपयोग करने का निर्णय लिया।

  • प्रयोग: उन्होंने AI को 220 अलग-अलग चित्र दिखाए (पुराने 71 प्लस 150 नए) और उससे पूछा: "यदि आप स्पेनिश, चीनी या फ्रेंच के मूल वक्ता होते, तो आप इस चित्र का वर्णन करने के लिए किस शब्द का उपयोग करते?"
  • परीक्षण: उन्होंने जांचा कि क्या AI के उत्तर वास्तविक मनुष्यों द्वारा कहे जाने वाले शब्दों से मेल खाते हैं।
  • परिणाम: AI आश्चर्यजनक रूप से अच्छा था! वह लगभग 80-90% बार मानव उत्तरों से सहमत रहा। यह पूर्ण नहीं है, लेकिन यह एक विश्वसनीय "ड्राफ्ट्समैन" (प्रारूपकार) के रूप में सटीक है।

3. रणनीति: "कवरेज मैप" (The Coverage Map)

अब जब उनके पास एक ऐसा AI था जो किसी भी भाषा और किसी भी चित्र के लिए लेबल का अनुमान लगा सकता था, तो उन्हें यह तय करने के लिए एक तरीका चाहिए था कि वास्तव में किन नए चित्रों का वास्तविक मनुष्यों के साथ परीक्षण किया जाए। वे केवल यादृच्छिक (random) चित्र नहीं जोड़ना चाहते थे; वे मानचित्र में "अंतराल" (gaps) को भरना चाहते थे।

उन्होंने कवरेज (Coverage) की अवधारणा का उपयोग किया, जो मछली पकड़ने वाले जाल की तरह है:

  • कल्पना कीजिए कि "सभी संभावित स्थानिक दृश्यों का ब्रह्मांड" मछलियों (दृश्यों) से भरा एक विशाल महासागर है।
  • पुराने 71 चित्र एक छोटा जाल हैं जो केवल तट के पास की मछलियाँ पकड़ते हैं।
  • लक्ष्य है एक बड़ा जाल डालना जो गहरे समुद्र, मूंगा चट्टानों (reefs) और खुले समुद्र से मछलियाँ पकड़े।
  • AI ने उन्हें विभिन्न स्थानों में जाल डालने का अनुकरण (simulate) करने में मदद की। उन्होंने पूछा: "यदि हम यह नया चित्र जोड़ते हैं, तो क्या यह उस प्रकार की 'मछली' (स्थानिक अवधारणा) को पकड़ता है जो हमारे वर्तमान जाल में गायब है?"

4. परिणाम: एक बेहतर नक्शा (A Better Map)

इस AI-सहायता प्राप्त रणनीति का उपयोग करके, उन्होंने 42 चित्रों का एक नया सेट बनाया (जिसे LCXRK सेट कहा जाता है)।

  • परिणाम: जब उन्होंने मापा कि उनके नए चित्रों ने "महासागर" के कितने हिस्से को कवर किया, तो उन्होंने पाया कि उनके नए सेट ने पिछले प्रयासों की तुलना में स्थान को बहुत बेहतर तरीके से कवर किया।
  • भाषा परीक्षण: उन्होंने AI का उपयोग यह पता लगाने के लिए भी किया कि उनके अध्ययन में कौन सी भाषाएं गायब थीं। AI ने सुझाव दिया कि पुर्तगाली और रोमानियाई उन भाषाओं से बहुत भिन्न हैं जिनका उनके पास पहले से ही डेटा था, इसलिए अगली बार वास्तविक मनुष्यों के साथ परीक्षण करने के लिए ये उपयुक्त होनी चाहिए।

5. यह क्यों महत्वपूर्ण है?

यह शोध पत्र यह नहीं कह रहा है कि "AI मानव वैज्ञानिकों की जगह लेगा।" इसके बजाय, यह कह रहा है कि "AI हमें अपने प्रयोगों की योजना बनाने में मदद करने के लिए सबसे अच्छा उपकरण है।"

  • पहले: शोधकर्ताओं को यह अनुमान लगाना पड़ता था कि कौन से चित्र बनाने हैं और किन भाषाओं का अध्ययन करना है।
  • अब: वे हजारों परिदृश्यों का अनुकरण करने, अपने ज्ञान के अंतराल को खोजने और फिर सबसे महत्वपूर्ण चीजों को सत्यापित करने के लिए वास्तविक मनुष्यों का उपयोग करने के लिए AI का उपयोग कर सकते हैं।

संक्षेप में: लेखकों ने स्थानिक विवरणों के बेहतर "मेन्यू" (सूची) को बनाने के लिए AI का उपयोग किया। उन्होंने हजारों संयोजनों का स्वाद चखने के लिए AI का उपयोग किया, यह पता लगाया कि कौन से व्यंजन (दृश्य और भाषाएं) मेन्यू में गायब थे, और एक नया, अधिक पूर्ण मेन्यू बनाया जो इस बात को कवर करता है कि हम "चीजें कहाँ हैं" का वर्णन कैसे करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →