← नवीनतम पेपर
💻 computer science

Object-Centric Low-Data Datasets for Artificial Intelligence Research: A Multi-Domain Data Resource

यह शोध पत्र बहु-डोमेन मानकीकृत, वस्तु-केंद्रित डेटासेट्स के एक संग्रह को प्रस्तुत करता है जिसे आर्टिफिशियल इंटेलिजेंस अनुसंधान में नियंत्रित लो-डेटा प्रयोगों और पुनरुत्पादक संवर्धन वर्कफ़्लो को सुगम बनाने के लिए डिज़ाइन किया गया है।

मूल लेखक: Vasile Marian, Yong-Bin Kang, Alexander Buddery

प्रकाशित 2026-09-25
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vasile Marian, Yong-Bin Kang, Alexander Buddery

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, मशीनें चित्रों के विशाल पुस्तकालयों का अध्ययन करके देखना सीखती हैं। आमतौर पर, ये पुस्तकालय पूर्ण दृश्यों से भरे होते हैं: जैसे कारों, लोगों और इमारतों से भरी एक व्यस्त सड़क, या पेड़ों, चट्टानों और जानवरों वाला एक जंगल जो एक ही फ्रेम साझा कर रहे हों। एक कंप्यूटर के सीखने के लिए, उसे यह समझना होता है कि एक वस्तु कहाँ समाप्त होती है और दूसरी कहाँ शुरू होती है, जिसके लिए अक्सर नियमों को सही ढंग से समझने हेतु लाखों उदाहरणों की आवश्यकता होती है। लेकिन क्या होगा यदि कोई शोधकर्ता पृष्ठभूमि के व्यवधान के बिना, किसी एकल वस्तु, जैसे कि पैदल यात्री या ट्रैफिक साइन (यातायात संकेत) का अध्ययन करना चाहता है? यह 'ऑब्जेक्ट-सेंट्रिक' (वस्तु-केंद्रित) अनुसंधान की चुनौती है। यह सवाल उठाता है कि क्या एक मशीन अपने परिवेश से अलग होकर, केवल व्यक्तिगत वस्तु पर ध्यान केंद्रित करके अधिक कुशलता से सीख सकती है। यह दृष्टिकोण विशेष रूप से तब मूल्यवान होता है जब डेटा कम हो, जिससे वैज्ञानिकों को यह परीक्षण करने की अनुमति मिलती है कि एक AI केवल कुछ उदाहरणों से कितनी अच्छी तरह सीख सकता है, बजाय इसके कि उसे छवियों के पहाड़ की आवश्यकता हो। इसका लक्ष्य इन प्रणालियों को प्रशिक्षित करने के लिए एक स्वच्छ, अधिक नियंत्रित तरीका बनाना है, जो पूर्ण दृश्य के शोर को हटाकर यह देख सके कि मुख्य वस्तु वास्तव में कैसे व्यवहार करती है।

द यूनिवर्सिटी ऑफ क्वींसलैंड और स्विनबर्न यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने इस आवश्यकता को पूरा करने के लिए विशेष रूप से इस प्रकार के केंद्रित अध्ययन के लिए डिज़ाइन किए गए डेटा संसाधनों का एक नया संग्रह तैयार किया है। उन्होंने चार डेटासेट्स का एक सेट बनाया है जो पूरे फोटोग्राफ के बजाय व्यक्तिगत वस्तुओं को सूचना की प्राथमिक इकाई के रूप में देखते हैं। यह संग्रह केवल चित्रों का एक यादृच्छिक समूह नहीं है; यह एक सावधानीपूर्वक व्यवस्थित टूलकिट है जिसे वैज्ञानिकों को सीमित डेटा के साथ नियंत्रित प्रयोग चलाने में मदद करने के लिए बनाया गया है। शोधकर्ता मानक कंप्यूटर विजन डेटासेट्स से आगे बढ़ना चाहते थे, जो अक्सर जटिल दृश्यों में एक साथ कई चीजों का पता लगाने के लिए अनुकूलित होते हैं, और इसके बजाय एक ऐसा संसाधन प्रदान करना चाहते थे जहाँ प्रत्येक डेटा का हिस्सा एक एकल वस्तु का मानकीकृत, अलग दृश्य हो। ऐसा करके, वे उम्मीद करते हैं कि इससे दूसरों के लिए प्रयोगों को दोहराना और ऐसे आर्टिफिशियल इंटेलिजेंस तरीके विकसित करना आसान हो जाएगा जो कुशल और विश्वसनीय हों, तब भी जब प्रशिक्षण डेटा मिलना कठिन हो।

यह संग्रह चार अलग-अलग भागों से बना है, जिनमें से प्रत्येक एक अलग दृश्य डोमेन को कवर करता है ताकि यह दिखाया जा सके कि यह विधि विभिन्न प्रकार की छवियों में कैसे काम करती है। इनमें से दो भाग ट्रैफिक साइन पर ध्यान केंद्रित करते हैं, जबकि अन्य दो प्राकृतिक छवियों में पाए जाने वाले गमलों में लगे पौधों और शहरों में चलते हुए लोगों से संबंधित हैं। पहला भाग, जिसे 'TrafficSigns-Raw' कहा जाता है, 4,185 स्ट्रीट-व्यू छवियों का एक सीधा रिलीज़ है जिन्हें मनुष्यों द्वारा मैन्युअल रूप से जांचा गया है। इन छवियों में, शोधकर्ताओं ने 8,249 ट्रैफिक साइन के चारों ओर बॉक्स बनाए हैं, जिसमें मानक संकेतों और क्षतिग्रस्त संकेतों दोनों को चिह्नित किया गया है। चूंकि ये पूर्ण स्ट्रीट सीन हैं, इसलिए वे स्रोत सामग्री के रूप में कार्य करते हैं। इस स्रोत से, टीम ने दूसरा भाग, 'TrafficSigns-OC' बनाया, जो वस्तु-केंद्रित संस्करण है। यहाँ, उन्होंने संकेतों को काटकर निकाला है और उन्हें 256 x 256 पिक्सेल के एक समान वर्गाकार आकार में पुनर्गठित किया है। इसके परिणामस्वरूप संकेतों की 3,009 मानकीकृत छवियां और 4,607 एनोटेशन प्राप्त होते हैं। यह एक शोधकर्ता को सड़क, आकाश या आसपास की कारों के शोर के बिना स्वयं संकेतों का अध्ययन करने की अनुमति देता है।

अन्य दो भाग गोपनीयता और कॉपीराइट की चुनौती को संभालते हैं। 'Cityscapes-Pedestrian' डेटासेट के लिए, शोधकर्ता सख्त गोपनीयता और लाइसेंसिंग नियमों के कारण शहरों में चलते लोगों की मूल छवियां सीधे जारी नहीं कर सकते थे। इसके बजाय, उन्होंने एक 'रिकंस्ट्रक्शन किट' (पुनर्निर्माण किट) प्रदान की है। इस किट में निर्देश और विशिष्ट निर्देशांक (कोऑर्डिनेट्स) शामिल हैं जिनकी आवश्यकता मूल, सार्वजनिक रूप से उपलब्ध सिटीस्केप्स छवियों से पैदल यात्रियों को काटने के लिए होती है। परिणाम स्वरूप, पैदल यात्रियों के 2,156 मानकीकृत छवियों का एक संग्रह मिलता है, जो 1,264 मूल चित्रों से प्राप्त किया गया है, जिसमें पैदल यात्रियों के चारों ओर लगभग 17,500 व्यक्तिगत बॉक्स शामिल हैं। इसी तरह, 'COCO-PottedPlant' डेटासेट के लिए, टीम ने प्रसिद्ध माइक्रोसॉफ्ट कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट संग्रह के साथ काम किया। उन्होंने उस बड़े डेटाबेस से गमलों में लगे पौधों की छवियों को निकालने की एक प्रक्रिया बनाई। उन्होंने गमलों में लगे पौधों के 7,679 रिकॉर्ड तैयार किए, जिसमें प्रत्येक पाए गए पौधे के लिए एक एकल 256 x 256 का क्रॉप बनाया गया। पैदल यात्री डेटा की तरह, यह संसाधन स्क्रिप्ट और मानचित्र प्रदान करता है जिसकी आवश्यकता छवियों को पुनर्गठित करने के लिए होती है, जिससे यह सुनिश्चित होता है कि मूल छवि मालिकों के नियमों का पालन किया जाए और साथ ही शोधकर्ताओं को आवश्यक विशिष्ट वस्तु डेटा तक पहुंच भी मिले।

जो इस कार्य को विशेष रूप रूप से उपयोगी बनाता है, वह है इस प्रक्रिया में लाई गई निरंतरता। कई शोध परियोजनाओं में, हर बार जब कोई वैज्ञानिक किसी नए ऑब्जेक्ट का अध्ययन करना चाहता है, तो उसे फोटो से उसे काटने, उसका आकार बदलने और उसे लेबल करने के लिए नया कोड लिखना पड़ता है। यह नया संसाधन उस घर्षण (फ्रिक्शन) को दूर करता है। संग्रह की प्रत्येक छवि को एक ही प्रारूप में प्रस्तुत किया गया है, जिसमें स्पष्ट लेबल और मेटाडेटा है जो बताता है कि छवि कैसे बनाई गई थी। शोधकर्ता यह सुनिश्चित करने में भी सावधान रहे हैं कि डेटा को प्रशिक्षण, परीक्षण और सत्यापन के समूहों में सही ढंग से विभाजित किया गया है, ताकि मशीन लर्निंग मॉडल गलती से एक ही छवि को विभिन्न रूपों में दो बार देखकर परिणाम प्राप्त न कर ले। उदाहरण के लिए, ट्रैफिक साइन डेटा में, उन्होंने उन्नत कंप्यूटर विज़न टूल का उपयोग यह जांचने के लिए किया कि परीक्षण समूह में कोई भी छवि प्रशिक्षण समूह वाली छवि के बहुत समान तो नहीं है, जिससे यह सुनिश्चित हो सके कि प्रयोग के परिणाम वास्तविक हैं।

शोधकर्ता स्पष्ट हैं कि यह संग्रह क्या कर सकता है और क्या नहीं। यह दुनिया के हर ऑब्जेक्ट का एक पूर्ण विश्वकोश नहीं है। यह केवल तीन प्रकार की चीजों पर केंद्रित है: लोग, ट्रैफिक साइन और गमलों में लगे पौधे। यह साइन की हर संभव क्षति स्थिति को कवर नहीं करता है, न ही इसमें हर प्रकार के पौधे या व्यक्ति शामिल हैं। इसके अलावा, क्योंकि डेटा को वस्तु पर ध्यान केंद्रित करने के लिए क्रॉप किया गया है, इसलिए दृश्य का संदर्भ (कॉन्टेक्स्ट) खो जाता है। इस डेटासेट में एक ट्रैफिक साइन केवल एक साइन है; यह उस सड़क को नहीं दिखाता जिस पर वह है या मौसम की स्थिति को नहीं दिखाता। यह वस्तु को अध्ययन के लिए अलग करने का एक जानबूझकर किया गया विकल्प है, जिसका अर्थ है कि इस डेटा का उपयोग वस्तुओं के वातावरण के साथ उनके व्यवहार का अध्ययन करने के लिए नहीं किया जा सकता है। इसके अतिरिक्त, प्रदान किए गए एनोटेशन वस्तुओं की रूपरेखा बताने वाले बॉक्स हैं, न कि वस्तु के आकार का विस्तृत पिक्सेल-दर-पिक्सेल मानचित्र।

इन सीमाओं के बावजूद, यह संग्रह डेटा-कुशल आर्टिफिशियल इंटेलिजेंस पर काम करने वाले शोधकर्ताओं के लिए एक महत्वपूर्ण कदम है। वस्तु-केंद्रित डेटा का एक मानकीकृत, बहु-डोमेन सेट प्रदान करके, टीम ने नए विचारों के परीक्षण के लिए एक सामान्य आधार तैयार किया है। चाहे कोई वैज्ञानिक यह सिखाने की कोशिश कर रहा हो कि कंप्यूटर को एक एकल उदाहरण से क्षतिग्रस्त साइन को कैसे पहचानना है, या यह परीक्षण कर रहा हो कि एक AI छोटे डेटा सेट से कितनी अच्छी तरह सीख सकता है, यह संसाधन आवश्यक उपकरण प्रदान करता है। यह डेटा मुफ्त में उपलब्ध है, साथ ही वह कोड भी उपलब्ध है जिसकी आवश्यकता छवियों को स्रोत सामग्री से पुनर्गठिकित करने के लिए होती है जहाँ प्रत्यक्ष रिलीज संभव नहीं था। यह पारदर्शिता सुनिश्चित करती है कि कोई भी काम को सत्यापित कर सके और उस पर आगे बढ़ सके, जिससे आर्टिफिशियल इंटेलिजेंस अनुसंधान के लिए अधिक विश्वसनीय और पुनरुत्पादनीय भविष्य को बढ़ावा मिलता है। यह कार्य एक व्यावहारिक संसाधन के रूप में खड़ा है, जो उन लोगों के लिए एक स्पष्ट मार्ग प्रदान करता है जो यह अन्वेषण करना चाहते हैं कि मशीनें एक समय में एक वस्तु के माध्यम से दुनिया को देखना कैसे सीख सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →