← नवीनतम पेपर
🤖 machine learning

Data Requirement Goal Modeling for Machine Learning Systems

यह शोध पत्र एक डेटा रिक्वायरमेंट गोल मॉडलिंग (DRGM) दृष्टिकोण प्रस्तावित करता है जो लक्ष्य मॉडलिंग और एक अनुकूलन तंत्र का उपयोग करता है ताकि गैर-विशेषज्ञों को मशीन लर्निंग प्रणालियों के लिए डेटा आवश्यकताओं की पहचान करने, उन्हें अनुकूलित करने और उनका मूल्यांकन करने में मार्गदर्शन किया जा सके, जिसे व्यावहारिक प्रभावशीलता सुनिश्चित करने के लिए वास्तविक दुनिया के उदाहरणों के माध्यम से मान्य किया गया है।

मूल लेखक: Asma Yamani, Nadeen AlAmoudi, Salma Albilali, Malak Baslyman, Jameleddine Hassine

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Asma Yamani, Nadeen AlAmoudi, Salma Albilali, Malak Baslyman, Jameleddine Hassine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को बिल्ली पहचानना सिखाने की कोशिश कर रहे हैं। आपको लग सकता है कि सबसे कठिन काम कोड लिखना है, लेकिन मशीन लर्निंग (ML) की दुनिया में, कोड वास्तव में केवल एक रेसिपी है। असली जादू—और असली खतरा—सामग्री (ingredients) में छिपा है। यदि आप अपने रोबोट को सूप का एक कटोरा खिलाते हैं जिसमें ज्यादातर पानी है और उसमें कुछ बिल्ली की तस्वीरें तैर रही हैं, तो रोबोट बिल्लियाँ देखना नहीं सीखेगा; वह सूप देखना सीख जाएगा। यह समस्या का मूल है: ML सिस्टम को केवल डेटा की आवश्यकता नहीं होती; उन्हें अच्छे डेटा की आवश्यकता होती है। लेकिन डेटा को "अच्छा" क्या बनाता है? क्या लाखों तस्वीरें होना पर्याप्त है, या क्या उन्हें अलग-अलग कोणों से लिया जाना चाहिए? क्या होगा यदि तस्वीरों में केवल काली बिल्लियाँ दिखाई गई हैं, और रोबोट कभी यह नहीं सीख पाता कि सफेद बिल्ली कैसी दिखती है?

यहीं "डेटा रिक्वायरमेंट्स" (Data Requirements) काम आते हैं। इन्हें अपने रोबोट के मस्तिष्क के लिए एक सख्त खरीदारी सूची (shopping list) के रूप में समझें। इससे पहले कि आप खाना बनाना शुरू करें, आपको जानना होगा: क्या हमारे पास पर्याप्त सामग्री है? क्या वे ताज़ा हैं? क्या वे खाने के लिए सुरक्षित हैं? क्या वे निष्पक्ष हैं (क्या बिल्लियों के किसी एक समूह को अनदेखा किया जा रहा है)? लंबे समय से, विशेषज्ञ इन सूचियों को लिखने के लिए संघर्ष कर रहे हैं क्योंकि हर रोबोट प्रोजेक्ट अलग होता है। बीमारी का निदान करने वाला रोबोट मौसम की भविष्यवाणी करने वाले रोबोट से अलग डेटा की आवश्यकता रखता है। यह शोध पत्र, जिसका शीर्षक "DRGM: Data Requirement Goal Modeling for ML-Based Systems" है, एक नए, सुपर-स्मार्ट शॉपिंग लिस्ट जनरेटर की तरह है। यह उन लोगों की मदद करता है जो डेटा के जादूगर नहीं हैं, ताकि वे यह सटीक रूप से जान सकें कि उन्हें अपना AI बनाने से पहले किस तरह की सामग्री की आवश्यकता है, जिससे यह सुनिश्चित हो सके कि वे गलती से नमक जैसा स्वाद वाला केक न बना दें।

लेखक, जो किंग फहद यूनिवर्सिटी ऑफ पेट्रोलियम एंड मिनरल्स की एक टीम है, DRGM (डेटा रिक्वायरमेंट गोल मॉडल) नामक एक विधि प्रस्तावित करते हैं। उन्होंने महसूस किया कि एक ML सिस्टम बनाना एक बड़े, जटिल रोड ट्रिप की योजना बनाने जैसा है। आप सिर्फ यह नहीं कह सकते, "चलो चलते हैं!" आपको एक नक्शा, एक ईंधन योजना और रुकने की सूची चाहिए। अतीत में, लोग अक्सर योजना बनाने के चरण को छोड़ देते थे और जो भी डेटा उन्हें मिल जाता था उसे उठा लेते थे, जिससे ऐसे रोबोट बनते थे जो पक्षपाती, गलत या पूरी तरह से भ्रमित होते थे।

इसे ठीक करने के लिए, टीम ने एक "गोल मॉडल" (Goal Model) बनाया। इसे एक विशाल, इंटरैक्टिव फ्लोचार्ट या निर्णय वृक्ष (decision tree) के रूप में समझें। सबसे ऊपर, आपके पास आपका मुख्य लक्ष्य है: "एक सफल AI बनाना।" उससे जुड़ी हुई "सॉफ्ट गोल्स" (soft goals) हैं, जो वे गुण हैं जो आपके डेटा में होने चाहिए, जैसे मात्रा (क्या हमारे पास पर्याप्त है?), गुणवत्ता (क्या यह साफ और सटीक है?), प्रबंधन (क्या हम इसे सुरक्षित और अपडेट रख सकते हैं?) और नैतिकता (क्या यह निष्पक्ष और कानूनी है?)।

टीम ने इस फ्लोचार्ट को किसी भी विशिष्ट यात्रा के लिए काम करने योग्य बनाने के लिए एक चतुर "कस्टमाइजेशन मैकेनिज्म" पेश किया है। लेखक सुझाव देते हैं कि हर यात्रा के लिए एक ही तरह के सामान की आवश्यकता नहीं होती है। यदि आप समुद्र तट पर जा रहे हैं, तो आपको सनस्क्रीन चाहिए; यदि आप पहाड़ पर जा रहे हैं, तो आपको गर्म कपड़ों की आवश्यकता है। इसी तरह, DRGM उस प्रकार के आधार पर बदल जाता है जिसे आप हल कर रहे हैं।

  • यदि आप एक "क्लासिफिकेशन" (Classification) समस्या कर रहे हैं (चीजों को श्रेणियों में छाँटना, जैसे "क्या यह ईमेल स्पैम है या नहीं?"), तो मॉडल बताता है कि डेटा बैलेंसनेस (Data Balancedness) बहुत महत्वपूर्ण है। आपको "स्पैम" और "स्पैम नहीं" के लगभग बराबर संख्या में ईमेलों की आवश्यकता है, अन्यथा आपका रोबोट हर बार "स्पैम नहीं" का अनुमान लगाएगा और इसे अपनी जीत मान लेगा।
  • यदि आप एक "रिग्रेशन" (Regression) समस्या कर रहे हैं (एक संख्या की भविष्यवाणी करना, जैसे "कल कितनी बारिश होगी?"), तो संतुलन कम महत्वपूर्ण हो जाता है, लेकिन यदि मौसम तेजी से बदलता है, तो डेटा फ्रेशनेस (Data Freshness) अधिक महत्वपूर्ण हो सकती है।

शोधकर्ताओं ने अपने विचार का परीक्षण दो वास्तविक दुनिया की कहानियों के साथ किया कि क्या यह वास्तव में काम करता है।

कहानी 1: एनीमिया डिटेक्टर
पहले उदाहरण में, शोधकर्ताओं ने एक ऐसा AI बनाने की कोशिश की जो केवल उंगली के पोर (fingertip) के वीडियो को देखकर बता सके कि कोई व्यक्ति एनीमिया (स्वस्थ रक्त कोशिकाओं की कमी) से पीड़ित है या नहीं। टीम ने अपने डेटा की योजना बनाने के लिए DRGM का उपयोग किया। उन्हें एहसास हुआ कि उन्हें लोगों के एक बड़े मिश्रण की आवश्यकता है: विभिन्न स्किन टोन, आयु और लिंग। हालाँकि, जब उन्होंने वास्तव में डेटा एकत्र किया, तो उन्हें मुश्किलों का सामना करना पड़ा। उनके पास स्वस्थ लोगों की संख्या बहुत अधिक थी और गंभीर एनीमिया वाले लोगों की संख्या बहुत कम थी। उन्हें कमरे की रोशनी के साथ भी समस्याएं हुईं, जिससे डेटा "असंगत" (inconsistent) हो गया। जब उन्होंने अपने डेटा को DRGM चेकलिस्ट के माध्यम से चलाया, तो मॉडल ने उन्हें कम स्कोर दिया। इसने मूल रूप से कहा, "रुकिए! आपकी सामग्री खराब और असंतुलित है।" शोध पत्र में उल्लेख है कि इस प्रोजेक्ट को अंततः रोकना पड़ा क्योंकि डेटा ने आवश्यकताओं को पूरा नहीं किया, जिससे यह सिद्ध हुआ कि यदि उन्होंने इसे पहले उपयोग किया होता तो यह चेकलिस्ट उनका समय और प्रयास बचा लेती।

कहानी 2: सौर ऊर्जा भविष्यवक्ता
दूसरा उदाहरण इस बारे में था कि एक सौर फार्म को हर घंटे कितनी धूप मिलेगी। यह एक "टाइम सीरीज़" (Time Series) समस्या है (समय के साथ संख्याओं की भविष्यवाणी करना)। यहाँ, DRGM ने टीम को बताया कि डेटा फ्रेशनेस और डेटा मैनेजमेंट महत्वपूर्ण हैं क्योंकि मौसम के साथ सूरज का पैटर्न बदलता है। उन्होंने यह भी सीखा कि चूंकि यह डेटा लोगों के बारे में नहीं था, इसलिए उन्हें गोपनीयता कानूनों की उतनी चिंता करने की आवश्यकता नहीं थी। हालाँकि, उन्होंने पाया कि उनके डेटा में अंतराल (गायब महीने) थे और यह विशिष्ट शहर के जलवायु का प्रतिनिधि नहीं था। मॉडल ने उन्हें यह देखने में मदद की कि भले ही उनके पास दो साल का डेटा था, लेकिन वह उस विशिष्ट स्थान के लिए "अच्छा" डेटा नहीं था क्योंकि इसमें प्रमुख मौसम पैटर्न गायब थे।

शोध पत्र निष्कर्ष निकालता है कि DRGM दृष्टिकोण एक उपयोगी उपकरण है, विशेष रूप से उन लोगों के लिए जो मशीन लर्निंग के विशेषज्ञ नहीं हैं। यह एक मार्गदर्शक की तरह कार्य करता है, जो उन्हें शुरू करने से पहले सही प्रश्न पूछने में मदद करता है। लेखक सावधानी बरतते हुए कहते हैं कि हालांकि उनकी विधि मानक समस्याओं जैसे वर्गीकरण और संख्या की भविष्यवाणी के लिए अच्छी तरह से काम करती है, लेकिन बहुत उन्नत AI (जैसे कहानी लिखने वाले विशाल भाषा मॉडल) के लिए इसमें और काम करने की आवश्यकता हो सकती है। वे यह भी स्वीकार करते हैं कि वर्तमान में, आपको उनके आरेखों का उपयोग करके मैन्युअल रूप से चेकलिस्ट भरनी होती है, जो थोड़ा कठिन हो सकता है। वे भविष्य में आपके लिए यह काम करने के लिए एक चैटबॉट बनाने की आशा करते हैं।

संक्षेप में, यह शोध पत्र सुझाव देता है कि अपने AI को भोजन खिलाने से पहले, आपको मेनू की जांच करनी चाहिए। एक संरचित, अनुकूलन योग्य डेटा आवश्यकताओं के मानचित्र का उपयोग करके, हम ऐसे रोबोट बनाना बंद कर सकते हैं जो पक्षपाती, टूटे हुए या अंधे हैं, और ऐसे रोबोट बनाना शुरू कर सकते हैं जो वास्तविक दुनिया के लिए तैयार हैं। यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है, बल्कि यह एक बहुत ही मजबूत टॉर्च है उस यात्रा के लिए जो अक्सर अकेले नेविगेट करने के लिए बहुत अंधेरी होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →