← नवीनतम पेपर
🤖 AI

Is your AI Model Accurate Enough? The Difficult Choices Behind Rigorous AI Development and the EU AI Act

यह शोध पत्र एआई (AI) सटीकता को एक विशुद्ध रूप से वस्तुनिष्ठ मीट्रिक मानने की धारणा को चुनौती देता है, जिसमें इसे परिभाषित करने और मापने के लिए आवश्यक संदर्भ-निर्भर मानकीय विकल्पों का विश्लेषण करने हेतु यूरोपीय संघ एआई अधिनियम (EU AI Act) का उपयोग किया गया है, ताकि यह प्रदर्शित किया जा सके कि कैसे ये तकनीकी-मानकीय निर्णय जोखिम वितरण को आकार देते हैं और नियामकों एवं डेवलपर्स के लिए व्यावहारिक मार्गदर्शन प्रदान करते हैं।

मूल लेखक: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lucas G. Uberti-Bona Marin, Bram Rijsbosch, Kristof Meding, Gerasimos Spanakis, Gijs van Dijck, Konrad Kollnig

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-स्टेक कुकिंग प्रतियोगिता में जज हैं। नियम पुस्तिका (EU AI Act) कहती है: "व्यंजन इतना सटीक (accurate) होना चाहिए कि उसे जनता को परोसा जा सके।"

अब, कल्पना कीजिए कि एक डेवलपर आपके पास सूप लेकर आता है और कहता है, "देखिए! मेरा सूप 99.8% सटीक है!"

आप सोच सकते हैं, "वाह, यह तो एकदम परफेक्ट है!" लेकिन फिर आपको एहसास होता है: वह सूप 99.8% पानी और 0.2% नमक से बना है। तकनीकी रूप से वह पानी होने के मामले में "सटीक" है, लेकिन वह एक बहुत ही बुरा सूप है। यदि आप इसे किसी ऐसे व्यक्ति को परोसते हैं जिसमें नमक की कमी है, तो वह बीमार पड़ सकता है।

यह पेपर तर्क देता है कि यह पूछना कि "क्या AI पर्याप्त सटीक है?" एक धोखे वाला सवाल है। सटीकता केवल स्कोरबोर्ड पर एक नंबर नहीं है; यह उन छिपे हुए विकल्पों की एक श्रृंखला है कि हम किस तरह की गलतियों को स्वीकार करने के लिए तैयार हैं।

यहाँ सरल उपमाओं का उपयोग करके पेपर के चार "गुप्त विकल्पों" का विवरण दिया गया है:

1. स्कोरकार्ड चुनना (Metrics का चयन करना)

कल्पना कीजिए कि आप एक नए मेलानोमा (त्वचा के कैंसर) डिटेक्टर का परीक्षण कर रहे हैं।

  • जाल: यदि आप एक साधारण "सटीकता" (Accuracy) स्कोर का उपयोग करते हैं, तो AI सभी के लिए बस "कैंसर नहीं है" कह सकता है। चूंकि अधिकांश तिल हानिरहित होते हैं, इसलिए यह 99% बार सही होगा। लेकिन यह कैंसर के हर मामले को मिस कर देगा। यह एक आपदा है।
  • विकल्प: डेवलपर को निर्णय लेना होगा: क्या अधिक महत्वपूर्ण है?
    • विकल्प A: कैंसर के हर एक मामले को पकड़ें (भले ही इसके लिए एक हानिरहित तिल पर भी "कैंसर!" चिल्लाना पड़े)। इसे रिकॉल (Recall) कहा जाता है।
    • विकल्प B: केवल तभी "कैंसर!" चिल्लाएं जब आप पूरी तरह सुनिश्चित हों (भले ही इसमें कुछ वास्तविक मामलों को छोड़ दिया जाए)। इसे प्रिसिजन (Precision) कहा जाता है।
  • पेपर का बिंदु: कोई एक "सही" स्कोरकार्ड नहीं है। एक को दूसरे के ऊपर चुनना एक नैतिक निर्णय है। क्या हम स्वस्थ लोगों को डराने के लिए तैयार हैं (फॉल्स पॉजिटिव) या बीमार लोगों की जान जोखिम में डालने के लिए (फॉल्स नेगेटिव)? AI एक्ट मांग करता है कि हम यह स्पष्ट करें कि हमने कौन सा स्कोरकार्ड चुना है।

2. सामग्री को मिलाना (Metrics का संतुलन बनाना)

अब, मान लीजिए कि आप उच्च प्रिसिजन (Precision) और उच्च रिकॉल (Recall) दोनों चाहते हैं। आप दोनों का 100% नहीं रख सकते।

  • जाल: डेवलपर्स अक्सर इन दोनों नंबरों को एक एकल "F-स्कोर" में मिला देते हैं (जैसे केक बनाने के लिए आटे और चीनी को मिलाना)। एक बार मिल जाने के बाद, यह पहचानना कठिन हो जाता है कि उसमें कितनी चीनी या कितना आटा है।
  • विकल्प: क्या हम इसे एक नंबर में मिला दें ताकि यह सरल दिखे? या हम उन्हें अलग रखें और कहें, "हमें 90% प्रिसिजन और 80% रिकॉल चाहिए"?
  • पेपर का बिंदु: उन्हें मिलाने से समझौते (trade-offs) छिप जाते हैं। यदि आप उन्हें मिला देते हैं, तो आप अनजाने में यह तय कर सकते हैं कि कैंसर पकड़ने से ज्यादा महत्वपूर्ण लोगों को न डराना है, बिना कभी यह स्वीकार किए कि आपने ऐसा किया है। पेपर सुझाव देता है कि हमें सामग्रियों को अलग रखना चाहिए ताकि हम देख सकें कि हम किसे प्राथमिकता दे रहे हैं।

3. टेस्टिंग पैनल चुनना (Metrics को मापना)

आपके पास आपकी रेसिपी है, लेकिन आप इसका परीक्षण कैसे करेंगे?

  • जाल: कल्पना कीजिए कि आप अपने सूप का परीक्षण केवल उन लोगों पर करते हैं जिन्हें नमकीन खाना पसंद है। उन्हें सूप बहुत स्वादिष्ट लगेगा! लेकिन नमक के प्रति संवेदनशील लोगों का क्या?
  • विकल्प: AI में, यह डेटा (Data) के बारे में है। यदि आप त्वचा के कैंसर के AI का परीक्षण केवल गोरी त्वचा की तस्वीरों पर करते हैं, तो यह गहरे रंग की त्वचा पर बुरी तरह विफल हो जाएगा।
  • पेपर का बिंदु: डेवलपर को निर्णय लेना होगा: हमारे परीक्षण समूह में कौन है? क्या हम सभी का समान रूप से परीक्षण करते हैं? क्या हम यह सुनिश्चित करते हैं कि हमारे पास बुजुर्गों या अलग स्किन टोन वाले लोगों की पर्याप्त तस्वीरें हैं? यदि टेस्ट ग्रुप वास्तविक दुनिया जैसा नहीं है, तो "सटीकता" का स्कोर एक झूठ है।

4. पास/फेल लाइन तय करना (Thresholds निर्धारित करना)

अंत में, आपके पास स्कोर हैं। क्या सूप परोसने के लिए पर्याप्त अच्छा है?

  • जाल: क्या 90% स्कोर अच्छा है? 95% के बारे में क्या?
  • विकल्प: यह स्वीकृति सीमा (Acceptance Threshold) है।
    • यदि AI एक डॉक्टर की जगह ले रहा है, तो इसे इंसान से बेहतर होना चाहिए।
    • यदि यह केवल एक "सेकंड ओपिनियन" सहायक है, तो शायद इसे बस इंसान के बराबर होना चाहिए।
  • पेपर का बिंदु: EU AI एक्ट कहता है कि सिस्टम "पर्याप्त सटीक" होना चाहिए, लेकिन यह कोई विशिष्ट नंबर (जैसे "95%") नहीं देता है। डेवलपर को रेखा खींचनी होगी। हम कितना जोखिम उठाने को तैयार हैं? यदि रेखा बहुत नीचे है, तो लोग घायल होंगे। यदि रेखा बहुत ऊपर है, तो हम जीवन रक्षक तकनीक को कभी तैनात नहीं कर पाएंगे।

मुख्य विचार

पेपर निष्कर्ष निकालता है कि सटीकता एक तकनीकी तथ्य नहीं है; यह एक राजनीतिक और नैतिक विकल्प है।

EU AI एक्ट इसे ठीक करने की कोशिश कर रहा है यह कहकर: "आप सिर्फ यह नहीं कह सकते कि 'यह सटीक है।' आपको यह विस्तार से लिखना होगा कि आपने अपना स्कोरकार्ड कैसे चुना, आपने सामग्रियों को कैसे संतुलित किया, आपने किन लोगों पर परीक्षण किया, और आपने पास/फेल की रेखा कहाँ खींची।"

यह क्यों मायने रखता है?
क्योंकि यदि हम इन विकल्पों को सावधानीपूर्वक नहीं चुनते हैं, तो हम ऐसा AI बना सकते हैं जो कागज पर "सटीक" है लेकिन वास्तविक जीवन में खतरनाक है। यह पेपर डेवलपर्स, वकीलों और नियामकों से आग्रह करता है कि वे नंबरों के पीछे छिपना बंद करें और इस बारे में ईमानदार बातचीत शुरू करें कि हम किस प्रकार की गलतियों को स्वीकार करने के लिए तैयार हैं।

संक्षेप में: केवल यह न पूछें, "क्या AI सटीक है?" बल्कि पूछें, "किस चीज़ के लिए सटीक, किसके लिए, और किस कीमत पर?"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →