← नवीनतम पेपर
🤖 AI

CIRCLE: A Framework for Evaluating AI from a Real-World Lens

यह शोध पत्र CIRCLE का प्रस्ताव करता है, जो एक छह-चरणीय जीवनचक्र ढांचा है जो एआई (AI) के अमूर्त प्रदर्शन मेट्रिक्स और वास्तविक दुनिया के परिनियोजन परिणामों के बीच के अंतर को पाटता है, तथा शासन के लिए हितधारकों की चिंताओं को तुलनीय, संदर्भ-संवेदनशील मात्रात्मक साक्ष्य में अनुवादित करने हेतु एक संरचित प्रोटोकॉल को औपचारिक रूप देता है।

मूल लेखक: Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters
प्रकाशित 2026-03-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Reva Schwartz, Carina Westling, Morgan Briggs, Marzieh Fadaee, Isar Nejadgholi, Matthew Holmes, Fariza Rashid, Maya Carlyle, Afaf Taïk, Kyra Wilson, Peter Douglas, Theodora Skeadas, Gabriella Waters, Rumman Chowdhury, Thiago Lacerda

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अभी-अभी एक बिल्कुल नया, हाई-टेक स्मार्ट टोस्टर खरीदा है।

निर्माता का ब्रोशर ("मॉडल बेंचमार्क्स") आपको बताता है कि यह 400 डिग्री पर ब्रेड को पूरी तरह से टोस्ट करता है, बहुत कम बिजली का उपयोग करता है, और ब्राउनिंग में 99.9% सटीक है। एक नियंत्रित लैब में, यह त्रुटिहीन रूप से काम करता है।

लेकिन आपकी वास्तविक रसोई में, चीजें अलग हैं। आपके पास एक छोटा बच्चा है जो गर्म किनारों को छूता रहता है। आपके पास एक बिल्ली है जो काउंटर से ब्रेड गिरा देती है। कभी-कभी आप ब्रेड डालना भूल जाते हैं, और टोस्टर से धुआं निकलने लगता है। आप इस पर इतना निर्भर भी हो सकते हैं कि आप टोस्ट बनाना भूल जाएं, या मशीन पर बहुत अधिक भरोसा करने के कारण आपका हाथ जल जाए।

समस्या: AI का परीक्षण करने के मौजूदा तरीके उस टोस्टर का परीक्षण करने जैसे हैं जो केवल लैब में किया जाता है। वे हमें बताते हैं कि मशीन काम कर सकती है, लेकिन यह नहीं कि क्या वह वास्तव में सुरक्षित रूप से और मददगार रूप से काम करेगी

समाधान: यह पेपर CIRCLE पेश करता है, जो AI का परीक्षण करने के लिए एक नया फ्रेमवर्क है। CIRCLE को एक लैब टेस्ट के रूप में नहीं, बल्कि एक 6-चरणीय "रियल-वर्ल्ड रोड ट्रिप" के रूप में समझें, यह देखने के लिए कि AI वास्तव में हाईवे पर गाड़ी चलाने के दौरान कैसा व्यवहार करता है, न कि केवल शोरूम में खड़ा रहने के दौरान।

यहाँ CIRCLE की यात्रा दी गई है, जिसे सरलता से समझाया गया है:

1. कॉन्टेक्स्टुअलाइज़ (Contextualize) - ("पैकिंग लिस्ट")

जाने से पहले, आप कार का उपयोग करने वाले लोगों से पूछते हैं: "आपको किस बात की चिंता है? क्या आपके बच्चे हैं? क्या आप बर्फ में गाड़ी चलाते हैं?"

  • पेपर में: केवल कोड का परीक्षण करने के बजाय, टीम शिक्षकों, डॉक्टरों या व्यवसाय मालिकों से बात करती है। वे पूछते हैं, "आपके लिए 'सफलता' का क्या अर्थ है? आपको क्या गलत होने का डर है?"
  • लक्ष्य: एक "कॉन्टेक्स ब्रीफ" (Context Brief) बनाना—वास्तविक दुनिया की चिंताओं की एक सूची (जैसे "छात्रों का AI पर बहुत अधिक निर्भर होना") जिसे परीक्षण को जवाब देना चाहिए।

2. आइडेंटिफाई (Identify) - ("मैप और कंपास")

अब आप उन चिंताओं को एक योजना में बदलते हैं। यदि आप इस बात से चिंतित हैं कि बच्चा गर्म किनारों को छू रहा है, तो आप विशेष रूप से "कूल-टच" फीचर का परीक्षण करने का निर्णय लेते हैं।

  • पेपर में: वे एक अस्पष्ट चिंता (जैसे "अत्यधिक निर्भरता") को एक विशिष्ट, मापने योग्य चीज़ में बदल देते हैं जिसे देखना है। वे एक योजना तैयार करते हैं: "हम देखेंगे कि एक शिक्षक छात्र को काम सौंपने से पहले कितनी बार AI के काम की जाँच करता है।"
  • लक्ष्य: एक "इवैल्यूएशन डिज़ाइन प्लान" (Evaluation Design Plan) बनाना जो आपको बताता है कि वास्तव में क्या देखना है।

3. रिप्रेजेंट (Represent) - ("टेस्ट ड्राइव")

आप कार को पार्किंग लॉट में गोल-गोल नहीं घुमाते। आप इसे किराने की दुकान, स्कूल जाने के रास्ते और हाईवे पर ले जाते हैं। आप अलग-अलग प्रकार के लोगों को इसे चलाने देते हैं।

  • पेपर में: वे वास्तविक दुनिया में वास्तविक लोगों (शिक्षकों, छात्रों, श्रमिकों) के साथ AI चलाते हैं। वे केवल रोबोट का उपयोग करके इसका परीक्षण नहीं करते; वे वास्तविक मनुष्यों का उपयोग करते हैं जो अपने वास्तविक काम कर रहे हैं। वे उन लोगों को भी देखते हैं जो AI का उपयोग नहीं करते हैं, ताकि यह देखा जा सके कि AI पूरे वातावरण को कैसे बदलता है।
  • लक्ष्य: एक "इवैल्यूएशन एक्जीक्यूशन प्लान" (Evaluation Execution Plan) प्राप्त करना जहाँ वास्तविक मनुष्य वास्तविक समय में AI के साथ बातचीत करते हैं।

4. कंपेयर (Compare) - ("ट्रिप रिपोर्ट")

आप डेटा देखते हैं। क्या कार ओवरहीट हुई? क्या बच्चे ने उसे छुआ? क्या ड्राइवर थक गया? आप देखते हैं कि वास्तविक दुनिया में क्या हुआ और इसकी तुलना अपनी योजना से करते हैं।

  • पेपर में: वे परिणामों को देखते हैं। क्या शिक्षकों ने वास्तव में AI के काम की जाँच करना बंद कर दिया? क्या छात्रों ने कम सीखा? वे पूर्ण चित्र प्राप्त करने के लिए "मानवीय कहानियों" को "कंप्यूटर नंबरों" के साथ मिलाते हैं।
  • लक्ष्य: एक "फाइंडिंग्स रिपोर्ट" (Findings Report) बनाना जो AI के आउटपुट और वास्तविक जीवन के परिणामों के बीच के संबंध को जोड़ती है।

5. लर्न (Learn) - ("डिब्रीफ")

आप परिवार के साथ बैठते हैं और कहते, "हे, टोस्टर तो बढ़िया है, लेकिन हमें बच्चों को इसे छूने से रोकने के लिए सिखाने की ज़रूरत है, और शायद हमें एक टाइमर की आवश्यकता है।"

  • पेपर में: वे तकनीकी डेटा को उन लोगों के लिए सरल सलाह में अनुवादित करते जिनके लिए यह महत्वपूर्ण है। वे स्कूल प्रिंसिपल को बताते, "AI काम कर रहा है, लेकिन यह शिक्षकों को आलसी बना रहा है। इसे ठीक करने का तरीका यहाँ है।"
  • लक्ष्य: एक "स्टेकहोल्डर इनसाइट्स ब्रीफ" (Stakeholder Insights Brief) बनाना जो समझने में आसान और कार्रवाई योग्य हो।

6. एक्सटेंड (Extend) - ("मेंटेनेंस चेक")

आप कार को केवल एक बार नहीं चलाते और भूल नहीं जाते। आप हर महीने इसकी जाँच करते रहते हैं। क्या इंजन अभी भी अच्छी तरह से चल रहा है? क्या बच्चों ने इसे छूना फिर से सीख लिया?

  • पेपर में: वे लॉन्च के बाद AI की निगरानी करने के लिए एक सिस्टम स्थापित करते हैं। वे "ड्रिफ्ट" (Drift) देखते हैं—जब AI समय के साथ अलग तरह से व्यवहार करने लगता है या जब उसके आसपास की दुनिया बदल जाती है।
  • लक्ष्य: एक "कंटीन्यूअस मॉनिटरिंग प्लान" (Continuous Monitoring Plan) बनाना ताकि समस्याओं को वर्षों बाद नहीं, बल्कि जल्दी पकड़ा जा सके।

यह क्यों महत्वपूर्ण है

आज के अधिकांश AI परीक्षण एक मछली को पेड़ पर चढ़ने की क्षमता के आधार पर आंकने जैसा है। वे शून्य में AI कितना "स्मार्ट" है, इसे मापते हैं।

CIRCLE सवाल बदल देता है। यह पूछता है: "क्या यह AI वास्तव में लोगों की जटिल और उलझी हुई ज़िंदगी में मदद करता है, या यह नई समस्याएँ पैदा करता है?"

यह इंजीनियरों (जो मशीन बनाते हैं) और मानवों (जो मशीन के साथ रहते हैं) के बीच के अंतर को पाटता है। इस 6-चरणीय लूप का पालन करके, हम यह अनुमान लगाना बंद कर सकते हैं कि AI सुरक्षित है और यह जानना शुरू कर सकते हैं कि यह वास्तविक दुनिया में कैसा व्यवहार करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →