Label Curation Using Agentic AI
यह शोध पत्र AURA को प्रस्तुत करता है, जो एक एजेंटिक AI फ्रेमवर्क है जो मल्टी-मोडल लेबल उत्पन्न करने और मान्य करने के लिए कई एजेंटों को समन्वित करता है जिसमें ग्राउंड ट्रुथ (ground truth) की आवश्यकता नहीं होती है, और यह वास्तविक लेबल और एनोटेटर विश्वसनीयता का अनुमान लगाने के लिए एक्स्पेक्टेशन-मैक्सिमाइजेशन (Expectation-Maximization) के साथ एक संभाव्य मॉडल (probabilistic model) को अनुकूलित करता है, जिससे मानक और चुनौतीपूर्ण एनोटेशन परिदृश्यों दोनों में बेसलाइन की तुलना में महत्वपूर्ण सटीकता सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किताबों के एक विशाल पुस्तकालय को व्यवस्थित करने की कोशिश कर रहे हैं, लेकिन आपके पास कोई लाइब्रेरियन नहीं है। इसके बजाय, आपने 50 अलग-अलग लोगों को किताबें पढ़ने और यह बताने के लिए काम पर रखा है कि वे किस शैली (genre) की हैं। उनमें से कुछ विशेषज्ञ हैं, कुछ थके हुए हैं, कुछ केवल अनुमान लगा रहे हैं, और कुछ तो बिल्कुल गलत भी हैं। यदि आप केवल "बहुमत के वोट" (यह पूछकर कि "ज्यादातर लोग क्या कहते हैं?") का उपयोग करते हैं, तो आप गलत शैली चुन सकते हैं यदि आपके सहायक वास्तव में अपना काम करने में खराब हैं।
यही वह समस्या है जिसे पेपर AURA हल करता है।
समस्या: "शोर भरा समूह" (The Noisy Crowd)
आर्टिफिशियल इंटेलिजेंस की दुनिया में, कंप्यूटर को सीखने के लिए लेबल किए गए डेटा की आवश्यकता होती है (जैसे एक छात्र को उत्तर कुंजी की आवश्यकता होती है)। आमतौर पर, इंसान ही यह लेबलिंग करते हैं, लेकिन यह महंगा है, धीमा है, और इंसान गलतियाँ करते हैं। हाल ही में, हमने डेटा को लेबल करने के लिए अपने लिए AI मॉडल का उपयोग करना शुरू कर दिया है। लेकिन यहाँ एक पेंच है: AI मॉडल भी अपूर्ण हैं। कुछ स्मार्ट हैं, कुछ भ्रमित हैं, और कुछ पक्षपाती हैं।
यदि आप केवल जवाब पर वोट देने के लिए कई AI मॉडलों को अनुमति देते हैं, तो "गलत" वाले मॉडल पूरे समूह को नीचे खींच सकते हैं।
समाधान: AURA (स्मार्ट मैनेजर)
लेखकों ने AURA नामक एक सिस्टम बनाया है (Agentic AI for Unified Reliability Modeling and Annotation Aggregation)। इसे एक सुपर-स्मार्ट मैनेजर के रूप में सोचें जो केवल वोटों की गिनती नहीं करता; बल्कि यह पता लगाता है कि कौन सच बोल रहा है।
AURA कैसे काम करता है, इसका एक सरल उदाहरण यहाँ दिया गया है:
- जासूसों की टीम: AURA अलग-अलग AI "जासूसों" (एजेंट्स) की एक टीम इकट्ठा करता है। एक बिल्लियों को पहचानने में माहिर हो सकता है, दूसरा कुत्तों को पहचानने में, और तीसरा दोनों में ही बहुत खराब हो सकता है।
- उत्तर कुंजी की आवश्यकता नहीं: आमतौर पर, यह जानने के लिए कि कौन सा जासूस अच्छा है, आपको पहले से सही उत्तर (ग्राउंड ट्रुथ) जानने की आवश्यकता होती है। AURA विशेष है क्योंकि इसे उत्तर कुंजी की आवश्यकता नहीं है। यह असहमति के पैटर्न को देखकर सच्चाई का पता लगाता है।
- "ट्रस्ट स्कोर" का खेल:
- कल्पना कीजिए कि जासूस एक फोटो के बारे में बहस कर रहे हैं। जासूस A कहता है "बिल्ली," जासूस B कहता है "कुत्ता," और जासूस C कहता है "बिल्ली।"
- यदि जासूस A और B को अतीत में झूठा साबित किया गया है, तो AURA उन्हें अनदेखा कर देता है।
- यदि जासूस C भरोसेमंद रहा है, तो AURA C की बात सुनता है।
- AURA इसे गणितीय रूप से करता है। यह एक लूप चलाता है जहाँ यह उत्तर का अनुमान लगाता है, फिर देखता है कि किसने उस उत्तर के लिए वोट दिया, फिर प्रत्येक जासूस के लिए अपना "ट्रस्ट स्कोर" अपडेट करता है, और तब तक दोहराता है जब तक कि सभी सबसे संभावित सत्य पर सहमत नहीं हो जाते।
इनका गुप्त मंत्र: "एक्सपेक्टेशन-मैक्सिमाइजेशन" (Expectation-Maximization) लूप
पेपर एक फैंसी गणितीय ट्रिक का उपयोग करता है जिसे एक्सपेक्टेशन-मैक्सिमाइजेशन (EM) कहा जाता है। इसे "हॉट एंड कोल्ड" (Hot and Cold) के खेल की तरह समझें:
- चरण 1 (अनुमान): AURA किसी छवि के लिए वास्तविक लेबल के बारे में एक अनुमान लगाता है।
- चरण 2 (जांच): यह जासूसों को देखता है। "ओह, जो जासूस आमतौर पर चीजें सही करते हैं, उन्होंने इस अनुमान के लिए वोट दिया है। वे जो आमतौर पर गलत होते हैं, उन्होंने दूसरे के लिए वोट दिया है।"
- चरण 3 (अपडेट): AURA अपनी इस सूची को अपडेट करता है कि कौन भरोसेमंद है।
- दोहराव: यह बार-बार ऐसा करता है। हर दौर के साथ, "ट्रस्ट स्कोर" अधिक सटीक होते जाते हैं, और अंतिम लेबल भी अधिक सटीक होते जाते हैं।
उन्होंने क्या पाया?
शोधकर्ताओं ने चार अलग-अलग प्रकार के डेटा (लोगों के खेल करने के वीडियो, भोजन की तस्वीरें, पक्षियों की तस्वीरें और सामान्य चित्र) पर AURA का परीक्षण किया।
- भीड़ को पछाड़ना: हर परीक्षण में, AURA साधारण बहुमत वोट लेने की तुलना में बेहतर था। कुछ मामलों में, यह बेसलाइन तरीकों से 50% अधिक सटीक था, खासकर जब टीम में कुछ बहुत खराब AI मॉडल शामिल थे।
- फर्जी लोगों को पकड़ना: AURA इस बात को पहचानने में उत्कृष्ट था कि कौन से AI मॉडल विश्वसनीय हैं और कौन से बेकार हैं। उदाहरण के लिए, इसने सही ढंग से पहचाना कि एक विशिष्ट AI मॉडल केवल 6% समय ही सही होता है और उसने उस पर भरोसा करना बंद कर दिया।
- प्रशिक्षण की आवश्यकता नहीं: आपको AURA को यह सिखाने की आवश्यकता नहीं है। यह "ऑफ-द-शेल्फ" AI मॉडल के साथ सीधे काम करता है। आपको उन्हें फिर से प्रशिक्षित करने या विशेष निर्देश देने की आवश्यकता नहीं है।
- असंतुलन को संभालना: भले ही डेटासेट में कुत्तों की 100 तस्वीरें हों और केवल 1 पक्षी की तस्वीर हो, AURA भ्रमित नहीं होता है। यह दुर्लभ पक्षी के साथ भी उतनी ही सावधानी से व्यवहार करता है जितना कि सामान्य कुत्तों के साथ।
निचोड़ (The Bottom Line)
AURA एक ऐसा सिस्टम है जो अपूर्ण AI वर्कर्स के एक अराजक समूह को एक अत्यधिक सटीक लेबलिंग टीम में बदल देता है। यह लगातार यह पूछकर करता है, "कौन सच बोल रहा है?" और "असली उत्तर क्या है?" बिना कभी भी पहले से सही उत्तर देखे। यह एक ऐसे मैनेजर की तरह है जो तुरंत बता सकता है कि कौन से कर्मचारी अच्छा काम कर रहे हैं और कौन ढिलाई बरत रहे हैं, जिससे यह सुनिश्चित होता है कि अंतिम रिपोर्ट हमेशा उच्च गुणवत्ता वाली हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।