Are LLMs Ready to Replace Bangla Annotators?
यह शोध पत्र बांग्ला घृणास्पद भाषण (hate speech) के लिए ज़ीरो-शॉट एनोटेटर्स के रूप में 17 लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है, जिससे पता चलता है कि वे महत्वपूर्ण पूर्वाग्रह और अस्थिरता प्रदर्शित करते हैं, जहाँ छोटे, कार्य-अनुकूलित मॉडल अक्सर बड़े मॉडलों से बेहतर प्रदर्शन करते हैं, जिससे कम संसाधन वाली भाषाओं के लिए संवेदनशील एनोटेशन कार्यों हेतु वर्तमान एलएलएम (LLMs) की सीमाओं पर प्रकाश पड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल पुस्तकालय चला रहे हैं, लेकिन किताबों के बजाय, आपके पास बांग्ला में लिखे गए लाखों सोशल मीडिया पोस्ट हैं। आपका लक्ष्य उन्हें दो ढेरों में छाँटना है: "हानिकारक घृणास्पद भाषण" (Harmful Hate Speech) और "सुरक्षित सामग्री" (Safe Content)।
अतीत में, आपको हर पोस्ट को पढ़ने और उस पर निर्णय लेने के लिए मानव विशेषज्ञों की एक टीम रखनी पड़ती थी। लेकिन इंसान थक जाते हैं, उन्हें भूख लगती है, और कभी-कभी वे आपस में असहमत भी होते हैं। इसलिए, आपने कुछ नया आज़माने का फैसला किया है: इस काम को आपके लिए करने के लिए AI रोबोट्स (लार्ज लैंग्वेज मॉडल्स)। आप उम्मीद करते हैं कि ये रोबोट्स 24/7 काम कर सकेंगे, कभी थकेंगे नहीं, और पूरी तरह से निष्पक्ष होंगे।
यह शोध पत्र वास्तव में 17 अलग-अलग AI रोबोट्स का एक रिपोर्ट कार्ड है, यह देखने के लिए कि क्या वे वास्तव में इस महत्वपूर्ण काम को संभालने के लिए तैयार हैं।
शोधकर्ताओं ने जो पाया है, उसे यहाँ कुछ सरल उपमाओं के माध्यम से समझाया गया है:
1. "अति-आत्मविश्वासी छात्र" की समस्या
शोधकर्ताओं ने इन AI रोबोट्स से बिना किसी विशेष प्रशिक्षण (जिसे "ज़ीरो-शॉट" कहा जाता है) के पोस्ट पढ़ने और उन्हें लेबल करने के लिए कहा। उन्होंने उम्मीद की थी कि सबसे बड़े, सबसे शक्तिशाली रोबोट ( "सुपर-जीनियस" मॉडल) सबसे अच्छा काम करेंगे।
आश्चर्य: सबसे बड़े रोबोट अनिवार्य रूप से सर्वश्रेष्ठ नहीं थे।
इसे एक कक्षा की तरह समझें। आप मान सकते हैं कि जिस छात्र के पास सबसे बड़ी, मोटी विश्वकोश (सबसे बड़ा AI मॉडल) है, उसे सबसे अच्छे ग्रेड मिलेंगे। लेकिन इस मामले में, "सुपर-जीनियस" मॉडल अक्सर भ्रमित और असंगत थे। वे एक पोस्ट को आज "घृणास्पद भाषण" के रूप में लेबल करेंगे और कल उसे "सुरक्षित" कह देंगे, भले ही पोस्ट में कोई बदलाव न हुआ हो।
इस बीच, कुछ छोटे, अधिक विशिष्ट रोबोटों ( "फोकस्ड इंटर्न्स") ने वास्तव में बेहतर काम किया। वे अधिक सुसंगत और विश्वसनीय थे, भले ही उनके पास कुल मिलाकर कम "ज्ञान" था।
2. "व्यक्तिपरक न्यायाधीश" का मुद्दा
घृणास्पद भाषण को छाँटना पेचीदा है। यहाँ तक कि इंसान भी इस बात पर बहस करते हैं कि कोई विशिष्ट वाक्य अपमानजनक है या सिर्फ एक मज़ाक। यह एक पेंटिंग को "कला" या "कचरा" तय करने की कोशिश करने जैसा है।
अध्ययन में पाया गया कि AI रोबदों के अपने छिपे हुए पूर्वाग्रह थे। इंसानों की तरह, उनके भी अपने "विचार" थे जो इस आधार पर थे कि उन्हें कैसे प्रशिक्षित किया गया था। कभी-कभी, वे बहुत सख्त थे; अन्य समय में, वे बहुत उदार थे। चूंकि वे मशीनें हैं, इसलिए उनके पास उन्हें यह बताने के लिए विवेक नहीं है कि वे कब अनुचित व्यवहार कर रहे हैं, जो घृणास्पद भाषण जैसे संवेदनशील विषयों के साथ काम करते समय खतरनाक है।
3. "आकार मायने नहीं रखता" का सबक
सबसे बड़ी सीख यह है कि बड़ा होना हमेशा बेहतर नहीं होता।
- पुराना तरीका: "आइए सबसे बड़ा, सबसे महंगा AI मॉडल खरीदें; वह सबसे स्मार्ट होना चाहिए।"
- नई वास्तविकता: "आइए उस AI मॉडल को चुनें जिसे विशेष रूप से इस विशिष्ट भाषा और कार्य की बारीकियों को समझने के लिए प्रशिक्षित किया गया है।"
बांग्ला घृणास्पद भाषण को छाँटने के लिए एक विशाल, सामान्य-उद्देश्य वाले AI का उपयोग करना, हार्ट सर्जरी करने के लिए स्विस आर्मी नाइफ (Swiss Army Knife) का उपयोग करने जैसा है। इसमें कई उपकरण हैं, लेकिन यह इस नाजुक काम के लिए सही उपकरण नहीं है। एक छोटा, विशिष्ट उपकरण (एक केंद्रित मॉडल) अक्सर अधिक सुरक्षित और सटीक होता है।
निचोड़
शोध पत्र निष्कर्ष निकालता है कि हम अभी केवल मानव लेबलर्स को AI रोबोट्स से नहीं बदल सकते, खासकर बांग्ला जैसी भाषाओं में संवेदनशील कार्यों के लिए।
यदि आप इन रोबोट्स को बिना उनके काम की जाँच किए लाइब्रेरी छाँटने के लिए छोड़ देते हैं, तो आप गलती से महत्वपूर्ण किताबें फेंक सकते हैं या खतरनाक किताबों को शेल्फ पर रख सकते हैं। इससे पहले कि हम AI को नियंत्रण सौंपें, हमें उन्हें सावधानीपूर्वक परखने, उनके पूर्वाग्रहों को समझने और यह समझने की आवश्यकता है कि कभी-कभी, एक विशाल, भ्रमित सहायक की तुलना में एक छोटा, अधिक केंद्रित सहायक बेहतर होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।