Large Language Models Are Effective Human Annotation Assistants, But Not Good Independent Annotators
यद्यपि लार्ज लैंग्वेज मॉडल्स इवेंट डिटेक्शन कार्यों के लिए स्वतंत्र एनोटेटर्स के रूप में पर्याप्त विश्वसनीय नहीं हैं, फिर भी वे प्रभावी सहायकों के रूप में कार्य करते हैं जो मानव विशेषज्ञों द्वारा इवेंट सेट क्यूरेट करने और वेरिएबल्स को एनोटेट करने के लिए आवश्यक समय और मानसिक प्रयास को काफी कम कर देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: "सुपर-हेल्पर" बनाम "विशेषज्ञ"
कल्पना कीजिए कि आप आतंकवादी घटनाओं के बारे में समाचार कहानियों के एक विशाल, अराजक पुस्तकालय को व्यवस्थित करने की कोशिश कर रहे हैं। आपका लक्ष्य उन कहानियों को एक साथ समूहबद्ध करना है जो एक ही घटना के बारे में बात करती हैं (जैसे यह समझना कि तीन अलग-अलग समाचार पत्र वास्तव में एक ही विस्फोट के बारे में रिपोर्ट कर रहे हैं) और फिर प्रत्येक घटना के लिए एक विस्तृत फॉर्म भरना (यह सूचीबद्ध करना कि किसने किया, कहाँ हुआ, और कितने लोग घायल हुए)।
यह एक ऐसा काम है जो आमतौर पर अत्यधिक प्रशिक्षित मानव विशेषज्ञों द्वारा किया जाता है। लेकिन यह धीमा, महंगा और थका देने वाला है।
इस शोध पत्र के लेखकों ने पूछा: "क्या हम इस काम को हमारे लिए करने के लिए AI (लार्ज लैंग्वेज मॉडल्स) का उपयोग कर सकते हैं?"
उनका उत्तर एक सूक्ष्म "नहीं, लेकिन..." है।
- नहीं: AI अकेले इस काम को करने के लिए मानव विशेषज्ञों की जगह नहीं ले सकता। यदि आप AI को पूरा काम करने देते हैं, तो वह बहुत अधिक गलतियाँ करता है।
- लेकिन: AI एक अद्भुत सहायक (Assistant) है। यदि कोई मानव विशेषज्ञ AI के सुझावों को एक शुरुआती बिंदु के रूप में उपयोग करता है, तो वे बहुत अधिक गुणवत्ता खोए बिना इस काम को 25% तेज़ी से पूरा कर सकते हैं।
इसे इस तरह समझें: आप एक रोबोट को अकेले फॉर्मूला 1 कार चलाने के लिए नहीं छोड़ेंगे क्योंकि वह दुर्घटनाग्रस्त हो सकता है। लेकिन यदि आपके पास एक ऐसा रोबोट है जो आपको सबसे अच्छा रेसिंग पाथ बताता है और गड्ढों के बारे में चेतावनी देता है, तो मानव ड्राइवर अधिक तेज़ी से और सुरक्षित रूप से जा सकता है।
दो-चरणीय नृत्य (The Two-Step Dance)
शोधकर्ताओं ने इसका परीक्षण ग्लोबल टेररिज्म डेटाबेस (GTD) पर किया, जो वास्तविक दुनिया की आतंकवाद रिपोर्टों का एक विशाल, अव्यवस्थित फाइलिंग कैबिनेट जैसा है। उन्होंने काम को दो मुख्य चरणों में विभाजित किया:
चरण 1: "समूहीकरण" चरण (इवेंट सेट क्यूरेशन)
समस्या: कल्पना कीजिए कि आपके पास 500 समाचार कतरनें हैं। कुछ एक ही बम विस्फोट के बारे में हैं, कुछ अलग विस्फोटों के बारे में हैं, और कुछ केवल डुप्लिकेट हैं। एक इंसान को उन सभी को पढ़ना होगा और उन्हें ढेरों में छाँटना होगा।
AI परीक्षण: उन्होंने इन ढेरों को छाँटने में AI की मदद लेने के तीन तरीके आजमाए:
- "कीवर्ड" विधि (पुराना तरीका): केवल "बम" और "विस्फोट" जैसे शब्दों का मिलान करना। (बहुत प्रभावी नहीं)।
- "स्मार्ट रीडर" विधि (LLM-CLS): AI दो लेख पढ़ता है और पूछता है, "क्या ये एक ही घटना के बारे में हैं?"
- "समराइज़र" विधि (K-LLMMEANS): AI कई लेख पढ़ता है, "मुख्य विचार" का एक संक्षिप्त सारांश लिखता है, और उन लेखों को समूहों में रखता है जिनके सारांश समान होते हैं।
परिणाम:
AI कीवर्ड पद्धति की तुलना में सही समूह खोजने में बहुत बेहतर था। हालाँकि, यह पूरी तरह से सटीक नहीं था। इसने कुछ संबंधों को मिस कर दिया और कभी-कभी असंबंधित चीजों को एक साथ जोड़ दिया। यह समान दस्तावेजों को खोजने के लिए एक "अच्छा सहायक" था, लेकिन एक "परफेक्ट सॉर्टर" नहीं।
चरण 2: "फॉर्म भरने" का चरण (वेरिएबल कोडिंग)
समस्या: एक बार जब ढेर छाँट लिए जाते हैं, तो मानव विशेषज्ञ को प्रत्येक घटना के लिए एक विशिष्ट फॉर्म भरना होता है। उन्हें विवरण निकालना होता है जैसे: देश, लक्ष्य, हथियार, मृत्यु संख्या।
AI परीक्षण: उन्होंने तीन परिदृश्यों का परीक्षण किया:
- केवल मानव: विशेषज्ञ पढ़ता है और शून्य से फॉर्म भरता है।
- केवल AI: AI फॉर्म भरता है। (यह त्रुटियों और "हैलुसिनेशन" (Hallucinations)—यानी ऐसे तथ्य बनाना जो वहाँ नहीं थे—से भरा था)।
- हाइब्रिड (विजेता): AI एक ड्राफ्ट फॉर्म भरता है, और मानव विशेषज्ञ बस उसकी समीक्षा करता है, गलतियों को सुधारता है और बाकी चीज़ों की पुष्टि करता है।
परिणाम:
- गति: जब मनुष्यों ने AI के ड्राफ्ट का उपयोग किया, तो उन्होंने 25% तेज़ी से काम पूरा किया।
- स्वीकार्यता: विशेषज्ञों ने लगभग 60% समय AI के सुझावों को स्वीकार किया।
- विशिष्टता: AI आसान, निश्चित तथ्यों (जैसे "देश" – 92% सहमति) के लिए बहुत अच्छा था, लेकिन अस्पष्ट विवरणों (जैसे "स्थान" – केवल 40% सहमति) या संख्याओं (जैसे "मृत्यु") के मामले में संघर्ष करता था, जहाँ वह अक्सर गलत अनुमान लगाता था।
"हैलुसिनेशन" (Hallucination) की समस्या
यह शोध पत्र AI के एक मज़ेदार लेकिन खतरनाक दोष को उजागर करता है: ज्ञान के बिना आत्मविश्वास।
यदि किसी समाचार लेख में यह उल्लेख नहीं है कि कितने लोग मारे गए, तो एक मानव विशेषज्ञ "उपलब्ध नहीं" (Not Available) लिखता है।
हालाँकि, AI अक्सर मददगार होने की कोशिश में एक संख्या बना देता है (जैसे "5 लोग मारे गए") भले ही टेक्स्ट में इसके बारे में कुछ भी न कहा गया हो। इसे "हैलुसिनेटिंग" कहा जाता है।
- उपमा: यह एक छात्र की तरह है जो परीक्षा दे रहा है। यदि उन्हें उत्तर नहीं पता, तो एक इंसान "मुझे नहीं पता" लिख सकता है। AI, एक "अच्छा छात्र" बनने की कोशिश में, एक रैंडम नंबर का अनुमान लगाता है और उसे आत्मविश्वास के साथ लिख देता है।
निष्कर्ष: एक उपकरण, प्रतिस्थापन नहीं
शोध पत्र निष्कर्ष निकालता है कि लार्ज लैंग्वेज मॉडल्स प्रभावी मानव एनोटेशन सहायक हैं, लेकिन स्वतंत्र एनोटेटर नहीं हैं।
- वे ड्राइविंग संभालने के लिए तैयार नहीं हैं: वे विशेषज्ञ की जगह नहीं ले सकते क्योंकि वे संदर्भ (Context) को समझने में चूक जाते हैं, विरोधाभासी रिपोर्टों में भ्रमित हो जाते हैं, और तथ्य गढ़ लेते हैं।
- वे पैसेंजर सीट के लिए एकदम सही हैं: वे हजारों दस्तावेजों को पढ़ने और उत्तर सुझाने का भारी काम कर सकते हैं। इससे मानव विशेषज्ञ कठिन निर्णय लेने पर ध्यान केंद्रित करने के लिए स्वतंत्र हो जाता है, जिससे समय और धन की बचत होती है।
संक्षेप में: अपने विशेषज्ञ एनोटेटरों को बर्खास्त न करें और रोबोट को काम पर न रखें। इसके बजाय, अपने विशेषज्ञ एनोटेटरों को एक रोबोटिक सहायक दें जो उनके लिए बुनियादी काम करे, और अंतिम गुणवत्ता जांच के लिए मनुष्यों को छोड़ दें। उच्च गुणवत्ता वाला डेटा तेज़ी से प्राप्त करने के लिए यही संयोजन सबसे सटीक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।