← नवीनतम पेपर
🤖 machine learning

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

यह शोध पत्र प्रदर्शित करता है कि ट्यून्ड एनकोडर प्री-एनोटेशन्स को ह्यूमन-इन-द-लूप वर्कफ़्लो में एकीकृत करने से उच्च-अस्पष्टता वाले स्पैटियोटेम्पोरल वीडियो फुटेज के लिए मैनुअल एनोटेशन समय में अधिकांश उपयोगकर्ताओं के लिए 35% की कमी आती है, और साथ ही एल्गोरिद्मिक गति और मानव सत्यापन अखंडता के बीच के ट्रेड-ऑफ का मूल्यांकन करने के लिए एक कठोर ढांचा स्थापित करता है।

मूल लेखक: Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

प्रकाशित 2026-02-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: वीडियो को लेबल करना थका देने वाला काम है

कल्पना कीजिए कि आपके पास सुरक्षा कैमरों के फुटेज की एक विशाल लाइब्रेरी है। आपका काम हर एक सेकंड को देखना और हर बार जब कुछ "अजीब" या "खतरनाक" (जैसे लड़ाई, गिरना, या चोरी) होता है, तो उसके चारों ओर एक बॉक्स बनाना है। आपको यह भी लिखना होगा कि वह ठीक कब शुरू हुआ और कब खत्म हुआ।

इसे मैन्युअल रूप से करना ऐसा ही है जैसे एक समय में एक छोटा सा बिंदु बनाकर हाथ से एक मास्टरपीस पेंट करने की कोशिश करना। इसमें बहुत समय लगता है, यह उबाऊ है, और अलग-अलग लोग बॉक्स को थोड़ी अलग जगहों पर बना सकते हैं। यह AI को प्रशिक्षित करने के लिए "गोल्ड स्टैंडर्ड" (मानक) है, लेकिन भारी मात्रा में वीडियो के लिए ऐसा करना बहुत धीमा और महंगा है।

प्रस्तावित समाधान: "स्मार्ट असिस्टेंट"

शोधकर्ताओं ने पूछा: क्या होगा अगर हम मानव लेबलर (annotator) को एक "स्मार्ट असिस्टेंट" दें जो पहले भारी काम कर दे?

खाली स्क्रीन से शुरुआत करने के बजाय, कंप्यूटर एक विशेष AI मॉडल ("विज़न-लैंग्वेज मॉडल") चलाता है जो वीडियो को स्कैन करता है और कहता है, "हे, मुझे लगता है कि यह 10 सेकंड का हिस्सा चोरी जैसा दिखता है, और अगला हिस्सा सामान्य दिखता है।" इन्हें प्री-एनोटेशन (Pre-Annotations) कहा जाता है।

अब इंसान का काम "निर्माता" (सब कुछ शून्य से बनाना) से बदलकर "संपादक" (AI के काम की जांच करना और गलतियों को सुधारना) हो जाता है। यह एक भूतिया लेखक (ghostwriter) द्वारा लिखे गए ड्राफ्ट को एडिट करने बनाम खुद से उपन्यास लिखने के अंतर जैसा है।

प्रयोग: एक नियंत्रित परीक्षण

यह देखने के लिए कि क्या यह "स्मंत असिस्टेंट" लोगों को बिना गुमराह किए वास्तव में मदद करता है, शोधकर्ताओं ने एक सख्त प्रयोग चलाया:

  • खिलाड़ी: 18 स्वयंसेवक (मुख्य रूप से विश्वविद्यालय के छात्र)।
  • कार्य: उन्हें 30 अलग-अलग वीडियो लेबल करने थे।
  • ट्विस्ट: प्रत्येक व्यक्ति ने दो प्रकार के कार्य किए:
    1. कठिन तरीका: बिना किसी मदद के 5 वीडियो लेबल करना (केवल कच्चा फुटेज)।
    2. आसान तरीका: 5 वीडियो लेबल करना जहाँ AI ने पहले से ही रफ आउटलाइन बना दी थी।
  • सेटअप: उन्होंने क्रम को बदल दिया ताकि किसी को भी केवल "टूल का उपयोग करने की आदत" से अनुचित लाभ न मिले।

परिणाम: तेज़, लेकिन क्या वे अपना मानसिक संतुलन खो बैठे?

शोधकर्ता एक विशिष्ट जाल को लेकर चिंतित थे: "यस-मैन" प्रभाव (The "Yes-Man" Effect)।
यदि आप किसी को एक ड्राफ्ट देते हैं, तो वे शायद कंप्यूटर द्वारा लिखी गई हर चीज़ के लिए बस "ठीक है" कह दें, भले ही कंप्यूटर गलत हो। वे जल्दी खत्म करने के लिए AI से सहमत हो सकते हैं, जिससे उनका अपना निर्णय कम हो जाता है। इसे "सिमेंटिक ड्रिफ्ट" (semantic drift) कहा जाता है।

यहाँ उन्हें क्या मिला:

1. गति: "टाइम मशीन" प्रभाव

  • परिणाम: "स्मार्ट असिस्टेंट" ने लोगों को औसतन 35% तेज़ बना दिया।
  • उपमा: कल्पना कीजिए कि आप एक सूटकेस पैक कर रहे हैं। अकेले करने में 20 मिनट लगते हैं। यदि कोई और आपके लिए 70% पैकिंग कर देता है, और आपको बस उसे ज़िप करना है और कुछ मोज़े ठीक करने हैं, तो आप 13 मिनट में काम पूरा कर लेते हैं।
  • विवरण: 72% स्वयंसेवक AI की मदद से तेज़ थे। उन्होंने जितना अधिक टूल का उपयोग किया, वे AI के सुझावों को जल्दी सत्यापित करने में उतने ही बेहतर होते गए।

2. गुणवत्ता: क्या वे सिर्फ AI से सहमत थे?

  • परिणाम: आश्चर्यजनक रूप से, नहीं। जिन लोगों ने AI का उपयोग किया, उन्होंने केवल अंधे होकर कंप्यूटर की नकल नहीं की।
  • उपमा: कल्पना कीजिए कि दोस्तों का एक समूह यह तय करने की कोशिश कर रहा है कि फिल्म का दृश्य कहाँ समाप्त होता है। बिना मदद के, हर कोई अलग-अलग अनुमान लगाता है (कोई कहता है कि यह 1:00 पर समाप्त होता है, दूसरा कहता है 1:05 पर)। AI के साथ, AI कहता है "यह 1:02 पर समाप्त होता है।" दोस्त अभी भी थोड़ा बहस करते हैं, लेकिन वे सभी 1:02 के निशान पर बहुत अधिक सहमत होते हैं।
  • विज्ञान: शोधकर्ताओं ने मापा कि स्वयंसेवकों के बीच कितनी सहमति थी। AI का उपयोग करने वाले समूह अकेले काम करने वाले समूह की तुलना में एक-दूसरे के साथ अधिक सहमत थे। इसका मतलब है कि AI ने एक "रूलर" (पैमाने) या एक "मानक" के रूप में कार्य किया, जिससे सभी को अपनी रेखाएं एक ही जगह खींचने में मदद मिली, बिना उन्हें गलत उत्तरों को स्वीकार करने के लिए मजबूर किए।

3. "जिटर" (Jitter) की समस्या

  • परिणाम: बिना मदद के, मानव लेबल "जिटरी" (लड़खड़ाते हुए और असंगत) थे। मदद के साथ, लेबल "स्मूथ" (सुचारू) और सुसंगत हो गए।
  • उपमा: कागज पर एक रेखा खींचने के बारे में सोचें। यदि आप इसे फ्रीहैंड करते हैं, तो आपका हाथ थोड़ा हिलता है (जिटर)। यदि आप एक रूलर (AI) का उपयोग करते हैं, तो रेखा सीधी होती है। पेपर का दावा है कि AI ने वह "रूलर" प्रदान किया जिसने इंसानों को अधिक सुसंगत बनाया, बिना यह बदले कि वे क्या बना रहे थे।

निष्कर्ष (The Takeaway)

यह पेपर साबित करता है कि इंसानों को AI से "पहला ड्राफ्ट" देना वीडियो लेबलिंग के लिए एक विन-विन (दोनों के लिए फायदेमंद) स्थिति है:

  1. यह समय बचाता है: लोग काम बहुत तेज़ी से पूरा करते हैं।
  2. यह गुणवत्ता को उच्च बनाए रखता है: लोग केवल अंधे होकर AI से सहमत नहीं होते; वे इसका उपयोग एक मार्गदर्शक के रूप में एक-दूसरे के साथ अधिक सुसंगत होने के लिए करते हैं।
  3. यह सुरक्षित है: AI ने इंसानों को गलत निर्णय लेने के लिए धोखा नहीं दिया; इसने बस उन्हें रेखा खींचते समय अपने हाथों को कांपने से रोकने में मदद की।

शोधकर्ताओं ने अपना कोड और स्वयंसेवकों के माउस क्लिक और टाइपिंग का डेटा भी जारी किया है ताकि अन्य वैज्ञानिक उनके काम की जांच कर सकें और इसे स्वयं आज़मा सकें। उन्होंने इस बात पर जोर दिया कि हालांकि यह मदद करता है, फिर भी इंसानों को नियंत्रण में रहना चाहिए ताकि जब AI गलती करे, तो वे उसे पकड़ सकें, खासकर जब वीडियो की सामग्री संवेदनशील या हिंसक हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →