← नवीनतम पेपर
💻 computer science

Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition

Gen2Balance, एक्शन प्रोफाइल्स पर आधारित टेक्स्ट-टू-वीडियो जनरेटेड क्लिप्स के माध्यम से असंतुलित ट्रेनिंग सेट्स को संवर्धित करके लॉन्ग-टेल्ड वीडियो एक्शन रिकग्निशन की चुनौती का समाधान करता है, जो दुर्लभ क्रियाओं पर महत्वपूर्ण सटीकता सुधार प्राप्त करने के लिए एक टू-स्टेज ट्रेनिंग रणनीति का उपयोग करता है और आंशिक संतुलन (पार्शियल बैलेंसिंग) के माध्यम से व्यावहारिक स्केलेबिलिटी प्रदर्शित करता है।

मूल लेखक: Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron, Dima Damen

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron, Dima Damen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को विभिन्न मानवीय क्रियाओं को पहचानना सिखाने की कोशिश कर रहे हैं, जैसे कि "तैरना" (swimming), "खाना बनाना" (cooking), या "नाचना" (dancing)। आप उसे अध्ययन करने के लिए वीडियो का एक विशाल पुस्तकालय देते हैं। हालाँकि, यहाँ एक बहुत बड़ी समस्या है: यह लाइब्रेरी अत्यधिक असंतुलित (unbalanced) है।

इसे एक संगीत प्लेलिस्ट की तरह समझें जहाँ 99% गाने एक प्रसिद्ध पॉप स्टार के हैं, और केवल कुछ ही गाने गुमनाम इंडी बैंड्स के हैं।

  • "हेड" (लोकप्रिय): रोबोट "बास्केटबॉल खेलने" के हजारों वीडियो देखता है। वह इसमें विशेषज्ञ बन जाता है।
  • "टेल" (दुर्लभ): रोबोट "कीबोर्ड काटने" (cutting a keyboard) या "टायर पर झूलने" (swinging on a tire) के केवल पांच वीडियो देखता है। वह इनके बारे में बहुत कम सीख पाता है, इसलिए जब वह असल जिंदगी में इन्हें देखता है, तो वह भ्रमित हो जाता है और गलत अनुमान लगाता है।

यह लॉन्ग-टेल्ड समस्या (Long-Tailed Problem) है। रोबोट आम चीजों में तो बेहतरीन है लेकिन दुर्लभ चीजों में बहुत खराब है।

समाधान: Gen2Balance (एक "AI शेफ")

यह पेपर Gen2Balance नामक एक नई विधि पेश करता है। केवल इंटरनेट पर और अधिक दुर्लभ वीडियो खोजने की उम्मीद करने के बजाय (जो कि कठिन है क्योंकि वे दुर्लभ होते हैं), लेखकों ने एक AI जनरेटर का उपयोग करके नए वीडियो को "पकाकर तैयार करने" (cook up) का निर्णय लिया।

उन्होंने इसे सरल चरणों में इस प्रकार किया:

1. स्मार्ट रेसिपी बुक (द प्रॉम्प्ट पाइपलाइन)

यदि आप केवल एक AI को कहते हैं, "रोबोट डांस करने का एक वीडियो बनाओ," तो वह भ्रमित हो सकता है। क्या इसका मतलब एक इंसान का रोबोट की तरह नाचना है, या एक वास्तविक धातु का रोबोट नाचना? यदि आप केवल "कीबोर्ड काटना" मांगते हैं, तो AI एक अजीब, डरावना वीडियो बना सकता है जो वास्तविक क्रिया जैसा नहीं दिखता।

इसे ठीक करने के लिए, लेखकों ने एक स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करके एक तीन-चरणीय रेसिपी सिस्टम बनाया:

  • चरण A: एक्शन प्रोफाइल (Action Profile)। वे AI से क्रिया की एक विस्तृत परिभाषा लिखने के लिए कहते हैं, जिसमें यह शामिल है कि वह क्या है और क्या नहीं है (जैसे, "एक इंसान जो रोबोट की तरह हिल रहा है, न कि एक धातु की मशीन")।
  • चरण B: उदाहरण (The Examples)। वे AI को उस क्रिया के कुछ वास्तविक वीडियो दिखाते हैं ताकि वह संदर्भ को समझ सके (जैसे, "इस इंसान को देखो? इसका मतलब यही है")।
  • चरण C: विविधता (The Variety)। वे AI को इस वीडियो के 100 अलग-अलग संस्करण बनाने के लिए कहते हैं: लाइटिंग बदलें, बैकग्राउंड बदलें (एक पार्क बनाम एक रसोई), व्यक्ति के कपड़े बदलें, और कैमरा एंगल बदलें।

परिणाम: उन्होंने 1,40,000 बिल्कुल नए, सिंथेटिक वीडियो बनाए जो वास्तविक दिखते हैं लेकिन उन दुर्लभ क्रियाओं को कवर करते हैं जिनकी रोबोट को कमी थी।

2. दो-चरणीय प्रशिक्षण (द स्टडी प्लान)

आप इन नए नकली वीडियो को सीधे रोबोट के दिमाग में नहीं डाल सकते और उम्मीद नहीं कर सकते कि सब ठीक हो जाएगा। रोबोट भ्रमित हो सकता है क्योंकि नकली वीडियो वास्तविक जीवन से थोड़े अलग दिख सकते हैं (जैसे, एक कार्टून बनाम एक फोटो)।

इसलिए, उन्होंने एक दो-चरणीय अध्ययन योजना का उपयोग किया:

  • चरण 1: "संतुलित" अध्ययन (The "Balanced" Study)। रोबोट नए, संतुलित पुस्तकालय (वास्तविक वीडियो + जनरेटेड वीडियो) का अध्ययन करता है। क्योंकि अब पर्याप्त "दुर्लभ" उदाहरण मौजूद हैं, रोबोट उन्हें पहचानना सीख जाता है। हालाँकि, रोबोट को यह तय करने के लिए विशेष ध्यान देने को कहा जाता है कि प्रत्येक श्रेणी कितनी महत्वपूर्ण है, कि वह वास्तविक वीडियो पर ध्यान दे।
  • चरण 2: "रियलिटी चेक" (The "Reality Check")। रोबोट वापस केवल वास्तविक वीडियो का अध्ययन करने के लिए थोड़े समय के लिए जाता है। यह एक अंतिम परीक्षा की समीक्षा की तरह है। यह रोबोट को "नकली" विचित्रताओं को भूलने और अपनी याददाश्त को वास्तविक दुनिया के अनुरूप वापस पाने में मदद करता है।

परिणाम: क्या यह काम आया?

लेखकों ने इसका परीक्षण मानक वीडियो डेटासेट (UCF-101 और Kinetics) पर किया, जिन्हें उन्होंने समस्या को दर्शाने के लिए कृत्रिम रूप से "लॉन्ग-टेल्ड" बनाया था।

  • बड़ी जीत: Gen2Balance ने सभी पिछले तरीकों को पछाड़ दिया। Kinetics डेटासेट पर, इसने मौजूदा सर्वोत्तम तरीकों की तुलना में 7% सुधार किया। UCF डेटासेट पर, इसने 5% का सुधार किया।
  • दुर्लभ क्रियाएं: सबसे कठिन, दुर्लभ क्रियाओं के लिए (जैसे "कीबोर्ड काटना"), सुधार जबरदस्त था—पहले की तुलना में 31.9% बेहतर।
  • लागत दक्षता (Cost Efficiency): उन्होंने पाया कि बेहतरीन परिणाम पाने के लिए आपको सब कुछ जेनरेट करने की आवश्यकता नहीं है। यदि उन्होंने केवल लापता डेटा के 27% हिस्से को भरने के लिए पर्याप्त वीडियो जेनरेट किए, तो भी उन्हें कुल प्रदर्शन लाभ का 79% प्राप्त हुआ। इसका मतलब है कि यह विधि व्यावहारिक है और इसके लिए अनंत कंप्यूटिंग पावर की आवश्यकता नहीं है।

यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर का तर्क है कि जबकि अन्य विधियाँ उनके पास मौजूद कुछ दुर्लभ वीडियो को "खींचने" (stretch) की कोशिश करती हैं (जिससे कोई नई जानकारी नहीं जुड़ती), Gen2Balance नई जानकारी बनाता है। यह दुर्लभ क्रियाओं के विविध, यथार्थवादी उदाहरणों का आविष्कार करके रोबोट के ज्ञान के अंतराल को भर देता है, जिससे रोबोट अंततः वह सीख पाता है जो वह मिस कर रहा था।

संक्षेप में: Gen2Balance एक छात्र को ऐसी पाठ्यपुस्तक देने जैसा है जिसे उन विषयों के लिए सैकड़ों अभ्यास प्रश्नों के साथ फिर से लिखा गया है जिनमें वह कमजोर था, और उसके बाद मूल पाठ्यपुस्तक की एक त्वरित समीक्षा की गई ताकि यह सुनिश्चित हो सके कि वह नए उदाहरणों से भ्रमित न हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →