← नवीनतम पेपर
💻 computer science

Using LLMs for Ontology generation by video summarization

यह शोध पत्र एक दो-चरणीय एल्गोरिदम प्रस्तुत करता है जो यूट्यूब वीडियो यूआरएल से स्वचालित रूप से आरडीएफ (RDF) ऑन्टोलॉजी बनाने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसमें पहले एक पाठ्य सारांश बनाया जाता है और फिर उसे एक संरचित डोमेन प्रतिनिधित्व में परिवर्तित किया जाता है, जिससे एक स्पोर्ट्स डेटासेट पर 90% सटीकता प्राप्त होती है।

मूल लेखक: Khaled Omar

प्रकाशित 2026-09-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Khaled Omar

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल सूचना के विशाल परिदृश्य में, एक निरंतर चुनौती बनी हुई है: कंप्यूटर को केवल डेटा संग्रहीत करना ही नहीं, बल्कि विचारों के बीच के संबंधों को समझना भी सिखाना। एक ऐसी लाइब्रेरी की कल्पना करें जहाँ हर किताब को उसके विषय के बजाय उसके कवर के रंग के आधार पर फाइल किया जाता है; वहाँ किसी विशिष्ट कहानी को खोजना लगभग असंभव होगा। कंप्यूटिंग की दुनिया में, इस समस्या का समाधान "ऑन्टोलॉजी" (ontologies) बनाकर किया जाता है। एक ऑन्टोलॉजी को किसी विशिष्ट क्षेत्र, जैसे कि खेल या चिकित्सा, के लिए ज्ञान के एक संरचित मानचित्र के रूप में समझें। यह उस क्षेत्र के प्रमुख अवधारणाओं को परिभाषित करता है और, सबसे महत्वपूर्ण बात, उन्हें जोड़ने वाली रेखाएँ खींचता है। यह मानचित्र मशीनों को इस तरह से तर्क करने, खोजने और सूचना साझा करने की अनुमति देता है जो मानवीय समझ की नकल करता है। हालाँकि, इन मानचित्रों का निर्माण पारंपरिक रूप से एक धीमी, महंगी प्रक्रिया रही है जिसमें प्रत्येक शब्द और संबंध को मैन्युअल रूप से परिभाषित करने के लिए मानव विशेषज्ञों की टीमों की आवश्यकता होती है। जैसे-जैसे डिजिटल सामग्री की मात्रा बढ़ रही है, विशेष रूप से वीडियो प्रारूपों में, पुरानी मैनुअल निर्माण विधियाँ तालमेल बिठाने में संघर्ष कर रही हैं।

एक नया दृष्टिकोण, जो दमिश्क विश्वविद्यालय के डॉ. खालिद उमर के हालिया शोध में विस्तृत है, उन्नत आर्टिफिशियल इंटेलिजेंस का उपयोग करके सीधे वीडियो से इन ज्ञान मानचित्रों को बनाकर मानव श्रम की बाधा को दूर करने का प्रयास करता है। यह अध्ययन आर्टिफिशियल इंटेलिजेंस के एक विशिष्ट प्रकार पर केंद्रित है जिसे 'लार्ज लैंग्वेज मॉडल्स' (large language models) कहा जाता है—ऐसे सिस्टम जो भारी मात्रा में टेक्स्ट पर प्रशिक्षित होते हैं और उल्लेखनीय प्रवाह के साथ मानव भाषा को पढ़, समझ और उत्पन्न कर सकते हैं। जबकि इन मॉडलों का उपयोग पहले टेक्स्ट को सारांशित करने के लिए किया जाता रहा है, यह शोध एक साहसी प्रश्न पूछता है: क्या वे एक वीडियो देख सकते हैं, उसके मूल संदेश को समझ सकते हैं, और स्वचालित रूप से विषय वस्तु का एक औपचारिक ज्ञान मानचित्र बना सकते हैं? अध्ययन के अनुसार, इसका उत्तर एक आशाजनक 'हाँ' है। शोधकर्ताओं ने एक दो-चरणीय प्रणाली विकसित की है जो पहले एक वीडियो को एक संक्षिप्त लिखित सारांश में बदलती है और फिर उस सारांश को एक संरचित डेटा प्रारूप में परिवर्तित करती है जिसका उपयोग कंप्यूटर वीडियो की सामग्री के बारे में तर्क करने के लिए कर सकते हैं।

प्रक्रिया एक सरल इनपुट के साथ शुरू होती है: यूट्यूब पर एक वीडियो का लिंक। यह सिस्टम वीडियो को उस तरह से नहीं देखता जैसे एक इंसान चलता-फिरते चित्रों को प्रोसेस करके देखता है। इसके बजाय, यह पहले वीडियो से बोले गए शब्दों को निकालता है, जिससे एक टेक्स्ट ट्रांसक्रिप्ट तैयार होती है। इस ट्रांसक्रिप्ट को फिर 'लामा 3.2' (Llama 3.2) नामक एक शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल में डाला जाता है, जिसे शोधकर्ताओं ने क्लाउड लागतों से बचने के लिए अपने स्थानीय कंप्यूटरों पर चलाया था। यह मॉडल एक कुशल संपादक की भूमिका निभाता है, ट्रांसक्रिप्ट को पढ़ता है और उसे प्रबंधनीय टुकड़ों में विभाजित करता है। यह प्रत्येक अनुभाग का सारांश बनाता है और फिर उन सारांशों को एक एकल, सुसंगत वृत्तांत (narrative) में जोड़ता है। यह वृत्तांत केवल वाक्यों का यादृच्छिक संग्रह नहीं है; इसे सावधानीपूर्वक इस तरह से संरचित किया गया है कि यह वीडियो के मुख्य विषय को उजागर करे, उल्लेखित सबसे महत्वपूर्ण लोगों या वस्तुओं की पहचान करे और प्रमुख निष्कर्षों को निकाले। परिणाम एक साफ, टेक्स्ट-आधारित कहानी है जो मूल वीडियो के सार को पकड़ती है।

एक बार जब यह टेक्स्ट सारांश तैयार हो जाता है, तो सिस्टम अपने दूसरे चरण की ओर बढ़ता है: कहानी को एक औपचारिक मानचित्र में बदलना। यहाँ, एक अलग आर्टिफिशियल इंटेलिजेंस मॉडल, 'जेमिनी प्रो 002' (Gemini Pro 002), कार्यभार संभालता है। शोधकर्ता इस मॉडल को निर्देशों का एक विशिष्ट सेट, या 'प्रॉम्ट' प्रदान करते हैं, जिसमें इसे एक 'नॉलेज आर्किटेक्ट' के रूप में कार्य करने के लिए कहा जाता है। मॉडल को सारांश को देखने, वीडियो के डोमेन की पहचान करने और इसमें पाई जाने वाली प्रमुख अवधारणाओं को सूचीबद्ध करने के लिए कहा जाता है। फिर यह इन अवधारणाओं को लेता है और उनके बीच संबंध बनाना शुरू करता है, यह परिभाषित करता है कि वे एक-दूसरे से कैसे संबंधित हैं। अंत में, मॉडल इस संरचना को 'आरडीएफ' (RDF) नामक एक मानक प्रारूप में आउटपुट करता है, जो डेटा लिखने का एक तरीका है जिससे विभिन्न कंप्यूटर सिस्टम जानकारी को निर्बाध रूप से साझा और समझ सकते हैं। एक कच्चे वीडियो लिंक से लेकर एक संरचित ज्ञान मानचित्र तक का पूरा वर्कफ़्लो स्वचालित रूप से होता है, जिसमें शब्दों या संबंधों को परिभाषित करने के लिए किसी मानवीय हस्तक्षेप की आवश्यकता नहीं होती है।

यह परीक्षण करने के लिए कि क्या यह स्वचालित विधि वास्तव में काम करती है, शोधकर्ताओं ने इसे खेलों पर केंद्रित सौ वीडियो के डेटासेट पर लागू किया। उन्होंने केवल सिस्टम को चलने और बेहतर परिणाम की उम्मीद करने के लिए नहीं छोड़ा; उन्होंने एक उच्च मानक के विरुद्ध इसके प्रदर्शन को मापा। प्रक्रिया के पहले भाग के लिए, यानी वीडियो सारांश के लिए, उन्होंने एआई के लिखित सारांश की तुलना वीडियो के मूल शीर्षक से की ताकि यह देखा जा सके कि वे अर्थ में कितनी अच्छी तरह मेल खाते हैं। सिस्टम ने उच्च स्तर की सहमति प्राप्त की, जिसमें सारांश लगभग नब्बे प्रतिशत समय शीर्षकों के साथ मेल खाते थे। दूसरे भाग के लिए, यानी ज्ञान मानचित्र के निर्माण के लिए, शोधकर्ताओं ने एआई द्वारा निर्मित मानचित्र की तुलना एक मानव विशेषज्ञ द्वारा बनाए गए मानचित्र से की। यह वास्तविक परीक्षण है कि क्या मशीन शब्दों को ही नहीं, बल्कि ज्ञान की संरचना को भी समझती है। इस तुलना में, स्वचालित प्रणाली ने मानव विशेषज्ञ के मानचित्र को पचासी प्रतिशत की सटीकता दर के साथ सफलतापूर्वक पुन: निर्मित किया। पूरी प्रक्रिया को समग्र रूप से देखते हुए, शोधकर्ताओं ने नब्बे प्रतिशत की कुल सटीकता की गणना की।

इन कार्यों के निहितार्थ इंटरनेट पर वीडियो सामग्री के बढ़ते सागर को प्रबंधित करने के तरीके के लिए महत्वपूर्ण हैं। इन ज्ञान मानचित्रों के निर्माण को स्वचालित करके, यह प्रणाली मानव विशेषज्ञों पर भारी निर्भरता को कम करती है, जिससे वीडियो डेटा को उस पैमाने पर व्यवस्थित और समझना संभव हो जाता है जो पहले असंभव था। शोधकर्ता नोट करते हैं कि हालांकि उन्होंने इसका परीक्षण खेल वीडियो पर किया है, लेकिन यह विधि उस क्षेत्र तक सीमित नहीं है; इसे मेडिकल लेक्चर, शैक्षिक ट्यूटोरियल, या किसी भी ऐसे डोमेन में लागू किया जा सकता है जहाँ वीडियो सूचना का प्राथमिक स्रोत है। अध्ययन सुझाव देता है कि डिजिटल ज्ञान को व्यवस्थित करने का भविष्य इन हाइब्रिड सिस्टम में निहित है, जहाँ आर्टिफिशियल इंटेलिजेंस निष्कर्षण और संरचना के भारी काम को संभालता है, जिससे मनुष्यों को उच्च-स्तरीय सत्यापन और अनुप्रयोग पर ध्यान केंद्रित करने की अनुमति मिलती है। यह शोध इस बात का प्रमाण है कि सही उपकरणों के साथ, एक चलते-फिरते चित्र को दुनिया की एक संरचित, मशीन-पठनीय समझ में बदलने का जटिल कार्य अब केवल एक सैद्धांतिक संभावना नहीं, बल्कि एक व्यावहारिक वास्तविकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →