CogniRoute: Learning to Route Social Evidence in Omni-Modal Models
यह शोध पत्र कॉग्नीरूट (CogniRoute) को प्रस्तुत करता है, जो एक स्कीमा-गाइडेड मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है जिसे रूट-अवेयर रीइन्फोर्समेंट लर्निंग द्वारा उन्नत किया गया है और नए ओम्नीसोशलबेंच (OmniSocialBench) डेटासेट पर प्रशिक्षित किया गया है, जो जेस्चर (gestures), टोन (tone) और टेम्पोरल क्यूज़ (temporal cues) से जुड़े जटिल तर्क कार्यों के लिए मल्टी-मोडल साक्ष्यों को प्रभावी ढंग से रूट करने और समन्वय करने के माध्यम से सोशल वीडियो क्वेश्चन अनswering में महत्वपूर्ण सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक भीड़भाड़ वाले कमरे में किसी रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास एक वीडियो कैमरा, एक माइक्रोफ़ोन और लोगों द्वारा कही जा रही बातों का एक ट्रांसक्रिप्ट (लिखित रूप) है। इस रहस्य को सुलझाने के लिए, आपको यह जानना होगा कि क्या देखना है, इसे कैसे व्याख्यायित करना है, और यह कब हुआ।
वर्तमान के अधिकांश AI मॉडल उन जासूसों की तरह हैं जिनके पास यह सारा उपकरण तो है लेकिन उन्हें इसका उपयोग करना नहीं आता। वे वीडियो को तब देख सकते हैं जब उन्हें आवाज़ के लहजे को सुनना चाहिए था, या वे समय के गलत क्षण पर ध्यान केंद्रित कर सकते हैं। वे अक्सर किस्मत से या पैटर्न को याद करके सही उत्तर का अनुमान लगा लेते हैं, लेकिन वे वास्तव में यह नहीं समझते कि उत्तर सही क्यों है।
यह शोध पत्र CogniRoute पेश करता है, जो AI को एक बेहतर जासूस बनने के लिए प्रशिक्षित करने का एक नया तरीका है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: "सब कुछ करने वाला, पर किसी में भी माहिर नहीं" AI
वर्तमान AI मॉडल एक साथ देख, सुन और पढ़ सकते हैं। लेकिन जब आप उनसे कोई कठिन सामाजिक प्रश्न पूछते हैं (जैसे, "क्या वह व्यक्ति वास्तव में खुश है, या सिर्फ दिखावा कर रहा है?"), तो वे अक्सर भ्रमित हो जाते हैं। वे बोले जा रहे शब्दों पर बहुत अधिक ध्यान केंद्रित करने के कारण चेहरे के सूक्ष्म भाव को अनदेखा कर सकते हैं, या वे बातचीत के एक महत्वपूर्ण 2-सेकंड के ठहराव को मिस कर सकते हैं। उनके पास सभी सुराग उपलब्ध हैं, लेकिन उन्हें यह नहीं पता कि "असली सबूत" (smoking gun) कौन सा है।
2. समाधान: एक "स्मार्ट ट्रैफिक कंट्रोलर" (CogniRoute)
लेखकों ने CogniRoute नामक एक प्रणाली बनाई है। AI मॉडल को सैकड़ों विशिष्ट श्रमिकों (जिन्हें "विशेषज्ञ" कहा जाता है) वाली एक विशाल फैक्ट्री के रूप में समझें। कुछ श्रमिक चेहरों का विश्लेषण करने में माहिर हैं, अन्य स्वर (tone) को समझने में, और अन्य समय को ट्रैक करने में।
एक सामान्य फैक्ट्री में, मैनेजर (राउटर) बस काम को उस व्यक्ति के पास भेज देता है जो खाली होता है। CogniRoute में, मैनेजर को एक स्मार्ट ट्रैफिक कंट्रोलर के रूप में प्रशिक्षित किया जाता है। कार्य को विशेषज्ञ के पास भेजने से पहले, कंट्रोलर कार्य के बारे में तीन विशिष्ट प्रश्न पूछता है:
- साक्ष्य स्रोत (Evidence Source): क्या मुझे वीडियो देखने की आवश्यकता है, ऑडियो सुनने की, या दोनों की तुलना करने की?
- तर्क की मांग (Reasoning Demand): क्या मुझे केवल यह देखना है कि क्या हुआ, या मुझे किसी की छिपी हुई भावनाओं या सामाजिक नियमों को समझना है?
- समय का दायरा (Time Scope): क्या मुझे एक पल के हिस्से को देखना है, या मुझे पूरे दृश्य को देखना है?
3. प्रशिक्षण: एक "चीट शीट" के साथ सीखना
इस ट्रैफिक कंट्रोलर को सिखाने के लिए, शोधकर्ताओं ने एक विशेष "चीट शीट" बनाई है जिसे कॉग्निटिव स्कीमा (Cognitive Schema) कहा जाता है।
- उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। आमतौर पर, उन्हें अंत में केवल एक ग्रेड (सही/गलगलत) मिलता है। CogniRoute के साथ, शिक्षक उन्हें परीक्षा के दौरान एक चीट शीट देता है जो कहती है, "इस प्रश्न के लिए, आपको ऑडियो देखना चाहिए और समय की जांच करनी चाहिए।"
- प्रक्रिया: AI को इस चीट शीट के साथ अपने आंतरिक "ट्रैफिक नियंत्रण" निर्णयों को मिलाने के लिए प्रशिक्षित किया जाता है। यह सीखता है कि यदि किसी प्रश्न के लिए व्यंग्यात्मक लहजे को समझने की आवश्यकता है, तो इसे केवल "विजुअल एक्सपर्ट" पर निर्भर रहने के बजाय "ऑडियो एक्सपर्ट" और "सोशल एक्सपर्ट" को डेटा भेजना ही होगा।
4. सुदृढ़ीकरण (Reinforcement): "अच्छा काम किया, लेकिन क्या आपने इसे सही तरीके से किया?"
भले ही AI सही उत्तर दे दे, लेकिन हो सकता है कि उसने यह उत्तर केवल अनुमान लगाकर प्राप्त किया हो। इसे ठीक करने के लिए, शोधकर्ताओं ने दूसरा प्रशिक्षण चरण जोड़ा जिसे रूट-अवेयर रीइन्फोर्समेंट लर्निंग (Route-Aware Reinforcement Learning) कहा जाता है।
- उपमा: एक कोच की कल्पना करें जो खिलाड़ी को गोल करते हुए देख रहा है। यदि खिलाड़ी ने प्रतिद्वंद्वी को गिराकर गोल किया है, तो कोच कहता है, "अच्छा गोल, लेकिन खराब तकनीक।" यदि उन्होंने एक सटीक पास के माध्यम से गोल किया है, तो कोच कहता है, "शानदार गोल, शानदार तकनीक!"
- पुरस्कार (Reward): AI को "हाई स्कोर" तभी मिलता है जब:
- वह उत्तर सही देता है।
- उसने सही प्रकार के साक्ष्य का उपयोग किया (जैसे, ऑडियो को अनदेखा नहीं किया)।
- उसने सही समय पर ध्यान केंद्रित किया।
5. नया परीक्षण: OmniSocialBench
यह साबित करने के लिए कि यह काम करता है, टीम ने OmniSocialBench नामक एक नया परीक्षण बनाया है।
- उपमा: अधिकांश वीडियो परीक्षण बहुविकल्पीय प्रश्नों (multiple-choice quiz) की तरह होते हैं जहाँ आप बस सही अक्षर चुनते हैं। OmniSocialBench एक जासूसी परीक्षा की तरह है जहाँ आपको अपना काम दिखाना होता है। इसमें 118,000 उदाहरण शामिल हैं जहाँ "सही उत्तर" को इस विस्तृत मानचित्र के साथ जोड़ा गया है कि कौन से सुरागों का उपयोग किया गया था और कब।
- परिणाम: इस परीक्षण पर, CogniRoute ने 59.38% स्कोर किया, जो मौजूदा सर्वश्रेष्ठ AI मॉडलों को भारी अंतर से पीछे छोड़ते हुए (शीर्ष प्रोप्रायटरी मॉडल से 15% से अधिक बेहतर) जीत हासिल की। यह उन प्रश्नों के लिए विशेष रूप से अच्छा था जिनमें ऑडियो और वीडियो को मिलाने या संघर्षों (जैसे, जब कोई कहता है "मैं ठीक हूँ" लेकिन उदास दिखता है) को सुलझाने की आवश्यकता होती है।
सारांश
CogniRoute AI को अनुमान लगाने के बजाय एक मानव जासूस की तरह सोचना सिखाने जैसा है। केवल सही उत्तर खोजने के बजाय, यह सीखना जाता है कि:
- उसे किस प्रकार के सुराग की आवश्यकता है (दृश्य, श्रव्य, या दोनों)।
- उस सुराग को कैसे प्रोसेस करना है (साधारण अवलोकन बनाम जटिल सामाजिक निष्कर्ष)।
- वह सुराग कब हुआ था।
AI को इन सुरागों के आधार पर अपनी "मानसिक शक्ति" को सही विशेषज्ञों की ओर भेजने के लिए मजबूर करके, यह मानव सामाजिक संपर्क की जटिल और उलझी हुई दुनिया को समझने में बहुत बेहतर हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।