← नवीनतम पेपर
💻 computer science

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

यह शोध पत्र BROTHER का प्रस्ताव देता है, जो एक अत्यधिक नियमितीकृत मल्टीमॉडल फ्रेमवर्क है जो प्राकृतिक वीडियो में द्वंद्व (ambivalence) और हिचकिचाहट (hesitancy) की जटिल व्यवहारिक अवस्थाओं को पहचानने में 0.7465 का उच्चतम मैक्रो F1-स्कोर प्राप्त करने के लिए विजुअल, एकोस्टिक और विशिष्ट सांख्यिकीय भाषाई विशेषताओं पर विविध क्लासिफायर को एंसेम्बल करने हेतु पार्टिकल स्वार्म ऑप्टिमाइज़ेशन का उपयोग करता है।

मूल लेखक: Alexandre Pereira, Bruno Fernandes, Pablo Barros

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alexandre Pereira, Bruno Fernandes, Pablo Barros

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह पता लगाने की कोशिश कर रहे हैं कि क्या कोई वास्तव में एक नए विचार को लेकर उत्साहित है, या वह केवल उत्साहित होने का दिखावा कर रहा है जबकि मन ही मन अनिश्चित, द्वंद्व में या संशय में है। यह द्वंद्व और संशय (Ambivalence and Hesitancy - A/H) का पता लगाने की चुनौती है।

एक स्पष्ट "हाँ!" या एक ज़ोरदार "नहीं!" के विपरीत, द्वंद्व एक शांत, उलझा हुआ "शायद... लेकिन..." है जो किसी व्यक्ति के दिमाग के भीतर चलता है। इसे पहचानना कठिन है क्योंकि यह एक बड़ी मुस्कान या त्योरियाँ चढ़ाने जैसा नहीं दिखता। यह एक सूक्ष्म संघर्ष है जो उनके द्वारा कही गई बातों, उनके बोलने के तरीके और उनके हाव-भाव के बीच होता है।

यह शोध पत्र BROTHER (Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization) नामक एक स्मार्ट कंप्यूटर सिस्टम का वर्णन करता है, जिसे इस रहस्य को सुलझाने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. चार इंद्रियाँ (डेटा)

अधिकांश भावना डिटेक्टर केवल एक चेहरे को देखते हैं। लेकिन किसी ऐसे व्यक्ति को पकड़ने के लिए जो "दुविधा में" है, BROTHER चार अलग-अलग इंद्रियों का उपयोग करता है, जैसे कि एक जासूस सुराग इकट्ठा करता है:

  • आँखें (दृश्य/Visual): यह वीडियो फ्रेमों को देखता है। लेकिन केवल मुस्कान खोजने के बजाय, यह चेहरे के संदर्भ (context) को समझने के लिए एक सुपर-स्मार्ट AI (SigLip2) का उपयोग करता है। यह वीडियो को साफ भी करता है ताकि धुंधले क्षणों या कैमरा एडजस्टमेंट को अनदेखा किया जा सके।
  • कान (श्रव्य/Audio): यह आवाज़ को सुनता है। यह केवल शब्दों को नहीं सुनता; यह लहजा (tone), ठहराव और लय को सुनता है। क्या आवाज़ डगमगा रही है? क्या जवाब देने से पहले लंबा सन्नाटा है? (HuBERT नामक टूल का उपयोग करके)।
  • शब्द (पाठ/Text): यह ट्रांसक्रिप्ट को पढ़ता है। यह उन विशिष्ट वाक्यांशों को खोजता है जिनका उपयोग लोग तब करते हैं जब वे अनिश्चित होते हैं, जैसे कि "मुझे लगता है," "शायद," या "दूसरी ओर।" (F2LLM नामक टूल का उपयोग करके)।
  • "वाइब चेक" (सांख्यिकीय मोडैलिटी/Statistical Modality): यही इस शोध पत्र का मुख्य मंत्र (secret sauce) है। कल्पना कीजिए कि आप पहली तीन इंद्रियों को लेते हैं और पैटर्न खोजने के लिए गणना करते हैं। क्या व्यक्ति ने 2 सेकंड का विराम लिया? क्या उसने एक शब्द को तीन बार दोहराया? क्या उनकी आवाज़ धीमी हो गई? यह मोडैलिटी कच्चे डेटा को एक "व्यवहार संबंधी सारांश" (behavioral summary) में बदल देती है जो संशय को उजागर करती है।

2. विशेषज्ञों की समिति (क्लासिफायर)

केवल एक AI को अंतिम निर्णय लेने के लिए नियुक्त करने के बजाय, लेखकों ने 15 विशेषज्ञों की एक समिति बनाई।

  • उन्होंने चारों इंद्रियों के हर संभव संयोजन (जैसे, केवल टेक्स्ट, केवल ऑडियो + वीडियो, चारों एक साथ) को लिया।
  • प्रत्येक संयोजन के लिए, उन्होंने तीन अलग-अलग प्रकार के "मस्तिष्क" (मशीन लर्निंग मॉडल) का परीक्षण किया:
    • गहन विचारक (MLP): एक न्यूरल नेटवर्क जो जटिल पैटर्न खोजने में कुशल है।
    • फॉरेस्ट रेंजर (Random Forest): अव्यवस्थित और मिश्रित डेटा को संभालने में कुशल।
    • क्रमिक शिक्षार्थी (GBDT): अपनी गलतियों से कदम-दर-कदम सीखने में कुशल।
  • उन्होंने सभी 45 संयोजनों (15 सेटअप × 3 मस्तिष्क) का परीक्षण किया और प्रत्येक विशिष्ट सेटअप के लिए केवल सर्वश्रेष्ठ प्रदर्शन करने वाले को ही रखा। इसने यह सुनिश्चित किया कि उनके पास सबसे मजबूत टीम हो।

3. स्मार्ट कोच (पार्टिकल स्वार्म ऑप्टिमाइज़ेशन)

अब, उनके पास 15 अलग-अलग विशेषज्ञ हैं, जिनमें से प्रत्येक "हाँ" या "नहीं" का वोट दे रहा है। आप यह कैसे तय करेंगे कि किसकी बात सुननी है?

यदि आप उन्हें समान रूप से वोट करने देते हैं, तो ज़ोरदार लेकिन गलत विशेषज्ञ सही लेकिन शांत विशेषज्ञों को दबा सकते हैं। इसके अलावा, यदि आप उन्हें केवल अभ्यास के आधार पर वोट करने देते हैं, तो वे उत्तरों को रट सकते हैं (overfitting) और वास्तविक लोगों पर विफल हो सकते हैं।

इसलिए, उन्होंने एक स्मार्ट कोच का उपयोग किया जिसे पार्टिकल स्वार्म ऑप्टिमाइज़ेशन (PSO) कहा जाता है।

  • उपमा: कल्पना कीजिए कि पक्षियों का एक झुंड सबसे अच्छी जगह की तलाश में है जहाँ वे उतर सकें। "पक्षियों" के वोटिंग वेट (weights) हैं। कोच उन्हें सही संतुलन खोजने के लिए इधर-उधर ले जाता है जहाँ टीम का प्रदर्शन सबसे अच्छा हो।
  • दंड (Penalty): कोच का एक विशेष नियम है: "यदि आप बहुत अधिक अभ्यास करते हैं और एक सटीक स्कोर प्राप्त करते हैं लेकिन वास्तविक परीक्षण में विफल हो जाते हैं, तो आपको दंड दिया जाएगा।" यह समिति को विशिष्ट उत्तरों को रटने के बजाय सामान्य नियम सीखने के लिए मजबूर करता है।
  • परिणाम: कोच ने पाया कि टेक्स्ट (शब्द) विशेषज्ञ सबसे महत्वपूर्ण है, लेकिन इसे संशय के सूक्ष्म क्षणों को पकड़ने के लिए ऑडियो और विजुअल विशेषज्ञों की मदद की आवश्यकता होती है।

4. परिणाम

जब उन्होंने इस सिस्टम का परीक्षण उन लोगों पर किया जिन्हें यह पहले कभी नहीं देखा गया था:

  • इसने 0.7465 का स्कोर प्राप्त किया (जो इस कठिन कार्य के लिए बहुत उच्च है)।
  • इसने सिद्ध किया कि शब्द सबसे बड़ा सुराग हैं, लेकिन आप आवाज़ और चेहरे को नज़रअंदाज़ नहीं कर सकते।
  • सबसे महत्वपूर्ण बात यह है कि अनिश्चितता को एक एकल भावना के बजाय विभिन्न संकेतों के बीच एक संघर्ष के रूप में मानकर, सिस्टम मानवीय अनिश्चितता को समझने में बहुत बेहतर हो गया।

मुख्य निष्कर्ष

हिचकिचाहट का पता लगाना किसी एक "दुखी" या "खुश" चेहरे को खोजने के बारे में नहीं है। यह पूरी कहानी सुनने के बारे में है: वे क्या कहते हैं, वे इसे कैसे कहते हैं, और वे कैसे दिखते हैं, और यह सब एक साथ। विशेषज्ञों की एक विशेष टीम और उनके विचारों को संतुलित करने के लिए एक स्मार्ट कोच का उपयोग करके, BROTHER अंततः उस "शायद" को सुन सकता है जिसे इंसान अक्सर चूक जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →