← नवीनतम पेपर
🤖 AI

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

यह शोध पत्र OmniSapiens-7B 2.0 को प्रस्तुत करता है, जो सामाजिक व्यवहार प्रसंस्करण के लिए एक फाउंडेशन मॉडल है, जो विविध और असंतुलित व्यवहार संबंधी डेटा से प्रभावी ढंग से सीखने के लिए एक नवीन हेटेरोजेनिटी-अवेयर रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन पद्धति का लाभ उठाता है, जिससे कई कार्यों और बेंचमार्क पर अत्याधुनिक प्रदर्शन और सुसंगत तर्क प्राप्त होता है।

मूल लेखक: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र "OmniSapiens: Heterogeneity-Aware Relative Policy Optimization के माध्यम से सोशल बिहेवियर प्रोसेसिंग के लिए एक फाउंडेशन मॉडल" का स्पष्टीकरण दिया गया है।

बड़ी तस्वीर: एक AI को मानव व्यवहार समझने के लिए सिखाना

कल्पimate कीजिए कि आप एक रोबोट को मानव व्यवहार समझने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आप चाहते हैं कि वह कई अलग-अलग चीजों में कुशल हो: कटाक्ष (sarcasm) को पहचानना, अवसाद (depression) का पता लगाना, हास्य को समझना, शारीरिक भाषा (body language) को पढ़ना और यह समझना कि कोई क्या महसूस कर रहा है।

समस्या यह है कि मानव व्यवहार बहुत ही अव्यवस्थित और विविध है। कुछ कार्य 'चिल्लाने' (बहुत तेज़ संकेतों) जैसे होते हैं, जबकि अन्य 'फुसफुसाने' (बहुत शांत संकेतों) जैसे होते हैं। यदि आप इन सभी कार्यों को एक मानक AI के सामने रख देते हैं, तो "चिल्लाने" वाले कार्य "फुसफुसाहट" को दबा देते हैं। AI उन तेज़ संकेतों वाले कार्यों में बहुत अच्छा हो जाता है लेकिन शांत संकेतों को पूरी तरह से अनदेखा कर देता है।

इस शोध पत्र के लेखकों ने इस समस्या को हल करने के लिए एक नया AI मॉडल बनाया है जिसे OmniSapiens-7B 2.0 कहा जाता है। इसे एक ऐसे "सामाजिक रूप से बुद्धिमान" मस्तिष्क के रूप में डिज़ाइन किया गया है जो भ्रमित हुए बिना या किसी एक तरफ झुके बिना एक साथ इन सभी विभिन्न कार्यों को संभाल सकता है।

समस्या: "रोते हुए बच्चे" का प्रभाव (The "Crying Baby" Effect)

यह शोध पत्र बताता है कि मौजूदा AI मॉडल संघर्ष करते हैं क्योंकि जिस डेटा से वे सीखते हैं वह विषम (heterogeneous) (मिश्रित और असमान) होता है।

  • उपमा: कल्पना कीजिए कि एक कक्षा है जहाँ एक शिक्षक एक साथ 10 अलग-अलग विषय पढ़ाने की कोशिश कर रहा है। एक कोने में, एक छात्र गणित के सवाल का जवाब चिल्लाकर दे रहा है (एक बहुत ही आसान, तेज़ संकेत)। दूसरे कोने में, एक छात्र दुख के बारे में एक जटिल कविता फुसफुसा रहा है (एक कठिन, शांत संकेत)।
  • परिणाम: एक मानक शिक्षक (या AI) पूरी तरह से चिल्लाने वाले छात्र पर ध्यान केंद्रित करेगा क्योंकि उस फीडबैक को सुनना सबसे आसान है। वे फुसफुसाने वाले छात्र को अनदेखा कर देंगे। AI के संदर्भ में, मॉडल आसान कार्यों में तो बहुत अच्छा हो जाता है लेकिन सूक्ष्म और जटिल कार्यों में विफल हो जाता है।

समाधान: "फेयरनेस कोच" (HARPO)

इसे ठीक करने के लिए, शोधकर्ताओं ने एक नई प्रशिक्षण पद्धति विकसित की जिसे HARPO (Heterogeneity-Aware Relative Policy Optimization) कहा जाता है।

  • उपमा: HARPO को उस कक्षा में खड़े एक बहुत ही समझदार "फेयरनेस कोच" (निष्पक्षता प्रशिक्षक) के रूप में सोचें।
    1. सुनना: कोच हर छात्र के उत्तर को सुनता है।
    2. प्रयास को मापना: कोच गणना करता है कि प्रत्येक छात्र कितना "शोर" (या सीखने का संकेत) योगदान दे रहा है।
    3. आवाज़ का संतुलन बनाना: यदि गणित वाला छात्र बहुत ज़ोर से चिल्ला रहा है, तो कोच उसके माइक्रोफ़ोन को थोड़ा कम कर देता है। यदि कविता वाला छात्र बहुत धीरे फुसफुसा रहा है, तो कोच उसके माइक्रोफ़ोन को थोड़ा बढ़ा देता है।
    4. लक्ष्य: कोच यह सुनिश्चित करता है कि हर छात्र को पाठ को प्रभावित करने का समान अवसर मिले, चाहे वह कितना भी तेज़ या धीमा क्यों न हो।

तकनीकी शब्दों में, HARPO यह देखता है कि प्रत्येक विशिष्ट कार्य या डेटा सैंपल AI के सीखने में कितना योगदान देता है। फिर यह गणितीय रूप से शांत संकेतों की आवाज़ को बढ़ाता है और तेज़ संकेतों को कम करता है ताकि AI हर चीज़ से समान रूप से सीख सके।

परिणाम: एक ऑल-स्टार खिलाड़ी

शोध पत्र ने इस नए AI (OmniSapiens-7B 2.0) का परीक्षण 10 अलग-अलग व्यवहारिक कार्यों पर किया, जिसमें चिंता (anxiety) का पता लगाने से लेकर गैर-मौखिक इशारों (non-verbal gestures) को समझने तक शामिल हैं।

  • स्कोरबोर्ड: OmniSapiens ने केवल जीत ही नहीं हासिल की; बल्कि इसने दबदबा बनाया। इसने एक साथ सभी 10 कार्यों पर सर्वश्रेष्ठ परिणाम प्राप्त किए।
  • तुलना: अन्य शीर्ष AI मॉडलों की तुलना में, OmniSapiens समग्र रूप से 12% तक बेहतर था। इससे भी अधिक प्रभावशाली बात यह है कि जब AI का परीक्षण 5 बिल्कुल नए कार्यों (जैसे ऑटिज्म या गंभीर अवसाद का पता लगाना) पर किया गया, जो उसने पहले कभी नहीं देखे थे, तब भी इसने दूसरों से 9% तक बेहतर प्रदर्शन किया।
  • "क्यों": शोध पत्र का सुझाव है कि क्योंकि "फेयरनेस कोच" (HARPO) ने यह सुनिश्चित किया कि AI शांत और कठिन संकेतों से सीखे, इसलिए AI ने मानव व्यवहार की गहरी और अधिक लचीली समझ विकसित की। इसने केवल तेज़ जवाबों को रटा नहीं; बल्कि इसने अंतर्निहित पैटर्न को सीखा।

बोनस: स्पष्ट सोच

शोध पत्र ने यह भी देखा कि AI कैसे सोचता है। जब किसी समस्या को हल करने के लिए कहा जाता है, तो AI अपने तर्क के चरणों को लिखता है (जैसे एक छात्र अपना काम दिखाकर समझाता है)।

  • पुराने मॉडल: अक्सर लंबे, भ्रामक या उलझन भरे स्पष्टीकरण देते थे, या कभी-कभी बिना सोचे-समझे केवल अनुमान लगाते थे।
  • OmniSasiens: इसने छोटे, स्पष्ट और अधिक सुसंगत तर्क प्रस्तुत किए। यह एक ऐसे छात्र की तरह था जिसने न केवल सही उत्तर दिया, बल्कि इसे तार्किक और संक्षिप्त रूप में समझाया भी। यह AI को वास्तविक दुनिया के उपयोग के लिए अधिक विश्वसनीय बनाता है।

सारांश

शोध पत्र का दावा है कि अलग-अलग सीखने के संकेतों के "वॉल्यूम" को संतुलित करने का एक नया तरीका (HARPO) आविष्कार करके, उन्होंने एक ऐसा AI (OmniSapiens-7B 2.0) बनाया है जो है:

  1. हर चीज़ में बेहतर: यह 10 विविध सामाजिक कार्यों में जीतता है।
  2. नई चीज़ों में बेहतर: यह उन कार्यों के लिए अच्छी तरह से सामान्यीकरण (generalize) करता है जिन्हें उसने पहले नहीं देखा है।
  3. अधिक स्पष्ट: यह पिछले मॉडलों की तुलना में अपने तर्क को बेहतर ढंग से समझाता है।

मुख्य निष्कर्ष यह है कि वास्तव में सामाजिक रूप से बुद्धिमान AI बनाने के लिए, आप केवल "तेज़" डेटा को हावी नहीं होने दे सकते; आपको एक ऐसी व्यवस्था की आवश्यकता है जो यह सुनिश्चित करे कि "फुसफुसाहट" को भी उतनी ही स्पष्टता से सुना जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →