OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization
यह शोध पत्र OmniSapiens-7B 2.0 को प्रस्तुत करता है, जो सामाजिक व्यवहार प्रसंस्करण के लिए एक फाउंडेशन मॉडल है, जो विविध और असंतुलित व्यवहार संबंधी डेटा से प्रभावी ढंग से सीखने के लिए एक नवीन हेटेरोजेनिटी-अवेयर रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन पद्धति का लाभ उठाता है, जिससे कई कार्यों और बेंचमार्क पर अत्याधुनिक प्रदर्शन और सुसंगत तर्क प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र "OmniSapiens: Heterogeneity-Aware Relative Policy Optimization के माध्यम से सोशल बिहेवियर प्रोसेसिंग के लिए एक फाउंडेशन मॉडल" का स्पष्टीकरण दिया गया है।
बड़ी तस्वीर: एक AI को मानव व्यवहार समझने के लिए सिखाना
कल्पimate कीजिए कि आप एक रोबोट को मानव व्यवहार समझने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आप चाहते हैं कि वह कई अलग-अलग चीजों में कुशल हो: कटाक्ष (sarcasm) को पहचानना, अवसाद (depression) का पता लगाना, हास्य को समझना, शारीरिक भाषा (body language) को पढ़ना और यह समझना कि कोई क्या महसूस कर रहा है।
समस्या यह है कि मानव व्यवहार बहुत ही अव्यवस्थित और विविध है। कुछ कार्य 'चिल्लाने' (बहुत तेज़ संकेतों) जैसे होते हैं, जबकि अन्य 'फुसफुसाने' (बहुत शांत संकेतों) जैसे होते हैं। यदि आप इन सभी कार्यों को एक मानक AI के सामने रख देते हैं, तो "चिल्लाने" वाले कार्य "फुसफुसाहट" को दबा देते हैं। AI उन तेज़ संकेतों वाले कार्यों में बहुत अच्छा हो जाता है लेकिन शांत संकेतों को पूरी तरह से अनदेखा कर देता है।
इस शोध पत्र के लेखकों ने इस समस्या को हल करने के लिए एक नया AI मॉडल बनाया है जिसे OmniSapiens-7B 2.0 कहा जाता है। इसे एक ऐसे "सामाजिक रूप से बुद्धिमान" मस्तिष्क के रूप में डिज़ाइन किया गया है जो भ्रमित हुए बिना या किसी एक तरफ झुके बिना एक साथ इन सभी विभिन्न कार्यों को संभाल सकता है।
समस्या: "रोते हुए बच्चे" का प्रभाव (The "Crying Baby" Effect)
यह शोध पत्र बताता है कि मौजूदा AI मॉडल संघर्ष करते हैं क्योंकि जिस डेटा से वे सीखते हैं वह विषम (heterogeneous) (मिश्रित और असमान) होता है।
- उपमा: कल्पना कीजिए कि एक कक्षा है जहाँ एक शिक्षक एक साथ 10 अलग-अलग विषय पढ़ाने की कोशिश कर रहा है। एक कोने में, एक छात्र गणित के सवाल का जवाब चिल्लाकर दे रहा है (एक बहुत ही आसान, तेज़ संकेत)। दूसरे कोने में, एक छात्र दुख के बारे में एक जटिल कविता फुसफुसा रहा है (एक कठिन, शांत संकेत)।
- परिणाम: एक मानक शिक्षक (या AI) पूरी तरह से चिल्लाने वाले छात्र पर ध्यान केंद्रित करेगा क्योंकि उस फीडबैक को सुनना सबसे आसान है। वे फुसफुसाने वाले छात्र को अनदेखा कर देंगे। AI के संदर्भ में, मॉडल आसान कार्यों में तो बहुत अच्छा हो जाता है लेकिन सूक्ष्म और जटिल कार्यों में विफल हो जाता है।
समाधान: "फेयरनेस कोच" (HARPO)
इसे ठीक करने के लिए, शोधकर्ताओं ने एक नई प्रशिक्षण पद्धति विकसित की जिसे HARPO (Heterogeneity-Aware Relative Policy Optimization) कहा जाता है।
- उपमा: HARPO को उस कक्षा में खड़े एक बहुत ही समझदार "फेयरनेस कोच" (निष्पक्षता प्रशिक्षक) के रूप में सोचें।
- सुनना: कोच हर छात्र के उत्तर को सुनता है।
- प्रयास को मापना: कोच गणना करता है कि प्रत्येक छात्र कितना "शोर" (या सीखने का संकेत) योगदान दे रहा है।
- आवाज़ का संतुलन बनाना: यदि गणित वाला छात्र बहुत ज़ोर से चिल्ला रहा है, तो कोच उसके माइक्रोफ़ोन को थोड़ा कम कर देता है। यदि कविता वाला छात्र बहुत धीरे फुसफुसा रहा है, तो कोच उसके माइक्रोफ़ोन को थोड़ा बढ़ा देता है।
- लक्ष्य: कोच यह सुनिश्चित करता है कि हर छात्र को पाठ को प्रभावित करने का समान अवसर मिले, चाहे वह कितना भी तेज़ या धीमा क्यों न हो।
तकनीकी शब्दों में, HARPO यह देखता है कि प्रत्येक विशिष्ट कार्य या डेटा सैंपल AI के सीखने में कितना योगदान देता है। फिर यह गणितीय रूप से शांत संकेतों की आवाज़ को बढ़ाता है और तेज़ संकेतों को कम करता है ताकि AI हर चीज़ से समान रूप से सीख सके।
परिणाम: एक ऑल-स्टार खिलाड़ी
शोध पत्र ने इस नए AI (OmniSapiens-7B 2.0) का परीक्षण 10 अलग-अलग व्यवहारिक कार्यों पर किया, जिसमें चिंता (anxiety) का पता लगाने से लेकर गैर-मौखिक इशारों (non-verbal gestures) को समझने तक शामिल हैं।
- स्कोरबोर्ड: OmniSapiens ने केवल जीत ही नहीं हासिल की; बल्कि इसने दबदबा बनाया। इसने एक साथ सभी 10 कार्यों पर सर्वश्रेष्ठ परिणाम प्राप्त किए।
- तुलना: अन्य शीर्ष AI मॉडलों की तुलना में, OmniSapiens समग्र रूप से 12% तक बेहतर था। इससे भी अधिक प्रभावशाली बात यह है कि जब AI का परीक्षण 5 बिल्कुल नए कार्यों (जैसे ऑटिज्म या गंभीर अवसाद का पता लगाना) पर किया गया, जो उसने पहले कभी नहीं देखे थे, तब भी इसने दूसरों से 9% तक बेहतर प्रदर्शन किया।
- "क्यों": शोध पत्र का सुझाव है कि क्योंकि "फेयरनेस कोच" (HARPO) ने यह सुनिश्चित किया कि AI शांत और कठिन संकेतों से सीखे, इसलिए AI ने मानव व्यवहार की गहरी और अधिक लचीली समझ विकसित की। इसने केवल तेज़ जवाबों को रटा नहीं; बल्कि इसने अंतर्निहित पैटर्न को सीखा।
बोनस: स्पष्ट सोच
शोध पत्र ने यह भी देखा कि AI कैसे सोचता है। जब किसी समस्या को हल करने के लिए कहा जाता है, तो AI अपने तर्क के चरणों को लिखता है (जैसे एक छात्र अपना काम दिखाकर समझाता है)।
- पुराने मॉडल: अक्सर लंबे, भ्रामक या उलझन भरे स्पष्टीकरण देते थे, या कभी-कभी बिना सोचे-समझे केवल अनुमान लगाते थे।
- OmniSasiens: इसने छोटे, स्पष्ट और अधिक सुसंगत तर्क प्रस्तुत किए। यह एक ऐसे छात्र की तरह था जिसने न केवल सही उत्तर दिया, बल्कि इसे तार्किक और संक्षिप्त रूप में समझाया भी। यह AI को वास्तविक दुनिया के उपयोग के लिए अधिक विश्वसनीय बनाता है।
सारांश
शोध पत्र का दावा है कि अलग-अलग सीखने के संकेतों के "वॉल्यूम" को संतुलित करने का एक नया तरीका (HARPO) आविष्कार करके, उन्होंने एक ऐसा AI (OmniSapiens-7B 2.0) बनाया है जो है:
- हर चीज़ में बेहतर: यह 10 विविध सामाजिक कार्यों में जीतता है।
- नई चीज़ों में बेहतर: यह उन कार्यों के लिए अच्छी तरह से सामान्यीकरण (generalize) करता है जिन्हें उसने पहले नहीं देखा है।
- अधिक स्पष्ट: यह पिछले मॉडलों की तुलना में अपने तर्क को बेहतर ढंग से समझाता है।
मुख्य निष्कर्ष यह है कि वास्तव में सामाजिक रूप से बुद्धिमान AI बनाने के लिए, आप केवल "तेज़" डेटा को हावी नहीं होने दे सकते; आपको एक ऐसी व्यवस्था की आवश्यकता है जो यह सुनिश्चित करे कि "फुसफुसाहट" को भी उतनी ही स्पष्टता से सुना जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।