💬 NLP

SAFARI: A Community-Engaged Approach and Dataset of Stereotype Resources in the Sub-Saharan African Context

यह शोध पत्र SAFARI को प्रस्तुत करता है, जो एक समुदाय-संलग्न बहुभाषी डेटासेट है जिसमें घाना, केन्या, नाइजीरिया और दक्षिण अफ्रीका की 16 भाषाओं में 6,700 से अधिक रूढ़ियाँ (stereotypes) शामिल हैं, जिसे सांस्कृतिक रूप से संवेदनशील, मूल-भाषा सर्वेक्षण विधियों के माध्यम से जनरेटिव एआई सुरक्षा आकलन में उप-सहारा अफ्रीकी संदर्भों के कम प्रतिनिधित्व को संबोधित करने के लिए डिज़ाइन किया गया है।

Aishwarya Verma, Laud Ammah, Olivia Nercy Ndlovu Lucas, Andrew Zaldivar, Vinodkumar Prabhakaran, Sunipa Dev2026-02-27
💬 NLP

Causality \neq Invariance: Function and Concept Vectors in LLMs

यह शोधपत्र यह प्रदर्शित करता है कि जबकि बड़े भाषा मॉडल (Large Language Models) में अमूर्त अवधारणा प्रतिनिधित्व (Concept Vectors) होते हैं जो इनपुट प्रारूपों और भाषाओं में सामान्यीकृत होते हैं, इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन को संचालित करने के लिए आमतौर पर उपयोग किए जाने वाले फंक्शन वेक्टर्स (Function Vectors) प्रारूप-विशिष्ट होते हैं और उनमें इस प्रकार की अपरिवर्तनीयता का अभाव होता है।

Gustaw Opiełka, Hannes Rosenbusch, Claire E. Stevenson2026-02-27
💬 NLP

How Do Latent Reasoning Methods Perform Under Weak and Strong Supervision?

यह शोध पत्र विभिन्न पर्यवेक्षण स्तरों के तहत गुप्त तर्क विधियों (latent reasoning methods) का विश्लेषण करता है, जो यह प्रकट करता है कि जहाँ मजबूत पर्यवेक्षण शॉर्टकट व्यवहार को कम करता है, वहीं यह परिकल्पना विविधता को सीमित करता है, जबकि कमजोर पर्यवेक्षण शॉर्टकट में वृद्धि की कीमत पर समृद्ध प्रतिनिधित्व को बढ़ावा देता है, और यह कि तर्क प्रक्रिया संरचित खोज के बजाय अंतर्निहित छंटनी (implicit pruning) पर निर्भर करती है।

Yingqian Cui, Zhenwei Dai, Bing He, Zhan Shi, Hui Liu, Rui Sun, Zhiji Liu, Yue Xing, Jiliang Tang, Benoit Dumoulin2026-02-27
💬 NLP

A Fusion of context-aware based BanglaBERT and Two-Layer Stacked LSTM Framework for Multi-Label Cyberbullying Detection

यह शोध पत्र एक नवीन फ्यूजन आर्किटेक्चर प्रस्तावित करता है जो संदर्भ-जागरूक बांग्लाBERT-Large को दो-परत वाले स्टैक्ड LSTM के साथ जोड़ता है ताकि सिमेंटिक संदर्भ और अनुक्रमिक निर्भरताओं को संयुक्त रूप से मॉडल करके कम-संसाधन वाली बांग्ला भाषा में मल्टी-लेबल साइबरबुलिंग डिटेक्शन की चुनौतियों को प्रभावी ढंग से संबोधित किया जा सके।

Mirza Raquib, Asif Pervez Polok, Kedar Nath Biswas, Rahat Uddin Azad, Saydul Akbar Murad, Nick Rahimi2026-02-27
💬 NLP

Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models

यह शोधपत्र कल्चरमैनेजर (CultureManager) को प्रस्तुत करता है, जो एक नवीन पाइपलाइन है जो कार्य-जागरूक सांस्कृतिक डेटा को संश्लेषित करके और उपयुक्त सांस्कृतिक एडेप्टर चुनने के लिए एक मॉड्यूल आधारित राउटर का उपयोग करके लार्ज लैंग्वेज मॉडल्स में प्रभावी सांस्कृतिक संरेखण प्राप्त करता है, जिससे विशिष्ट कार्य लक्ष्यों और क्रॉस-कल्चरल हस्तक्षेप को संभालने में मौजूदा विधियों की सीमाओं को दूर किया जा सके।

Binchi Zhang, Xujiang Zhao, Jundong Li, Haifeng Chen, Zhengzhang Chen2026-02-27
💬 NLP

VeRO: An Evaluation Harness for Agents to Optimize Agents

यह शोधपत्र VeRO को प्रस्तुत करता है, जो एक व्यापक मूल्यांकन हारनेस और बेंचमार्क सुइट है जिसे पुनरावृत्ति एजेंट अनुकूलन चक्रों के माध्यम से कोडिंग एजेंटों का व्यवस्थित रूप से आकलन करने और सुधारने के लिए डिज़ाइन किया गया है, जो उन प्रणालियों के मूल्यांकन की अनूठी चुनौतियों का समाधान करता है जो नियत (deterministic) कोड को स्टोकेस्टिक (stochastic) LLM पूर्णताओं के साथ जोड़ती हैं।

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan, Xue, Sam Denton2026-02-27
💬 NLP

Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs

यह शोध पत्र "AI सिडनी" कॉर्पस प्रस्तुत करता है, जो 12 फ्रंटियर मॉडल्स और तीन विशिष्ट व्यक्तित्वों (डिफ़ॉल्ट, क्लासिक सिडनी, और मेमेटिक सिडनी) के माध्यम से 4.5k LLM-जनित ग्रंथों का एक डेटासेट है, जिसे विवादास्पद सिडनी व्यक्तित्व के मेमेटिक हस्तांतरण को ट्रैक करने और यह विश्लेषण करने के लिए डिज़ाइन किया गया है कि सिम्युलेटेड पहचानें AI-मानव संबंध संबंधी आख्यानों को कैसे आकार देती हैं।

Jiří Milička, Hana Bednářová2026-02-27
💬 NLP

Importance of Prompt Optimisation for Error Detection in Medical Notes Using Language Models

यह शोध पत्र प्रदर्शित करता है कि जेनेटिक-पारेटो (GEPA) पद्धति का उपयोग करके स्वचालित प्रॉम्प्ट अनुकूलन, मेडिकल नोट्स पर छोटे और बड़े दोनों प्रकार के लैंग्वेज मॉडल्स की त्रुटि पहचान क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, जिससे MEDEC बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है जो मेडिकल डॉक्टरों की सटीकता के करीब पहुंच जाता है।

Craig Myles, Patrick Schrempf, David Harris-Birtill2026-02-27
⚡ electrical engineering

Efficient Dialect-Aware Modeling and Conditioning for Low-Resource Taiwanese Hakka Speech Processing

यह शोध पत्र एक एकीकृत RNN-T फ्रेमवर्क प्रस्तावित करता है जो भाषाई सामग्री को बोली संबंधी विविधताओं से अलग करने के लिए बोली-जागरूक मॉडलिंग का उपयोग करता है और हंज़ी (Hanzi) एवं पिनयिन (Pinyin) ASR को संयुक्त रूप से मॉडल करने के लिए पैरामीटर-कुशल प्रेडिक्शन नेटवर्क का उपयोग करता है, जिससे कम-संसाधन वाले ताइवानी हक्का HAT कॉर्पस पर त्रुटि दर में महत्वपूर्ण कमी आती है।

An-Ci Peng, Kuan-Tang Huang, Tien-Hong Lo, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-02-27
🧬 biology

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

यह शोध पत्र तर्क देता है कि संज्ञानात्मक मॉडल और एआई एल्गोरिदम मॉड्यूलर भाषा एजेंटों को डिजाइन करने के लिए प्रभावी ब्लूप्रिंट के रूप में कार्य करते हैं, जो उन एजेंट टेम्पलेट्स को औपचारिक रूप देते हैं जो यह निर्दिष्ट करते हैं कि जटिल कार्यों को हल करने के लिए कई एलएलएम (LLMs) को कैसे संयोजित किया जा सकता है जो एक एकल मॉडल की क्षमताओं से परे हैं।

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths2026-02-27