💬 NLP

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

यह शोधपत्र रबाक बेंच (RabakBench) को प्रस्तुत करता है, जो सिंगापुर के भाषाई परिदृश्य के लिए एक मानव-इन-द-लूप द्वारा सत्यापित बहुभाषी सुरक्षा बेंचमार्क है, जो सिंग्लिश, चीनी, मलय और तमिल जैसी कम संसाधन वाली भाषाओं को संभालने में अत्याधुनिक एलएलएम (LLM) गार्डरेल्स के प्रदर्शन में महत्वपूर्ण अंतराल को प्रकट करता है।

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee2026-02-03
💬 NLP

AblationBench: Evaluating Automated Planning of Ablations in Empirical AI Research

यह शोध पत्र AblationBench प्रस्तुत करता है, जो अनुभवजन्य एआई अनुसंधान में एब्लेशन प्लानिंग कार्यों पर भाषा मॉडल एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क सुइट है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर मॉडल मनुष्यों की तुलना में काफी खराब प्रदर्शन करते हैं और एजेंट-आधारित दृष्टिकोणों की तुलना में चेन-ऑफ-थॉट प्रॉम्प्टिंग की बेहतर प्रभावशीलता को उजागर करता है।

Talor Abramovich, Gal Chechik2026-02-03
💬 NLP

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

यह शोध पत्र एक क्रॉस-लिंग्विस्टिक बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि प्रॉम्प्ट भाषाओं में व्याकरणिक लिंग, टेक्स्ट-टू-इमेज मॉडल के आउटपुट को संबंधित दृश्य लिंगों की ओर महत्वपूर्ण रूप से पक्षपाती बनाता है, जो यह प्रकट करता है कि केवल अर्थ संबंधी सामग्री के परे, भाषा की संरचना स्वयं एआई-जनित दृश्य प्रस्तुतियों को आकार देती है।

Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata2026-02-03
💬 NLP

Instructional Agents: Reducing Teaching Faculty Workload through Multi-Agent Instructional Design

यह शोध पत्र 'इंस्ट्रक्शनल एजेंट्स' (Instructional Agents) को प्रस्तुत करता है, जो एक मल्टी-एजेंट लार्ज लैंग्वेज मॉडल फ्रेमवर्क है जो भूमिका-आधारित सहयोग के माध्यम से एंड-टू-एंड पाठ्यक्रम सामग्री निर्माण को स्वचालित करता है, जिससे विविध विश्वविद्यालय पाठ्यक्रमों में शैक्षणिक गुणवत्ता बनाए रखते हुए संकाय कार्यभार को महत्वपूर्ण रूप से कम किया जाता है।

Huaiyuan Yao, Wanpeng Xu, Justin Turnau, Nadia Kellam, Hua Wei2026-02-03
💬 NLP

GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages

GemDetox सिस्टम, जो पैरामीटर-कुशल फाइन-ट्यूनिंग, फ्यू-शॉट प्रॉम्प्टिंग और रिट्रीवल-ऑगमेंटेड कॉन्टेक्स्ट द्वारा संवर्धित एक 12B-पैरामीटर जेम्मा-3 मॉडल का लाभ उठाता है, ने उच्च- और निम्न-संसाधन दोनों भाषाओं में विषाक्त टेक्स्ट को तटस्थ पैराफ्रेज में प्रभावी ढंग से पुनर्गठित करके CLEF 2025 टेक्स्टडिटॉक्स चुनौती में शीर्ष रैंकिंग प्राप्त की।

Trung Duc Anh Dang, Ferdinando Pio D'Elia2026-02-03
💬 NLP

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

यह शोध पत्र DRIFT को प्रस्तुत करता है, जो एक नवीन प्राथमिकता शिक्षण (preference learning) ढांचा है जो सकारात्मक उदाहरणों को गतिशील रूप से नमूना लेने के लिए प्रचुर वास्तविक दुनिया के उपयोगकर्ता असंतोष संकेतों का लाभ उठाता है, जिससे समाधान की विविधता को बनाए रखते हुए और ग्रेडिएंट क्षरण (gradient degeneration) से बचते हुए बेस मॉडल और मजबूत बेसलाइन की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng2026-02-03
💬 NLP

MARS: Co-evolving Dual-System Deep Research via Multi-Agent Reinforcement Learning

यह शोध पत्र MARS को प्रस्तुत करता है, जो एक नवीन मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) ढांचा है जो लार्ज रीजनिंग मॉडल्स की टोकन अक्षमता और ज्ञान संबंधी सीमाओं को दूर करने के लिए दोहरी संज्ञानात्मक प्रणालियों (त्वरित अंतर्ज्ञान और विचारशील तर्क) को सह-विकसित करता है, जिससे बिना सुपरवाइज्ड फाइन-ट्यूनिंग के ज्ञान-गहन कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Guoxin Chen, Zile Qiao, Wenqing Wang, Donglei Yu, Xuanzhong Chen, Hao Sun, Minpeng Liao, Kai Fan, Yong Jiang, Penguin Xi (…)2026-02-03
💬 NLP

WUGNECTIVES: Novel Entity Inferences of Language Models from Discourse Connectives

यह शोधपत्र WUGNECTIVES को प्रस्तुत करता है, जो एक ऐसा डेटासेट है जिसे यह मूल्यांकन करने के लिए डिज़ाइन किया गया है कि भाषा मॉडल विमर्श संयोजकों (discourse connectives) से नवीन संस्थाओं के गुणों का अनुमान कैसे लगाते हैं, जो यह प्रकट करता है कि जबकि ट्यूनिंग तर्क प्रदर्शन में सुधार करती है, मॉडल लगातार समझौतात्मक (concessive) संयोजकों के साथ संघर्ष करते हैं।

Daniel Brubaker, William Sheffield, Junyi Jessy Li, Kanishka Misra2026-02-03
💬 NLP

Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning

यह शोध पत्र HIES को प्रस्तुत करता है, जो एक एकीकृत प्रूनिंग मानदंड (pruning criterion) है जो ग्रेडिएंट-आधारित विधियों की सीमाओं को दूर करने के लिए हेड इम्पॉर्टेंस स्कोर्स (Head Importance Scores) को अटेंशन एंट्रॉपी (attention entropy) के साथ जोड़ता है, जिससे कुशल ट्रांसफॉर्मर संपीड़न (Transformer compression) के लिए मॉडल की गुणवत्ता और स्थिरता में महत्वपूर्ण सुधार प्राप्त होता है।

Minsik Choi, Hyegang Son, Changhoon Kim, Young Geun Kim2026-02-03