💬 NLP

MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards

MemBuilder एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सिंथेटिक सत्र-स्तरीय प्रश्न निर्माण और योगदान-जागरूक ग्रेडिएंट वेटिंग के माध्यम से स्पार्स रिवार्ड्स (sparse rewards) और बहु-आयामी मेमोरी एट्रिब्यूशन को संबोधित करके LLMs में दीर्घकालिक संवाद निरंतरता को बढ़ाता है, जिससे एक 4B-पैरामीटर वाला मॉडल अत्याधुनिक क्लोज्ड-सोर्स बेसलाइनों को पीछे छोड़ने में सक्षम होता है।

Zhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao2026-04-21
💬 NLP

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

यह शोध पत्र HieroSA को प्रस्तुत करता है, जो एक सामान्यीकरण योग्य ढांचा (framework) है जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को भाषा-विशिष्ट पूर्व-ज्ञान या हस्तनिर्मित डेटा पर निर्भर रहे बिना, चित्रलिपि (hieroglyphic) और लोगोग्राफिक (logographic) वर्ण चित्रों से स्वतः ही व्याख्यात्मक, स्ट्रोक-स्तरीय संरचनात्मक निरूपण निकालने में सक्षम बनाता है।

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu2026-04-21
⚡ electrical engineering

Closing the Modality Reasoning Gap for Speech Large Language Models

यह शोध पत्र TARS को पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो स्पीच लार्ज लैंग्वेज मॉडल्स में स्पीच और टेक्स्ट इनपुट्स के बीच मोडैलिटी रीजनिंग गैप को प्रभावी ढंग से पाटने के लिए रिप्रेजेंटेशन और बिहेवियर अलाइनमेंट सिग्नल्स के साथ एसिमेट्रिक रिवॉर्ड डिज़ाइन का उपयोग करता है, जिससे चुनौतीपूर्ण बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu2026-04-21
🔭 astrophysics

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

यह शोध पत्र Spec-o3 को प्रस्तुत करता है, जो एक टूल-ऑगमेंटेड विजन-लैंग्वेज एजेंट है जो दुर्लभ खगोलीय पिंडों की जांच को स्वचालित करने के लिए दो-चरणीय प्रशिक्षण रणनीति और मल्टीमॉडल चेन-ऑफ-थॉट रीजनिंग का लाभ उठाता है, जिससे अत्याधुनिक प्रदर्शन और विभिन्न सर्वेक्षणों में मजबूत सामान्यीकरण प्राप्त होता है, जबकि यह मौजूदा डीप लर्निंग और प्रोप्राइटरी मॉडलों से काफी बेहतर प्रदर्शन करता है।

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao2026-04-21
💬 NLP

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

यह शोध पत्र एक फेस-ओनली काउंटरफैक्चुअल इवैल्यूएशन पैराडाइम और उसके अनुरूप FOCUS डेटासेट और REFLECT बेंचमार्क प्रस्तुत करता है ताकि वास्तविक दुनिया की छवियों में विजुअल कन्फाउंडर्स से जनसांख्यिकीय प्रभावों को अलग करके विजन-लैंग्वेज मॉडल्स में सामाजिक पूर्वाग्रह को कड़ाई से मापा जा सके।

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu2026-04-21
💬 NLP

Is Agentic RAG worth it? An experimental comparison of RAG approaches

यह शोध पत्र प्रदर्शन और लागत के बीच संतुलन के आधार पर सबसे प्रभावी डिज़ाइन चुनने के लिए व्यावहारिक मार्गदर्शन प्रदान करने हेतु कई परिदृश्यों में "एन्हांस्ड" (Enhanced) और "एजेंटिक" (Agentic) RAG प्रतिमानों का अनुभवजन्य मूल्यांकन और तुलना करता है।

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi2026-04-21
💬 NLP

Triples and Knowledge-Infused Embeddings for Clustering and Classification of Scientific Documents

यह अध्ययन ट्रांसफार्मर एम्बेडिंग्स और सब्जेक्ट-प्रेडिकेट-ऑब्जेक्ट ट्रिपल्स का उपयोग करके वैज्ञानिक दस्तावेज़ क्लस्टरिंग और वर्गीकरण के लिए एक मॉड्यूलर पाइपलाइन का मूल्यांकन करता है, जिसमें यह पाया गया है कि हालांकि संरचित ज्ञान सूचनात्मक है, केवल अमूर्त (abstract) टेक्स्ट प्रतिनिधित्व लगातार ज्ञान-युक्त वेरिएंट्स की तुलना में बेहतर प्रदर्शन करते हैं या उनके बराबर रहते हैं, जो यह दर्शाता है कि ट्रिपल-आधारित संवर्धन के लाभ सार्वभौमिक होने के बजाय अत्यधिक कॉन्फ़िगरेशन-निर्भर हैं।

Mihael Arcan2026-04-21
💬 NLP

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

यह शोध पत्र अलेक्जेंड्रिया (Alexandria) को प्रस्तुत करता है, जो एक बड़े पैमाने का, समुदाय-संचालित डेटासेट है जिसमें 13 देशों और 11 डोमेन के माध्यम से 107K समानांतर अंग्रेजी-क्षेत्रीय अरबी संवादात्मक टर्न शामिल हैं, जिसमें सूक्ष्म शहर-स्तरीय मेटाडेटा और लिंग संबंधी एनोटेशन दिए गए हैं, जिसे विविध अरबी बोलियों के लिए मशीन अनुवाद और एलएलएम (LLM) प्रदर्शन में सुधार करने के लिए डिज़ाइन किया गया है।

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan S (…)2026-04-21
💬 NLP

The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations

यह शोध पत्र GDN-CC डेटासेट और एक कॉर्पस क्लेरिफिकेशन (Corpus Clarification) ढांचे को प्रस्तुत करता है जो शोर वाले लोकतांत्रिक परामर्श डेटा को संरचित तर्कपूर्ण इकाइयों में मानकीकृत करने के लिए है, यह प्रदर्शित करते हुए कि छोटे, ओपन-वेट भाषा मॉडल इस प्रक्रिया को प्रभावी ढंग से स्वचालित कर सकते हैं और बड़े पैमाने पर राजनीतिक विश्लेषण को सक्षम कर सकते हैं।

Pierre-Antoine Lequeu, Léo Labat, Laurène Cave, Gaël Lejeune, François Yvon, Benjamin Piwowarski2026-04-21