💬 NLP

Measuring Maximum Activations in Open Large Language Models

यह शोध पत्र 27 आधुनिक ओपन एलएलएम (LLM) चेकपॉइंट्स में अधिकतम सक्रियण परिमाणों (activation magnitudes) का एक व्यापक मापन प्रस्तुत करता है, जो यह प्रकट करता है कि शिखर मान पैरामीटर संख्या के बजाय मॉडल परिवार और आर्किटेक्चर के आधार पर लगभग चार क्रमों (orders of magnitude) तक भिन्न होते हैं, जिसमें MoE मॉडल अपने डेंस (dense) समकक्षों की तुलना में काफी कम शिखर प्रदर्शित करते हैं, जिससे अधिकतम सक्रियण को एक महत्वपूर्ण, गैर-एकदिष्ट (non-monotonic) गुण के रूप में स्थापित किया गया है जिसे स्थिर लो-बिट क्वांटाइजेशन सुनिश्चित करने के लिए रिपोर्ट किया जाना चाहिए।

Luxuan Chen, Han Tian, Xinran Chen, Rui Kong, Fang Wang, Jiamin Chen, Yuchen Li, Jiashu Zhao, Shuaiqiang Wang, Haoyi Xio (…)2026-05-18
💬 NLP

Calibrating LLMs with Semantic-level Reward

यह शोध पत्र कैलिब्रेशन विद सिमेंटिक रिवॉर्ड (CSR) का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो असंगत मौखिक रूप से व्यक्त किए गए आत्मविश्वास स्कोर के स्थान पर एक अर्थगत-स्तर (semantic-level) के रिवॉर्ड का उपयोग करके लार्ज लैंग्वेज मॉडल्स के अनिश्चितता कैलिब्रेशन में सुधार करता है, जो सही आउटपुट्स के बीच सहमति को प्रोत्साहित करता है और गलत आउटपुट्स के बीच बना हुआ बनावटी सामंजस्य को हतोत्साहित करता है, जिससे विभिन्न बेंचमार्क पर काफी कम त्रुटि दर और उच्च विश्वसनीयता प्राप्त होती है।

Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu2026-05-18
💬 NLP

VSPO: Vector-Steered Policy Optimization for Behavioral Control

यह शोध पत्र वेक्टर-स्टीयर्ड पॉलिसी ऑप्टिमाइज़ेशन (VSPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो रोलआउट सैंपलिंग के दौरान व्यवहारिक तीव्रता को नियंत्रित करने के लिए स्टीयरिंग वेक्टर्स का उपयोग करने हेतु GRPO को संशोधित करती है, जिससे स्पार्स रिवॉर्ड बॉटलनैक्स (sparse reward bottlenecks) कम होते हैं और कई रीजनिंग बेंचमार्क पर बेहतर व्यवहारिक नियंत्रण और कार्य सटीकता प्राप्त करने के लिए पॉलिसी ऑप्टिमाइज़ेशन को प्रमाणित रूप से त्वरित किया जाता है।

Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak2026-05-18
💬 NLP

Dynamic Chunking for Diffusion Language Models

यह शोध पत्र डायनेमिक चंकिंग डिफ्यूजन मॉडल (DCDM) को प्रस्तुत करता है, जो डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स की दक्षता और प्रदर्शन में सुधार करने के लिए एक डिफरेंशिएबल चंकिंग अटेंशन मैकेनिज्म के माध्यम से कठोर पोजीशनल ब्लॉक्स को सीखने योग्य, कंटेंट-डिफाइंड सिमेंटिक चंक्स से बदल देता है।

Yichen Zhu, Xiaoming Shi, Peng Zhao, Weiyu Chen, Debing Zhang, James Kwok2026-05-18
💬 NLP

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

यह शोध पत्र VCG-Bench प्रस्तुत करता है, जो एक एकीकृत बेंचमार्क और "Diagram-as-Code" प्रतिमान है जो पिक्सेल-आधारित संश्लेषण की सीमाओं को दूर करने के लिए mxGraph XML का उपयोग करता है, जिससे संरचित आरेख निर्माण और संपादन कार्यों पर विजन-लैंग्वेज मॉडल्स (Vision-Language Models) का आकलन करने के लिए एक वर्गीकृत डेटासेट और अनुकूलित मूल्यांकन प्रोटोकॉल प्रदान किया जाता है।

Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang (…)2026-05-18
🧬 biology

Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries

यह अध्ययन प्रदर्शित करता है कि फ्यू-शॉट प्रॉम्प्टेड लार्ज लैंग्वेज मॉडल्स, विशेष रूप से क्लॉड हाइकू 4.5, कम-संसाधन वाली स्थितियों में ऑनलाइन रोगी पूछताछ को उपयुक्त नैदानिक अनुवर्ती स्तरों पर रूट करने के लिए बायोबर्ट जैसे सुपरवाइज्ड बेसलाइन्स से बेहतर प्रदर्शन कर सकते हैं, हालांकि उनकी प्रदर्शन परिवर्तनशीलता यह सुझाव देती है कि वे स्वायत्त तैनाती के बजाय चयनात्मक मानव समीक्षा का समर्थन करने के लिए सबसे उपयुक्त हैं।

Liqi Zhou, Jiafu Li2026-05-18✓ Author reviewed
💬 NLP

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

यह शोध पत्र ASRU का प्रस्ताव करता है, जो एक नियंत्रणीय मल्टीमॉडल अनलर्निंग फ्रेमवर्क है जो संवेदनशील क्रॉस-मोडल जानकारी को प्रभावी ढंग से हटाने के साथ-साथ जनरेशन की गुणवत्ता में उल्लेखनीय सुधार करने और मॉडल उपयोगिता को बनाए रखने के लिए एक्टिवेशन स्टीयरिंग को सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) के साथ जोड़ता है।

Jiahui Guang, Yingjie Zhu, Cuiyun Gao, Haiyan Wang, Jing Li, Di Shao, Zhaoquan Gu2026-05-18
💬 NLP

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

यह शोधपत्र SMMBench प्रस्तुत करता है, जो विषम और स्वतंत्र रूप से उत्पन्न स्रोतों में बिखरी हुई साक्ष्यों को खोजने, संरेखित करने और संयोजित करने की मल्टीमॉडल एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान प्रणालियाँ इस महत्वपूर्ण स्रोत-वितरित स्मृति क्षमता (source-distributed memory capability) के साथ संघर्ष करती हैं।

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zha (…)2026-05-18
🤖 AI

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

यह शोध पत्र NudgeRL प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो महंगी ओरेकलल सुपरविजन (oracle supervision) या ब्रूट-फोर्स स्केलिंगिंग (brute-force scaling) पर निर्भर हुए बिना, गणितीय बेंचमार्क पर तर्क क्षमता (reasoning capabilities) को कुशलतापूर्वक सुधारने के लिए स्ट्रैटेजी-गाइडेड (strategy-guided), डाइवर्सिटी-ड्रिवन (diversity-driven) एक्सप्लोरेशन का उपयोग करके वेरिफिएबल रिवार्ड्स के साथ रिइन्फोर्समेंट लर्निंग (RLVR) को बढ़ाता है।

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang2026-05-18
💬 NLP

DimMem: Dimensional Structuring for Efficient Long-Term Agent Memory

यह शोध पत्र DimMem को प्रस्तुत करता है, जो एक हल्का आयामी मेमोरी फ्रेमवर्क (dimensional memory framework) है जो एजेंट की यादों को स्पष्ट फ़ील्ड्स के साथ परमाणु, प्रकारित इकाइयों (atomic, typed units) में व्यवस्थित करता है ताकि मौजूदा प्रणालियों की तुलना में दीर्घकालिक रिकॉल में बेहतर सटीकता और दक्षता प्राप्त की जा सके, जबकि यह भी प्रदर्शित करता है कि कॉम्पैक्ट मॉडल इस निष्कर्षण स्कीमा (extraction schema) को प्रभावी ढंग से सीख सकते हैं।

Wentao Qiu, Haotian Hu, Fanyi Wang, Jinwei Kong, Yu Zhang2026-05-18