💬 NLP

Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense

मेम्ब्रेन (Membrane) एक स्व-विकसित गार्डरेल है जो एक कंट्रास्टिव सेफ्टी मेमोरी (Contrastive Safety Memory) का उपयोग करता है ताकि हानिकारक प्रश्नों को उनके हानिरहित समकक्षों के साथ गतिशील रूप से जोड़ा जा सके, जिससे विकसित होते हुए जेलब्रेक्स के विरुद्ध सटीक, अनुकूलन योग्य रक्षा सक्षम होती है और मौजूदा तरीकों की तुलना में गलत इनकार (false refusals) को काफी कम किया जा सके।

Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak2026-06-05
💬 NLP

PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models

यह शोध पत्र PlanBench-V प्रस्तुत करता है, जो कि पेशेवर मानचित्र व्याख्या में विजन-लैंग्वेज मॉडल्स (Vision-Language Models) की क्षमताओं का आकलन करने के लिए 223 स्थानिक नियोजन मानचित्रों और 1,629 प्रश्न-उत्तर युग्मों के एक विशेषज्ञ-एनोटेटेड डेटासेट के साथ-साथ एक चार-चरणीय मूल्यांकन ढांचे वाला पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि हाल के मॉडल्स ने महत्वपूर्ण प्रगति दिखाई है, फिर भी वे जटिल, नीति-संवेदनशील निर्णय लेने वाले कार्यों में संघर्ष करते हैं।

Minxin Chen, He Zhu, Junyou Su, Wen Wang, Yijie Deng, Wenjia Zhang2026-06-05
💬 NLP

MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

MARDoc एक मेमोरी-अवेयर रिफाइनमेंट एजेंट फ्रेमवर्क है जो मल्टीमॉडल लॉन्ग-डॉक्यूमेंट QA को बेहतर बनाने के लिए प्रक्रिया को विशेषीकृत एक्सप्लोरर (Explorer), रिफाइनर (Refiner) और रिफ्लेक्टर (Reflector) एजेंटों में विभाजित करता है जो संदर्भ शोर (context noise) को कम करने और मल्टी-हॉप रीजनिंग को बढ़ाने के लिए एक गतिशील रूप से अपडेट की जाने वाली स्ट्रक्चर्ड मेमोरी का उपयोग करते हैं।

Kaifeng Chen, Hongtao Liu, Qiyao Peng, Jian Yang, Yongqiang Liu, Xiaochen Zhang, Qing Yang2026-06-05
🤖 AI

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

यह शोध पत्र SubtleMemory प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसे जटिल, दीर्घकालिक इंटरैक्शन इतिहास के भीतर सूक्ष्म संबंधात्मक स्मृति संरचनाओं (fine-grained relational memory structures) के बीच अंतर करने की दीर्घ-क्षितिज (long-horizon) AI एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि विविध मेमोरी आर्किटेक्चर पर व्यापक परीक्षण के बावजूद वर्तमान प्रणालियाँ इस महत्वपूर्ण क्षमता के साथ संघर्ष करती हैं।

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang2026-06-05
💬 NLP

CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

यह शोध पत्र CollabBench प्रस्तुत करता है, जो एक नवीन बेंचमार्क और प्रशिक्षण ढांचा है जो सहकारी गेम वातावरण में LLM एजेंटों की सहयोगात्मक दक्षता और भावात्मक अनुकूलन को महत्वपूर्ण रूप से बढ़ाने के लिए विविध प्लेयर सिमुलेशन और हाइब्रिड रिवॉर्ड ऑप्टिमाइज़ेशन का लाभ उठाता है।

Hong Qian, Yuanhao Liu, Zihan Zhou, Zongbao Zhang, Hanjie Ge, Haotian Shi, Liang Dou, Xiangfeng Wang, Jingwen Yang, Aimi (…)2026-06-05
💬 NLP

CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction

यह शोधपत्र CaliDist को प्रस्तुत करता है, जो एक नवीन पोस्ट-हॉक कैलिब्रेशन विधि है जो मॉडल के व्यवहार संबंधी अस्थिरता (जो सिमेंटिक डिस्ट्रैक्शन के संपर्क में आने पर उत्पन्न होती है) के आधार पर कॉन्फिडेंस स्कोर को दंडित करके लार्ज लैंग्वेज मॉडल की विश्वसनीयता में सुधार करती है, जिससे कई बेंचमार्क में कैलिब्रेशन एरर में महत्वपूर्ण रूप से कमी आती है।

Mohammad Anas Jawad, Cornelia Caragea2026-06-05
🤖 AI

Statistical Priors for Implicit Preferences: Decoupling Skill Selection as a Local Harness in Personal Agents

यह शोध पत्र एक हल्का स्थानीय वरीयता हारनेस (lightweight local preference harness) प्रस्तावित करता है जो सांख्यिकीय वरीयता शिक्षण को सिमेंटिक इंटेंट पार्सिंग से अलग करता है ताकि स्थानीय रूप से तैनात व्यक्तिगत एजेंट प्रभावी रूप से निहित उपयोगकर्ता वरीयताओं के अनुकूल हो सकें और कौशल चयन में पारंपरिक मेमोरी-ऑगमेंटेड एजेंटों से बेहतर प्रदर्शन कर सकें।

Zeyu Gan, Huayi Tang, Yong Liu2026-06-05
💬 NLP

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

यह शोध पत्र प्रकट करता है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स फंक्शनल स्पैरसिटी (functional sparsity) पर निर्भर करते हैं, जहाँ 'CoRe हेड्स' नामक अटेंशन हेड्स का एक विशिष्ट उपसमूह क्वेरी-प्रासंगिक विजुअल फीचर्स को निकालने के लिए महत्वपूर्ण है, जैसा कि उनके एब्लेशन (ablation) के दौरान प्रदर्शन पर पड़ने वाले महत्वपूर्ण प्रभाव और इन्फरेंस को तेज करने की उनकी क्षमता से प्रदर्शित होता है।

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang2026-06-05
💬 NLP

Forgive or forget: Understanding the context of hate in audio retrieval systems

यह शोध पत्र "फॉरगिव ऑर फॉरगेट" (Forgive or Forget) नामक एक मॉडल-अज्ञेय (model-agnostic), पोस्ट हॉक (post hoc) कारण संबंधी डिबायसिंग फ्रेमवर्क का प्रस्ताव करता है जो टेक्स्ट-टू-ऑडियो सिस्टम में सिमेंटिक प्रासंगिकता को बनाए रखते हुए और सटीकता की हानि को न्यूनतम करते हुए, टॉक्सिक ऑडियो रिट्रीवल को प्रभावी ढंग से दबाने के लिए एक सेंटीमेंट-नियंत्रित मीडिएटर का उपयोग करता है।

Arghya Pal, Sailaja Rajanala, Raphael C. -W. Phan, Shekhar Nayak2026-06-05
💬 NLP

YouZhi: Towards High-Concurrency Financial LLMs via Adaptive GQA-to-MLA Transition

YouZhi एक हाई-कन्करेंसी फाइनेंशियल LLM है जो हुआवेई एस्केंड (Huawei Ascend) इकोसिस्टम पर निर्मित है, जो लेयर-एडेप्टिव GQA-टू-MLA ट्रांज़िशन फ्रेमवर्क और विशेष प्रशिक्षण का उपयोग करता है ताकि KV-कैशे मेमोरी ओवरहेड को महत्वपूर्ण रूप से कम किया जा सके, जिससे बेस मॉडल्स की तुलना में वित्तीय बेंचमार्क सटीकता और अधिकतम इन्फरेंस कन्करेंसी दोनों में पर्याप्त सुधार प्राप्त होता है।

PSBC LLM Team, Huawei LLM Team, Ruihan Long, Junjie Wu, Tianan Zhang, Duo Zhang, Yaozong Wu, Jinbin Fu, Chang Liu, Zhen (…)2026-06-05