💬 NLP

Latent Collaboration in Multi-Agent Systems

यह शोध पत्र LatentMAS को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो मल्टी-एजेंट सिस्टम को साझा हिडन एम्बेडिंग के माध्यम से सीधे निरंतर लेटेंट स्पेस (continuous latent space) के भीतर सहयोग करने में सक्षम बनाता है, जिससे पारंपरिक टेक्स्ट-आधारित दृष्टिकोणों की तुलना में बेहतर तर्क प्रदर्शन, महत्वपूर्ण टोकन कमी और तेज़ इन्फरेंस प्राप्त होता है।

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He (…)2026-06-02
🤖 AI

LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services

यह शोध पत्र LocalSearchBench प्रस्तुत करता है, जो स्थानीय जीवन सेवाओं के जटिल और संदिग्ध डोमेन में एजेंटिक सर्च (agentic search) का मूल्यांकन करने के लिए पहला व्यापक बेंचमार्क और एकीकृत वातावरण है, जो यह प्रकट करता है कि अत्याधुनिक बड़े रीजनिंग मॉडल भी वास्तविक दुनिया के परिदृश्यों में मल्टी-हॉप रीजनिंग (multi-hop reasoning), पूर्णता और निष्ठा (faithfulness) में संघर्ष करते हैं।

Hang He, Chuhuai Yue, Chengqi Dong, Mingxue Tian, Hao Chen, Zhenfeng Liu, Jiajun Chai, Xiaohan Wang, Yufei Zhang, Qun Li (…)2026-06-02
💬 NLP

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning

यह शोधपत्र ReasonBench का परिचय देता है, जो एक ऐसा बेंचमार्क सुइट है जो यह प्रदर्शित करता है कि LLM तर्क प्रदर्शन बार-बार निष्पादन के दौरान महत्वपूर्ण, संरचित अस्थिरता प्रदर्शित करता है, जिससे यह तर्क दिया जाता है कि एकल-बिंदु मूल्यांकन अपर्याप्त हैं और गुणवत्ता, लागत एवं विश्वसनीयता के बीच के व्यापारों को सटीक रूप से पकड़ने के लिए वितरण-जागरूक मूल्यांकन की वकालत की जाती है।

Nearchos Potamitis, Vansh Ramani, Har Ashish Arora, Dhairya Kuchhal, Lars Klein, Akhil Arora2026-06-02
🤖 AI

On the Collapse of Generative Paths: A Criterion and Correction for Diffusion Steering

यह शोध पत्र "मार्जिनल पाथ कोलैप्स" (Marginal Path Collapse) को डिफ्यूजन मॉडल के इन्फरेंस-टाइम स्टीयरिंग में एक महत्वपूर्ण विफलता मोड के रूप में पहचानता है जो मिसमैच्ड नॉइज़ शेड्यूल्स या नेगेटिव एक्सपोनेंट्स के कारण होता है, और पाथ अस्तित्व की गणितीय गारंटी देने तथा ड्रग डिज़ाइन और इमेज जनरेशन जैसे जटिल कंपोजिशनल कार्यों में प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए 'एडैप्टिव पाथ करेक्शन विद एक्सपोनेंट्स' (ACE) फ्रेमवर्क का प्रस्ताव करता है।

Ziseok Lee, Minyeong Hwang, Wooyeol Lee, Sanghyun Jo, Jihyung Ko, Young Bin Park, Jae-Mun Choi, Eunho Yang, Kyungsu Kim2026-06-02✓ Author reviewed
🤖 AI

Calibrating Uncertainty for Zero-Shot Adversarial CLIP

यह शोधपत्र CLIP के लिए एक नवीन एडवरसैरियल फाइन-ट्यूनिंग पद्धति प्रस्तावित करता है जो आउटपुट्स को डिरिचलेट कंसंट्रेशन पैरामीटर्स के रूप में पुन: पैरामीटराइज करता है ताकि कैलिब्रेटेड अनसर्टेन्टी (अनिश्चितता) को बहाल करने और मजबूत ज़ीरो-शॉट सटीकता बनाए रखने को एक साथ सुलभ बनाया जा सके, जो उस महत्वपूर्ण समस्या का समाधान करता है जहाँ एडवरसैरियल परटर्बेशन्स आमतौर पर अनसर्टेन्टी को दबा देते हैं और ओवर-कॉन्फिडेंस का कारण बनते हैं।

Wenjing Lu, Zerui Tao, Yuning Qiu, Dongping Zhang, Yang Yang, Qibin Zhao2026-06-02
💬 NLP

Uncovering Competency Gaps in Large Language Models and Their Benchmarks

यह शोध पत्र स्पार्स ऑटोएन्कोडर कॉन्सेप्ट एक्टिवेशन्स का उपयोग करने वाली एक अनसुपरवाइज्ड विधि प्रस्तुत करता है जो "मॉडल गैप्स" (लार्ज लैंग्वेज मॉडल्स की विशिष्ट कमजोरियां) और "बेंचमार्क गैप्स" (कवरेज असंतुलन) दोनों को स्वचालित रूप से पहचानने और विघटित करने के लिए, मौजूदा मानकीकृत बेंचमार्क के पूरक के रूप में एक सूक्ष्म, कॉन्सेप्ट-स्तरीय मूल्यांकन प्रदान करता है।

Maty Bohacek, Nino Scherrer, Nicholas Dufour, Thomas Leung, Christoph Bregler, Stephanie C. Y. Chan2026-06-02
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

यह शोध पत्र AdvGame प्रस्तुत करता है, जो एक नवीन सुरक्षा संरेखण (safety alignment) प्रतिमान है जो एक हमलावर (Attacker) और एक रक्षक (Defender) भाषा मॉडल के बीच की अंतःक्रिया को प्राथमिकता-आधारित पुरस्कारों के साथ ऑनलाइन सुदृढीकरण शिक्षण (online reinforcement learning) के माध्यम से प्रशिक्षित एक गैर-शून्य-योग खेल (non-zero-sum game) के रूप में रूपायित करता है, जिसके परिणामस्वरूप एक अधिक सुदृढ़ और सहायक रक्षक के साथ-साथ एक शक्तिशाली सामान्य-उद्देश्य वाला रेड-टीमिंग एजेंट प्राप्त होता है।

Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov2026-06-02
🤖 machine learning

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

यह शोध पत्र "अवतार फॉरसिंग" (Avatar Forcing) प्रस्तुत करता है, जो एक रियल-टाइम इंटरैक्टिव हेड अवतार फ्रेमवर्क है, जो मल्टीमॉडलल यूजर इनपुट्स के प्रति लो-लेटेंसी, अभिव्यंजक और भावनात्मक रूप से आकर्षक अवतार प्रतिक्रियाएं उत्पन्न करने के लिए डिफ्यूजन फॉरसिंग और लेबल-फ्री डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन का उपयोग करता है।

Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang2026-06-02
🤖 AI

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

यह शोधपत्र VLM4VLA को प्रस्तुत करता है, जो एक न्यूनतम अनुकूलन पाइपलाइन है और यह प्रदर्शित करता है कि हालांकि विजन-लैंग्वेज मॉडल (VLM) का प्रारंभिक अवस्था (initialization) डाउनस्ट्रीम विजन-लैंग्वेज-एक्शन (VLA) नीतियों को लाभान्वित करता है, फिर भी सामान्य VLM सक्षमता और विशिष्ट एम्बोडीड (embodied) कौशल में सुधार, नियंत्रण प्रदर्शन के खराब भविष्यवक्ता हैं, जो यह प्रकट करता है कि एक्शन प्लानिंग के साथ विजुअल मॉड्यूल का डोमेन गैप ही प्राथमिक बाधा है।

Jianke Zhang, Xiaoyu Chen, Qiuyue Wang, Mingsheng Li, Yanjiang Guo, Yucheng Hu, Jiajun Zhang, Shuai Bai, Junyang Lin, Ji (…)2026-06-02
🤖 AI

Physics-Encoded Inverse Modeling for Arctic Snow Depth Prediction

यह शोध पत्र PhysE-Inv प्रस्तुत करता है, जो एक नवीन ढांचा है जो विरल अवलोकनों से आर्कटिक हिम गहराई (स्नो डेप्थ) की सटीक भविष्यवाणी करने के लिए डीप सीक्वेंशियल लर्निंग को फिजिक्स-इन्फॉर्म्ड इन्फरेंस और कॉन्ट्रास्टिव रेगुलराइजेशन के साथ संयोजित करता है, जो पुनर्निर्माण और पैरामीटर अनुमान दोनों कार्यों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Akila Sampath, Vandana Janeja, Jianwu Wang2026-06-02