💬 NLP

DECOR: Auditing LLM Deception via Information Manipulation Theory

यह शोध पत्र DECOR प्रस्तुत करता है, जो सूचना हेरफेर सिद्धांत (Information Manipulation Theory) पर आधारित एक मल्टी-एजेंट फ्रेमवर्क है, जो प्रतिक्रियाओं को परमाणु इकाइयों (atomic units) में विभाजित करके और उन्हें हेरफेर के चार आयामों में स्कोर करके, LLM धोखे (deception) के स्टेट-ऑफ-द-आर्ट, व्याख्या योग्य सूक्ष्म ऑडिटिंग को प्राप्त करता है।

Linyue Cai, Samuel Yeh, Jwala Dhamala, Rahul Gupta, Sharon Li2026-05-20
💬 NLP

OpenCompass: A Universal Evaluation Platform for Large Language Models

यह शोध पत्र OpenCompass को प्रस्तुत करता है, जो एक ओपन-सोर्स, स्केलेबल और उच्च-समानांतरता (high-concurrency) वाला मूल्यांकन मंच है, जिसे विविध डोमेन में बड़े भाषा मॉडलों के व्यापक और कुशल मूल्यांकन के लिए एक मॉड्यूलर, एकीकृत ढांचे के माध्यम से पारंपरिक स्थिर बेंचमार्क की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है।

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi (…)2026-05-20
💬 NLP

Language models struggle with compartmentalization

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल अक्सर एक ही अंतर्निहित अवधारणा (जैसे कि विभिन्न भाषाएँ या प्रोग्रामिंग प्रतिमान) की अलग-अलग प्रस्तुतियों को साझा आंतरिक निरूपणों में एकीकृत करने में विफल रहते हैं, जिससे अनावश्यक शिक्षण, कम नमूना दक्षता और अवधारणा प्रस्तुतियों की संख्या के आधार पर हस्तक्षेप प्रभावशीलता में एक चरण संक्रमण (फेज ट्रांजिशन) होता है।

Thomas Vincent Howe, David Wingate2026-05-20
💬 NLP

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

यह शोधपत्र STAR-PólyaMath को प्रस्तुत करता है, जो एक निरंतर मेटा-स्ट्रैटेजिस्ट (Meta-Strategist) और संरचित रीज़नर-वेरिफायर (Reasoner-Verifier) लूप्स वाला एक मल्टी-एजेंट फ्रेमवर्क है, जो मेटा-स्तरीय पर्यवेक्षण के माध्यम से मतिभ्रम (hallucination), मेमोरी विखंडन (memory fragmentation) और टूल के दुरुपयोग को प्रभावी ढंग से कम करके आठ शीर्ष-स्तरीय गणितीय बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong2026-05-20
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

यह शोध पत्र HalluWorld को प्रस्तुत करता है, जो भाषा मॉडलों में मतिभ्रम (hallucinations) का व्यवस्थित रूप से मूल्यांकन और वर्गीकरण करने के लिए स्पष्ट संदर्भ विश्व मॉडलों (reference world models) का उपयोग करने वाला एक नियंत्रित बेंचमार्क है, जो यह प्रकट करता है कि जबकि संवेदी त्रुटियाँ (perceptual errors) काफी हद तक हल हो गई हैं, बहु-चरणीय अवस्था ट्रैकिंग (multi-step state tracking), कारण सिमुलेशन (causal simulation) और परहेज (abstention) में चुनौतियाँ बनी हुई हैं।

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng2026-05-20
💬 NLP

Retrieval-Augmented Linguistic Calibration

यह शोधपत्र रिट्रीवल-ऑगमेंटेड लिंग्विस्टिक कैलिब्रेशन (RALC) प्रस्तुत करता है, जो एक पोस्ट-हॉक फ्रेमवर्क है जो भाषाई आत्मविश्वास को एक संभाव्यता वितरण के रूप में मॉडल करता है और विविध लार्ज लैंग्वेज मॉडल्स में प्राकृतिक भाषा के कथनों की निष्ठा और अंशांकन (कैलिब्रेशन) में महत्वपूर्ण सुधार करने के लिए रिट्रीवल-ऑगमेंटेड रीराइटिंग का उपयोग करता है।

Yi-Fan Yeh, Linwei Tao, Minjing Dong, Tao Huang, Jialin Yu, Philip Torr, Chang Xu2026-05-20
💬 NLP

IMLJD: A Computational Dataset for Indian Matrimonial Litigation Analysis

यह शोध पत्र IMLJD को प्रस्तुत करता है, जो सुप्रीम कोर्ट और कर्नाटक हाई कोर्ट (2000-2024) के 3,613 भारतीय वैवाहिक मुकदमेबाजी संबंधी निर्णयों से बना एक खुला कम्प्यूटेशनल डेटासेट है, जो दोनों न्यायालयों के बीच क्वैशिंग याचिका (quashing petition) की सफलता दर में एक महत्वपूर्ण असमानता के साथ-साथ कानूनी विश्लेषण के लिए संरचित मेटाडेटा और एक नॉलेज ग्राफ को प्रकट करता है।

Joy Bose2026-05-20
💬 NLP

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

यह शोध पत्र PAVE को प्रस्तुत करता है, जो एक नवीन चार-मॉड्यूल वाला संज्ञानात्मक आर्किटेक्चर है जो जनरेटिव एजेंटों को संरचित, व्याख्या योग्य और तर्कसंगत निर्णय लेने में सक्षम बनाता है ताकि वे केवल आपातकालीन ट्रिगर्स द्वारा सख्ती से न्यायसंगत होने पर ही नियमों का वैध रूप से उल्लंघन कर सकें, जबकि अधिकार के प्रति सम्मान और सीमित दायरे को बनाए रखें।

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel2026-05-20
💬 NLP

LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models

LambdaPO एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचे को पेश करता है जो तर्क करने वाले भाषा मॉडलों के लिए GRPO के अखंड समूह माध्य बेसलाइन (monolithic group mean baseline) को एक विघटित, युग्मवार वरीयता संरचना (pairwise preference structure) और सूक्ष्म संकेतों को पकड़ने के लिए सिमेंटिक डेंसिटी रिवार्ड्स (semantic density rewards) से बदल देता है ताकि सूक्ष्म-स्तरीय अनुकूलन संकेतों को कैप्चर किया जा सके और जटिल कार्यों पर प्रदर्शन में सुधार किया जा सके।

Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao2026-05-20
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

यह शोध पत्र कॉन्ट्रास्टिविव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन (CEPO) को प्रस्तुत करता है, जो एक नवीन RLVR सेल्फ-डिस्टिलेशन विधि है जो एक कॉन्ट्रास्टिव रिवॉर्ड सिग्नल उत्पन्न करने के लिए सही और अस्वीकृत दोनों रोलआउट्स का लाभ उठाती है, जिससे सूचना रिसाव (information leakage) से बचते हुए निर्णायक रीजनिंग स्टेप्स की सटीक पहचान की जाती है और मल्टीमॉडल गणितीय तर्क बेंचमार्क पर GRPO जैसे मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जाता है।

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan2026-05-20