💬 NLP

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

यह शोध पत्र पहचानता है कि लार्ज लैंग्वेज मॉडल्स में डाइवर्सिटी कोलैप्स (विविधता का पतन) मुख्य रूप से डिकोडिंग के दौरान उनकी प्रायिकता वितरणों (प्रोबेबिलिटी डिस्ट्रीब्यूशन्स) में ऑर्डर और शेप मिसकैलिब्रेशन के कारण होता है, न कि सैंपलिंग ह्यूरिस्टिक्स की सीमाओं के कारण, जिससे आउटपुट वैधता और विविधता के बीच एक ट्रेड-ऑफ उत्पन्न होता है।

Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Raza (…)2026-05-13
💬 NLP

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

यह शोध पत्र ClinicalBench को प्रस्तुत करता है, जो क्रॉस-एडमिशन क्लिनिकल QA में एसर्शन-अवेयर रिट्रीवल (assertion-aware retrieval) के लिए एक स्ट्रेस-टेस्टिंग फ्रेमवर्क और डेटासेट है, जो यह प्रदर्शित करता है कि एक इंटेंट-अवेयर नॉलेज ग्राफ रिट्रीवल सिस्टम कई LLMs पर डेंस बेसलाइन्स की तुलना में रिट्रीवल सटीकता में महत्वपूर्ण सुधार करता है और क्लिनिकल QA बेंचमार्क को मान्य करने के लिए चिकित्सक अधिनिर्णय (physician adjudication) की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Alex Stinard2026-05-13
💬 NLP

Decomposing Evolutionary Mixture-of-LoRA Architectures: The Routing Lever, the Lifecycle Penalty, and a Substrate-Conditional Boundary

यह शोध पत्र 150M-पैरामीटर वाले सबस्ट्रेट पर एक इवोल्यूशनरी मिक्सचर-ऑफ-लोरा (evolutionary mixture-of-LoRA) सिस्टम का विखंडन करता है ताकि यह प्रकट किया जा सके कि जबकि एक विशिष्ट राउटर रीराइट प्रदर्शन में लाभ को प्रेरित करता है, इवोल्यूशनरी लाइफसाइकिल घटक एक शुद्ध प्रदर्शन दंड (net performance penalty) के रूप में कार्य करता है, जिसमें खोज तंत्र केवल विशिष्ट प्री-अलाइनमेंट स्थितियों के तहत ही लाभकारी सिद्ध होता है।

Ramchand Kumaresan2026-05-13✓ Author reviewed
💬 NLP

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

द्विचरणीय मॉडल (Bicameral Model) एक प्रशिक्षित न्यूरल इंटरफेस पेश करता है जो निरंतर हिडन-स्टेट कपलिंग के माध्यम से दो फ्रोजन लैंग्वेज मॉडल्स को द्विदिश रूप से समन्वय करने में सक्षम बनाता है, जिससे एक प्राथमिक मॉडल कार्यों को संचालित कर सकता है जबकि एक सहायक मॉडल टूल्स या कोड को निष्पादित करता है, जिससे टेक्स्ट-आधारित संचार पर निर्भर रहे बिना अंकगणित, तर्क और गणितीय तर्क में प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Cedric Flamant, Udaya Ghai, Kanna Shimizu2026-05-13
💬 NLP

How Does Differential Privacy Affect Social Bias in LLMs? A Systematic Evaluation

यह शोध पत्र चार प्रतिमानों (पैराडाइम्स) में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में सामाजिक पूर्वाग्रह पर डिफरेंशियल प्राइवेसी के प्रभाव का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि डीपी (DP) वाक्य स्कोरिंग कार्यों में पूर्वाग्रह को कम करता है, यह सभी कार्यों में निष्पक्षता में समान रूप से सुधार नहीं करता है और कम स्मृति (मेमोराइजेशन) का अर्थ अनिवार्य रूप से कम अन्याय नहीं होता है।

Eduardo Tenorio, Karuna Bhaila, Xintao Wu2026-05-13
💬 NLP

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

यह शोधपत्र ReVision को प्रस्तुत करता है, जो एक ऐसी विधि है जो क्रमिक स्क्रीनशॉट में अनावश्यक पैच को चुनिंदा रूप से हटाकर कंप्यूटर-उपयोग एजेंट प्रक्षेप पथों (trajectories) में विजुअल टोकन रेडंडेंसी को कम करती है, जिससे टोकन लागत में काफी कमी आती है और सफलता दर में सुधार होता है तथा एजेंटों को लंबे ऐतिहासिक संदर्भों का प्रभावी ढंग से लाभ उठाने में सक्षम बनाया जाता है।

Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet2026-05-13
🤖 AI

Unlocking LLM Creativity in Science through Analogical Reasoning

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में मोड कोलैप्स (mode collapse) को कम करने के लिए एक नवीन दृष्टिकोण के रूप में एनालॉजिकल रीजनिंग (analogical reasoning) को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह कई बायोमेडिकल कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करते हुए उत्पन्न वैज्ञानिक समाधानों की विविधता और नवीनता को महत्वपूर्ण रूप से बढ़ाता है।

Andrew Shen, Shaul Druckmann, James Zou2026-05-13
💬 NLP

ReAD: Reinforcement-Guided Capability Distillation for Large Language Models

ReAD एक सुदृढीकरण-निर्देशित (reinforcement-guided) क्षमता आसवन (capability distillation) ढांचा है जो मॉडल क्षमताओं की परस्पर निर्भरता को संबोधित करता है, जो हानिकारक स्पिलओवर और व्यर्थ प्रयास को कम करते हुए डाउनस्ट्रीम उपयोगिता को अनुकूलित करने के लिए एक निश्चित टोकन बजट को गतिशील रूप से आवंटित करता है।

Xueqi Cheng, Xugui Zhou, Tyler Derr, Yushun Dong2026-05-13
🤖 machine learning

Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling

यह शोध पत्र DuST प्रस्तुत करता है, जो एक सेल्फ-ट्रेनिंग फ्रेमवर्क है जो टेस्ट-टाइम सैंपलिंग का लाभ उठाकर एक "डुअल जजमेंट स्पेस" बनाता है जहाँ मॉडल ऑन-पॉलिसी रीइन्फोर्समेंट लर्निंग के माध्यम से कैंडिडेट प्रोग्राम्स को रैंक करना सीखते हैं, जिससे सही जनरेशन के लिए प्रत्यक्ष रिवार्ड्स के बिना भी कोड की शुद्धता को परखने और उच्च गुणवत्ता वाले समाधान उत्पन्न करने की उनकी क्षमता में सुधार होता है।

Yizhu Jiao, Ruixiang Zhang, Richard Bai, Jiawei Han, Ronan Collobert, Yizhe Zhang2026-05-13
🤖 AI

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

यह शोध पत्र LatentRouter को प्रस्तुत करता है, जो एक नवीन ढांचा है जो रूटिंग को काउंटरफैक्टुअल यूटिलिटी प्रेडिक्शन (counterfactual utility prediction) के रूप में स्वरूपित करके मल्टीमॉडल मॉडल चयन को अनुकूलित करता है, जहाँ सीखे गए कैप्सूल और मॉडल क्षमता टोकन इमेज-क्वेश्चन इनपुट के लिए उम्मीदवार मॉडलों की विशिष्ट शक्तियों का अनुमान लगाने और उन्हें मिलाने के लिए लेटेंट संचार (latent communication) में संलग्न होते हैं, जिससे यह प्रदर्शन और लागत-दक्षता दोनों में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Xueqi Cheng, Yushun Dong2026-05-13