💬 NLP

QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

यह शोधपत्र QuickScope प्रस्तुत करता है, जो एक सैंपल-एफिशिएंट (नमूना-कुशल) कार्यप्रणाली है जो LLM बेंचमार्क में कठिन प्रश्नों को गतिशील रूप से पहचानने और प्रमाणित करने के लिए COUP बेयसियन ऑप्टिमाइज़ेशन एल्गोरिदम को अनुकूलित करती है, जिससे शोर वाले परिणामों से होने वाले फॉल्स पॉजिटिव्स (मिथ्या सकारात्मकता) को कम करते हुए मॉडल की कमजोरियों का अधिक विश्वसनीय पता लगाने में सक्षम बनाया जा सके।

Taylor Lundy, Narun K. Raman, Kevin Leyton-Brown2026-04-21
💬 NLP

Latent Preference Modeling for Cross-Session Personalized Tool Calling

यह शोध पत्र टूल-ऑगमेंटेड एजेंटों में अपूर्ण उपयोगकर्ता अनुरोधों को संबोधित करने के लिए MPT बेंचमार्क और PRefine विधि प्रस्तुत करता है, जो एक मेमोरी-ऑगमेंटेड जनरेट-वेरिफाई-रिफाइन लूप के माध्यम से विकसित होती उपयोगकर्ता प्राथमिकताओं को मॉडल करके, टोकन के उपयोग में काफी कमी के साथ उच्च सटीकता प्राप्त करता है।

Yejin Yoon, Minseo Kim, Taeuk Kim2026-04-21
💬 NLP

Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

यह शोध पत्र यह प्रदर्शित करता है कि विशिष्ट घटनाओं पर बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की खराब औपचारिक भाषाई क्षमता अक्सर स्थापत्य संबंधी सीमाओं के बजाय डेटा की कमी के कारण होती है, क्योंकि छोटे मॉडलों में लक्षित सिंथेटिक डेटा की एक न्यूनतम मात्रा डालने से अधिकांश चुनौतीपूर्ण व्याकरणिक कार्यों पर उनके प्रदर्शन में महत्वपूर्ण सुधार होता है।

H S V N S Kowndinya Renduchintala, Sumit Bhatia2026-04-21
💬 NLP

From Fallback to Frontline: When Can LLMs be Superior Annotators of Human Perspectives?

यह शोध पत्र एलएलएम (LLM) को केवल एक विकल्प (fallback) के रूप में देखने के दृष्टिकोण को चुनौती देता है, यह प्रदर्शित करते हुए कि अपने निम्न विचरण (low variance) और कम पूर्वाग्रह युग्मन (reduced bias coupling) के कारण, वे अक्सर मानव एनोटेटरों की तुलना में समग्र मानवीय दृष्टिकोणों के सांख्यिकीय रूप से श्रेष्ठ अग्रिम अनुमानक (frontline estimators) के रूप में कार्य कर सकते हैं।

Hasan Amin, Harry Yizhou Tian, Xiaoni Duan, Chien-Ju Ho, Rajiv Khanna, Ming Yin2026-04-21
💬 NLP

ltzGLUE: Luxembourgish General Language Understanding Evaluation

यह शोध पत्र ltzGLUE को प्रस्तुत करता है, जो लक्ज़मबर्गिश के लिए पहला नेचुरल लैंग्वेज अंडरस्टैंडिंग बेंचमार्क है, जो वर्गीकरण कार्यों का एक समूह स्थापित करता है और इस अक्सर उपेक्षित आधिकारिक राष्ट्रीय भाषा पर विभिन्न प्री-ट्रेंड लैंग्वेज मॉडल्स के प्रदर्शन का मूल्यांकन करता है।

Alistair Plum, Felicia Körner, Anne-Marie Lutgen, Laura Bernardy, Fred Philippy, Emilia Milano, Nils Rehlinger, Cédric L (…)2026-04-21
💬 NLP

Mitigating Multimodal Hallucination via Phase-wise Self-reward

यह शोध पत्र PSRD प्रस्तुत करता है, जो एक चरण-वार स्व-पुरस्कार डिकोडिंग ढांचा (phase-wise self-reward decoding framework) है जो एक हल्के, डिस्टिल्ड रिवॉर्ड मॉडल का उपयोग करके सिमेंटिक चरणों के प्रारंभ में त्रुटियों की गतिशील रूप से पहचान और सुधार करके लार्ज विजन-लैंग्वेज मॉडल्स में मल्टीमॉडल मतिभ्रम (multimodal hallucinations) को कम करता है, जिससे बिना किसी बाहरी पर्यवेक्षण या भारी कम्प्यूटेशनल ओवरहेड के मतिभ्रम में महत्वपूर्ण कमी आती है।

Yu Zhang, Chuyang Sun, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang2026-04-21
💬 NLP

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

यह अध्ययन प्रदर्शित करता है कि सामान्य प्रयोजन वाले लार्ज लैंग्वेज मॉडल्स, विशेष रूप से जब उन्हें 'लीस्ट-टू-मोस्ट' प्रॉम्प्टिंग के साथ उन्नत किया जाता है, वर्तमान में प्रासंगिक और तार्किक रूप से न्यायसंगत फार्माकोएपिडेमियोलॉजिकल अध्ययन डिजाइन उत्पन्न करने में विशिष्ट बायोमेडिकल मॉडल्स से बेहतर प्रदर्शन करते हैं, हालांकि सभी मॉडल्स में ऑन्टोलॉजी-कोड मैपिंग में सीमाएं दिखाई देती हैं।

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa2026-04-21
💬 NLP

Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation

यह शोध पत्र प्रकट करता है कि मल्टी-एजेंट एलएलएम (LLM) सिस्टम अक्सर ओपन-एंडेड विचार सृजन में "डाइवर्सिटी कोलैप्स" (विविधता पतन) से ग्रस्त होते हैं, जो स्ट्रक्चरल कपलिंग (संरचनात्मक युग्मन) के कारण होता है—जहाँ शक्तिशाली मॉडल, अधिकार-संचालित पदानुक्रम और सघन संचार नेटवर्क अनजाने में सिमेंटिक विविधता को दबा देते हैं और समयपूर्व अभिसरण (प्रिमचर कन्वर्जेंस) को ट्रिगर करते हैं—जो रचनात्मक अन्वेषण को बनाए रखने के लिए एजेंट स्वतंत्रता और असहमति को संरक्षित करने की महत्वपूर्ण आवश्यकता पर प्रकाश डालता है।

Nuo Chen, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Zou Qingyun, Qian Wang, Bingsheng He2026-04-21
💬 NLP

Modeling Human Perspectives with Socio-Demographic Representations

यह शोध पत्र सोशियो-कॉन्ट्रास्टिव लर्निंग (Socio-Contrastive Learning) को प्रस्तुत करता है, जो एक नवीन विधि है जो एनोटेटर के दृष्टिकोणों को संयुक्त रूप से मॉडल करती है और सूक्ष्म सामाजिक-जनसांख्यिकीय निरूपणों (socio-demographic representations) को सीखती है ताकि एनएलपी कार्यों में मानवीय असहमति को प्रभावित करने वाले जटिल सामाजिक संदर्भों को बेहतर ढंग से समझा जा सके, जो मानक फीचर फ्यूजन दृष्टिकोणों से बेहतर प्रदर्शन करती है।

Leixin Zhang, Cagri Coltekin2026-04-21
💬 NLP

FLiP: Towards understanding and interpreting multimodal multilingual sentence embeddings

यह शोध पत्र FLiP को प्रस्तुत करता है, जो एक फैक्टराइज्ड लीनियर प्रोजेक्शन मॉडल है जो बहुभाषी और बहुआयामी वाक्य एम्बेडिंग्स से लेक्सिकल सामग्री को प्रभावी ढंग से पुनर्प्राप्त करता है, जो डाउनस्ट्रीम कार्यों पर निर्भर किए बिना प्रीट्रेंड एनकोडर्स में अंतर्निहित पूर्वाग्रहों को उजागर करने के लिए एक नैदानिक उपकरण के रूप में कार्य करता है।

Santosh Kesiraju, Bolaji Yusuf, Šimon Sedláček, Oldřich Plchot, Petr Schwarz2026-04-21