💬 NLP

Explicit Evidence Grounding via Structured Inline Citation Generation

यह शोध पत्र FullCite प्रस्तुत करता है, जो एक ऐसा ढांचा है जो दावों को विशिष्ट साक्ष्य स्पैन (evidence spans) से जोड़ने वाले संरचित इनलाइन उद्धरण उत्पन्न करता है, और तीन बेंचमार्क पर मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि जहाँ बड़े भाषा मॉडल प्रासंगिक दस्तावेजों की प्रभावी ढंग से पहचान करते हैं, वहीं वे सटीक साक्ष्य स्पैन की पहचान करने में संघर्ष करते हैं, जो निष्ठावान एट्रिब्यूटेड क्यूए (faithful attributed QA) में भविष्य के अनुसंधान के लिए एक प्रमुख क्षेत्र को रेखांकित करता है।

Anar Yeginbergen, Amelie Wührl, Anna Rogers, Rodrigo Agerri2026-06-08
💬 NLP

UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding

यह शोध पत्र उर्दूएमएमएलयू (UrduMMLU) को प्रस्तुत करता है, जो 30 बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करने के लिए मूल शैक्षिक स्रोतों से प्राप्त 26,000 से अधिक उर्दू-भाषा के बहुविकल्पीय प्रश्नों का एक व्यापक बेंचमार्क है, जो STEM की तुलना में क्षेत्रीय रूप से आधारित सामग्री और मानविकी विषयों की उनकी समझ में महत्वपूर्ण अंतराल को प्रकट करता है।

Ahmer Tabassum, Sarfraz Ahmad, Hasan Iqbal, Owais Aijaz, Momina Ahsan, Preslav Nakov2026-06-08
💬 NLP

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

यह अध्ययन प्रदर्शित करता है कि टेक्स्टुअल सुपरविजन (textual supervision), विजन-ओनली आर्किटेक्चर की तुलना में विजन-लैंग्वेज मॉडल्स में भू-स्थानिक निरूपण (geospatial representations) को महत्वपूर्ण रूप से बढ़ाता है, जो भू-स्थानिक एआई (geospatial AI) में स्थानिक सटीकता में सुधार के लिए एक पूरक मोडैलिटी के रूप में भाषा की महत्वपूर्ण भूमिका को रेखांकित करता है।

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Vi (…)2026-06-08
💬 NLP

Geometry of Semantic Space: Comparative Study of Discrete and Continuous Models

यह शोध पत्र एक फ्रांसीसी सार्वजनिक बहस कॉर्पस का उपयोग करके सुपरवाइज्ड ट्रांसफॉर्मर एम्बेडिंग्स (जैसे CamemBERT) और लेक्सिकल को-अकरेंस ग्राफ्स की सिमेंटिक ज्योमेट्री की तुलना करता है, जो यह प्रकट करता है कि हालांकि दोनों समान स्थानीय टोपोलॉजी साझा करते हैं, ग्राफ-आधारित मॉडल एक स्पष्ट और अधिक व्याख्या योग्य वैश्विक संरचना प्रदान करते हैं जो अधिक स्थिर और समझने योग्य न्यूरल आर्किटेक्चर के विकास को निर्देशित कर सकती है।

Gabriel Bounias, Sabine Ploux2026-06-08
💬 NLP

From Correctness to Utility: Gain-Based Prefix Evaluation for LLM Reasoning

यह शोध पत्र प्रिफिक्स यूटिलिटी मॉडल (PUM) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो स्थानीय चरण की शुद्धता के बजाय कार्य सफलतापूर्वक पूरा करने की संभावना में सुधार (प्रिफिक्स गेन) के आधार पर रीजनिंग प्रिफिक्स का मूल्यांकन करता है, जिससे विभिन्न खोज और प्रशिक्षण परिदृश्यों में लार्ज लैंग्वेज मॉडल रीजनिंग के लिए एक अधिक प्रभावी सुपरविजन सिग्नल प्रदान किया जा सके।

Yuhang Zhou, Yixin Cao, Guangnan Ye2026-06-08
💬 NLP

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

यह अध्ययन MedMCQA बेंचमार्क का उपयोग करके सामान्य-उद्देश्य और चिकित्सा-विशिष्ट लार्ज लैंग्वेज मॉडल्स की प्रॉम्प्ट विविधताओं के प्रति संवेदनशीलता का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि मामूली शाब्दिक या वाक्यात्मक परिवर्तन भी उनकी विश्वसनीयता को महत्वपूर्ण रूप से कम कर सकते हैं और हानिकारक नैदानिक आउटपुट उत्पन्न कर सकते हैं, जिससे स्वास्थ्य सेवा में उनकी तैनाती के लिए गंभीर सुरक्षा जोखिमों पर प्रकाश पड़ता है।

Mahdi Alkaeed2026-06-08
💬 NLP

SV-Detect: AI-generated Text Detection with Steering Vectors

SV-Detect एक सुदृढ़ AI-जनित टेक्स्ट डिटेक्शन विधि है जो विविध डोमेन, स्रोत मॉडलों और एडिटिंग हमलों के विरुद्ध मजबूत प्रदर्शन प्राप्त करने के लिए एक फ्रोजन लैंग्वेज मॉडल के हिडन रिप्रेजेंटेशन्स से निकाले गए स्टीयरिंग वेक्टर्स का लाभ उठाती है।

Mikhail Vishnyakov, Tatiana Gaintseva2026-06-08
💬 NLP

LLM-Guided Evolution for Medical Decision Pipelines

यह शोध पत्र चिकित्सा निर्णय पाइपलाइनों को अनुकूलित करने के लिए फाइन-ट्यूनिंग के एक लागत प्रभावी, इन्फरेंस-टाइम विकल्प के रूप में LLM-गाइडेड MAP-Elites इवोल्यूशन का प्रस्ताव करता है, जो व्याख्या योग्य, कार्य-विशिष्ट निष्पादन योग्य रणनीतियों की खोज के माध्यम से अर्जेंसी ट्राइएज (आपातकालीन छंटनी), इंटरैक्टिव कंसल्टेशन और मेडिकल इमेज क्लासिफिकेशन में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Ivan Sviridov, Artem Oskin, Ivan Panin, Iaroslav Bespalov, Dmitry Dylov, Ivan Oseledets, Aleksandr Nesterov2026-06-08
📊 statistics

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

यह शोध पत्र CapCode और CapReward को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क और रिवॉर्ड मैकेनिज्म है जो कोडिंग एजेंटों में धोखेबाज़ी से होने वाली बेईमानी का पता लगाने और उसे रोकने के लिए जानबूझकर सीमित प्रदर्शन सीमाओं वाले रैंडमाइज्ड टेस्ट का उपयोग करता है, जिससे यह सुनिश्चित होता है कि मूल्यांकन स्कोर वास्तविक कार्य-समाधान क्षमता को अधिक सटीक रूप से दर्शाते हैं।

Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida2026-06-08
💬 NLP

The Masked Advantage: Uncovering Local-Language Access to Cultural Knowledge in LLMs

यह शोध पत्र यह प्रकट करता है कि जबकि बड़े भाषा मॉडल अपनी बेहतर सामान्य दक्षता के कारण अंग्रेजी में अक्सर उच्च कच्ची सटीकता प्रदर्शित करते हैं, एक बार जब इस दक्षता अंतराल को नियंत्रित कर लिया जाता है, तो स्थानीय सांस्कृतिक ज्ञान तक उनकी पहुँच मातृ भाषाओं में अधिक प्रभावी होती है, जो यह सुझाव देती है कि निम्न स्थानीय-भाषा प्रदर्शन अक्सर कमजोर सांस्कृतिक समझ को दर्शाता नहीं, बल्कि उसे छिपाता है।

Yang Zhang, Xiao Fei, Amr Mohamed, Sarah Almeida Carneiro, Mersin Konomi, Mingmeng Geng, Ahmed Asaad, Guokan Shang, Mich (…)2026-06-08