🤖 machine learning

PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines

यह शोध पत्र PASC को प्रस्तुत करता है, जो एक पाइपलाइन-जागरूक कॉन्फॉर्मल प्रेडिक्शन विधि है जो समस्या को एकल स्केलर क्वांटाइल गणना में कम करके मल्टी-स्टेज NLP और LLM सिस्टम के लिए परिमित-नमूना संयुक्त कवरेज गारंटी सुनिश्चित करती है, जिससे यह सटीकता और दक्षता दोनों में स्वतंत्र अंशांकन (कैलिब्रेशन) और रूढ़िवादी बोनफेरोनी बाउंड्स से काफी बेहतर प्रदर्शन करती है।

Varun Kotte2026-05-20
🤖 machine learning

Fine-Grained Benchmark Generation for Comprehensive Evaluation of Foundation Models

यह शोध पत्र एक स्वचालित, मल्टी-एजेंट फ्रेमवर्क पेश करता है जो संदर्भ सामग्रियों पर आधारित सूक्ष्म, मेटाडेटा-समृद्ध बेंचमार्क उत्पन्न करने के लिए है, जो MMLU और GSM8K जैसे मौजूदा मूल्यांकनों की तुलना में बेहतर ग्राउंड-ट्रुथ विश्वसनीयता और व्यापक सक्षमता कवरेज प्रदान करते हैं।

Mohammed Saidul Islam, Negin Baghbanzadeh, Farnaz Kohankhaki, Afshin Cheraghi, Ali Kore, Shayaan Mehdi, Elham Dolatabadi (…)2026-05-20
🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

यह शोध पत्र भाषा मॉडलों में एक छिपे हुए "एलाइनमेंट ट्रांजिशन" (alignment transition) की पहचान करता है जहाँ तर्क और सत्यनिष्ठा एक महत्वपूर्ण पैमाने के आगे प्रति-सहसंबंधी (anticorrelated) से सहकारी (cooperative) होने की ओर स्थानांतरित हो जाते हैं, जो एक ऐसा चरण परिवर्तन (phase change) है जिसे मॉडल के आंतरिक विवरणों तक पहुँच प्राप्त किए बिना वास्तुशिल्प समायोजन, डेटा क्यूरेशन और प्रशिक्षण विधियों के माध्यम से पूर्वानुमानित और हेरफेर किया जा सकता है।

Adil Amin2026-05-20
🤖 machine learning

The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next

यह शोध पत्र एक नैदानिक ढांचे (diagnostic framework) का प्रस्ताव करता है जो फ्रंटियर मॉडल के प्रदर्शन को जनसंख्या युग्मन प्रवृत्तियों (population coupling trends) और प्रति-रिलीज़ अवशेषों (per-release residuals) में विभाजित करता है ताकि यह प्रकट किया जा सके कि कोडिंग और तर्क क्षमताएं कैसे परस्पर क्रिया करती हैं, लैब के अनुसार कैसे भिन्न होती हैं, और समय के साथ कैसे विकसित होती हैं, जो अंततः वर्तमान लीडरबोर्ड के संतृप्त होने पर अगले सबसे सूचनात्मक बेंचमार्क चुनने के लिए एक रणनीतिक प्लेबुक प्रदान करता है।

Adil Amin2026-05-20
🤖 machine learning

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

यह शोध पत्र SAGE का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो एक गाइड फंक्शन के माध्यम से रिवर्स-KL एंकर डिस्ट्रीब्यूशन को नया रूप देकर LLMs में मानक RLVR की अन्वेषण सीमाओं को दूर करता है, जिससे गणितीय तर्क कार्यों पर pass@1 और pass@k दोनों में एक साथ सुधार प्राप्त होता है।

Chanuk Lee, Minki Kang, Sung Ju Hwang2026-05-20
💬 NLP

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn एक फ्यू-शॉट नॉलेज अनलर्निंग फ्रेमवर्क है जो मॉडल एडिटिंग के माध्यम से इस कार्य को एक सटीक ज्ञान री-मैपिंग समस्या के रूप में पुनर्गठित करता है, जो समग्र मॉडल उपयोगिता को संरक्षित करते हुए संवेदनशील जानकारी को कुशलतापूर्वक हटाने के लिए मल्टीप्लिकेटिव पैरामीटर अपडेट का उपयोग करता है।

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su2026-05-20
💬 NLP

Dynamic Model Merging Made Slim

यह शोध पत्र DiDi-Merging को प्रस्तुत करता है, जो एक कॉम्पैक्ट डायनेमिक मॉडल मर्जिंग फ्रेमवर्क है जो विजन, लैंग्वेज और मल्टीमॉडल कार्यों में मौजूदा तरीकों की तुलना में काफी कम मापदंडों के साथ बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त करने के लिए डिफरेंशिएबल रैंक एलोकेशन और डेटा-फ्री रिफाइनमेंट का उपयोग करता है।

Guodong Du, Wanyu Lin2026-05-20
💬 NLP

The Annotation Scarcity Paradox in Low-Resource NLP Evaluation: A Decade of Acceleration and Emerging Constraints

यह शोध पत्र "एनोटेशन स्कैरसिटी पैराडॉक्स" (अंकन दुर्लभता विरोधाभास) को प्रस्तुत करता है ताकि यह तर्क दिया जा सके कि जबकि स्केलिंग और ट्रांसफर लर्निंग के माध्यम से लो-रिसोर्स एनएलपी (NLP) ने तेजी से प्रगति की है, इसकी प्रगति एक न्यायसंगत, विशेषज्ञ मानव मूल्यांकन की गंभीर कमी के कारण ज्ञानमीमांसीय रूप से खतरे में है, जिसके लिए लेनदेन संबंधी डेटा निष्कर्षण से समुदाय-अंतर्निहित, संप्रभु मूल्यांकन प्रथाओं की ओर एक प्रतिमान परिवर्तन की आवश्यकता है।

Vukosi Marivate2026-05-20
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

यह शोध पत्र अरबी, फारसी और जर्मन भाषा युग्मों के कोड-स्विचिंग भाषण पर पांच वाणिज्यिक एएसआर (ASR) प्रणालियों के लिए एक नया बेंचमार्क डेटासेट और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इलेवनलैब्स स्क्राइब v2 (ElevenLabs Scribe v2) सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है, जबकि लिप्यंतरण भिन्नता को संभालने के लिए पारंपरिक वर्ड एरर रेट (Word Error Rate) पर BERTScore की श्रेष्ठता को उजागर करता है और कठिनाई-स्तरीकृत विश्लेषण के माध्यम से प्रदर्शन अंतराल को प्रकट करता है।

Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad2026-05-20
🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

यह शोधपत्र DecisionBench को प्रस्तुत करता है, जो विविध मॉडलों और कार्यों में दीर्घ-क्षितिज (long-horizon) एजेंटिक वर्कफ़्लो के उभरते हुए डेलीगेशन (delegation) के मूल्यांकन के लिए एक व्यापक बेंचमार्क सबस्ट्रेट है, जो यह प्रकट करता है कि जबकि जागरूकता स्थितियों (awareness conditions) में कार्य की गुणवत्ता स्थिर रहती है, रूटिंग फिडेलिटी (routing fidelity) और समग्र ऑर्केस्ट्रेशन प्रदर्शन को सुधारने के लिए महत्वपूर्ण अप्राप्त क्षमता मौजूद है।

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu2026-05-20