💬 NLP

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn एक फ्यू-शॉट नॉलेज अनलर्निंग फ्रेमवर्क है जो मॉडल एडिटिंग के माध्यम से इस कार्य को एक सटीक ज्ञान री-मैपिंग समस्या के रूप में पुनर्गठित करता है, जो समग्र मॉडल उपयोगिता को संरक्षित करते हुए संवेदनशील जानकारी को कुशलतापूर्वक हटाने के लिए मल्टीप्लिकेटिव पैरामीटर अपडेट का उपयोग करता है।

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su2026-05-20
💬 NLP

Dynamic Model Merging Made Slim

यह शोध पत्र DiDi-Merging को प्रस्तुत करता है, जो एक कॉम्पैक्ट डायनेमिक मॉडल मर्जिंग फ्रेमवर्क है जो विजन, लैंग्वेज और मल्टीमॉडल कार्यों में मौजूदा तरीकों की तुलना में काफी कम मापदंडों के साथ बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त करने के लिए डिफरेंशिएबल रैंक एलोकेशन और डेटा-फ्री रिफाइनमेंट का उपयोग करता है।

Guodong Du, Wanyu Lin2026-05-20
💬 NLP

The Annotation Scarcity Paradox in Low-Resource NLP Evaluation: A Decade of Acceleration and Emerging Constraints

यह शोध पत्र "एनोटेशन स्कैरसिटी पैराडॉक्स" (अंकन दुर्लभता विरोधाभास) को प्रस्तुत करता है ताकि यह तर्क दिया जा सके कि जबकि स्केलिंग और ट्रांसफर लर्निंग के माध्यम से लो-रिसोर्स एनएलपी (NLP) ने तेजी से प्रगति की है, इसकी प्रगति एक न्यायसंगत, विशेषज्ञ मानव मूल्यांकन की गंभीर कमी के कारण ज्ञानमीमांसीय रूप से खतरे में है, जिसके लिए लेनदेन संबंधी डेटा निष्कर्षण से समुदाय-अंतर्निहित, संप्रभु मूल्यांकन प्रथाओं की ओर एक प्रतिमान परिवर्तन की आवश्यकता है।

Vukosi Marivate2026-05-20
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

यह शोध पत्र अरबी, फारसी और जर्मन भाषा युग्मों के कोड-स्विचिंग भाषण पर पांच वाणिज्यिक एएसआर (ASR) प्रणालियों के लिए एक नया बेंचमार्क डेटासेट और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इलेवनलैब्स स्क्राइब v2 (ElevenLabs Scribe v2) सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है, जबकि लिप्यंतरण भिन्नता को संभालने के लिए पारंपरिक वर्ड एरर रेट (Word Error Rate) पर BERTScore की श्रेष्ठता को उजागर करता है और कठिनाई-स्तरीकृत विश्लेषण के माध्यम से प्रदर्शन अंतराल को प्रकट करता है।

Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad2026-05-20
🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

यह शोधपत्र DecisionBench को प्रस्तुत करता है, जो विविध मॉडलों और कार्यों में दीर्घ-क्षितिज (long-horizon) एजेंटिक वर्कफ़्लो के उभरते हुए डेलीगेशन (delegation) के मूल्यांकन के लिए एक व्यापक बेंचमार्क सबस्ट्रेट है, जो यह प्रकट करता है कि जबकि जागरूकता स्थितियों (awareness conditions) में कार्य की गुणवत्ता स्थिर रहती है, रूटिंग फिडेलिटी (routing fidelity) और समग्र ऑर्केस्ट्रेशन प्रदर्शन को सुधारने के लिए महत्वपूर्ण अप्राप्त क्षमता मौजूद है।

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu2026-05-20
💬 NLP

Prompting language influences diagnostic reasoning and accuracy of large language models

यह अध्ययन प्रदर्शित करता है कि प्रॉम्पटिंग भाषा नैदानिक सेटिंग्स में अधिकांश बड़े भाषा मॉडलों के नैदानिक तर्क और सटीकता को महत्वपूर्ण रूप से प्रभावित करती है, जिसमें पांच में से चार मूल्यांकित मॉडलों में अंग्रेजी आम तौर पर फ्रांसीसी से बेहतर प्रदर्शन करती है, जो न्यायसंगत वैश्विक तैनाती के लिए एक महत्वपूर्ण बाधा को रेखांकित करती है।

Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud2026-05-20
💬 NLP

MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent

यह शोध पत्र MMoA को प्रस्तुत करता है, जो एक रिकरेंट मिक्स्चर-ऑफ-एजेंट्स फ्रेमवर्क है जो ऐतिहासिक संदर्भ के आधार पर एजेंटों के योगदान को गतिशील रूप से नियंत्रित करने के लिए LSTM-आधारित गेटिंग का उपयोग करता है, जिससे पारंपरिक MoA प्रणालियों के तुलनीय प्रदर्शन के साथ-साथ कंप्यूटेशनल ओवरहेड में भी महत्वपूर्ण कमी आती है।

Rui Chu2026-05-20
💬 NLP

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स के लिए वर्तमान अनिश्चितता मात्रा निर्धारण (Uncertainty Quantification) विधियाँ मौलिक रूप से विफल रहती हैं क्योंकि वे बाहरी तथ्यात्मक शुद्धता के बजाय केवल अनसुपरवाइज्ड क्लस्टरिंग के माध्यम से आंतरिक पीढ़ी निरंतरता को मापती हैं, जिससे सुरक्षा की एक भ्रामक भावना पैदा होती है जो आत्मविश्वासी मतिभ्रम (hallucinations) का पता नहीं लगा सकती।

Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei2026-05-20
💬 NLP

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

यह शोध पत्र स्टेपवाइज कॉन्फिडेंस एट्रिब्यूशन (SCA) प्रस्तुत करता है, जो ब्लैक-बॉक्स LLMs में बहु-चरणीय तर्क विफलताओं का निदान करने के लिए एक ढांचा है, जो सर्वसम्मति संरचनाओं के आधार पर चरण-स्तरीय आत्मविश्वास स्कोर असाइन करने के लिए इंफॉर्मेशन बॉटलनेक सिद्धांत को लागू करता है, जिससे पारंपरिक उत्तर-स्तर की प्रतिक्रिया की तुलना में अधिक प्रभावी आत्म-सुधार सक्षम होता है।

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei2026-05-20
💬 NLP

FormalASR: End-to-End Spoken Chinese to Formal Text

यह शोधपत्र FormalASR को प्रस्तुत करता है, जो दो कॉम्पैक्ट एंड-टू-एंड मॉडल्स (0.6B और 1.7B) का एक जोड़ा है, जिन्हें नए निर्मित बड़े पैमाने के डेटासेट्स पर सीधे बोले गए चीनी भाषा को औपचारिक लिखित पाठ में ट्रांसक्राइब करने के लिए प्रशिक्षित किया गया है, जिससे त्रुटि दर में काफी कमी आती है और विलंब उत्पन्न करने वाले पोस्ट-प्रोसेसिंग LLMs की आवश्यकता समाप्त हो जाती है।

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang2026-05-20