🤖 machine learning

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

यह शोध पत्र भाषा मॉडलों में एक छिपे हुए "एलाइनमेंट ट्रांजिशन" (alignment transition) की पहचान करता है जहाँ तर्क और सत्यनिष्ठा एक महत्वपूर्ण पैमाने के आगे प्रति-सहसंबंधी (anticorrelated) से सहकारी (cooperative) होने की ओर स्थानांतरित हो जाते हैं, जो एक ऐसा चरण परिवर्तन (phase change) है जिसे मॉडल के आंतरिक विवरणों तक पहुँच प्राप्त किए बिना वास्तुशिल्प समायोजन, डेटा क्यूरेशन और प्रशिक्षण विधियों के माध्यम से पूर्वानुमानित और हेरफेर किया जा सकता है।

Adil Amin2026-05-20
🤖 machine learning

The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next

यह शोध पत्र एक नैदानिक ढांचे (diagnostic framework) का प्रस्ताव करता है जो फ्रंटियर मॉडल के प्रदर्शन को जनसंख्या युग्मन प्रवृत्तियों (population coupling trends) और प्रति-रिलीज़ अवशेषों (per-release residuals) में विभाजित करता है ताकि यह प्रकट किया जा सके कि कोडिंग और तर्क क्षमताएं कैसे परस्पर क्रिया करती हैं, लैब के अनुसार कैसे भिन्न होती हैं, और समय के साथ कैसे विकसित होती हैं, जो अंततः वर्तमान लीडरबोर्ड के संतृप्त होने पर अगले सबसे सूचनात्मक बेंचमार्क चुनने के लिए एक रणनीतिक प्लेबुक प्रदान करता है।

Adil Amin2026-05-20
🤖 machine learning

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

यह शोध पत्र SAGE का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो एक गाइड फंक्शन के माध्यम से रिवर्स-KL एंकर डिस्ट्रीब्यूशन को नया रूप देकर LLMs में मानक RLVR की अन्वेषण सीमाओं को दूर करता है, जिससे गणितीय तर्क कार्यों पर pass@1 और pass@k दोनों में एक साथ सुधार प्राप्त होता है।

Chanuk Lee, Minki Kang, Sung Ju Hwang2026-05-20
💬 NLP

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn एक फ्यू-शॉट नॉलेज अनलर्निंग फ्रेमवर्क है जो मॉडल एडिटिंग के माध्यम से इस कार्य को एक सटीक ज्ञान री-मैपिंग समस्या के रूप में पुनर्गठित करता है, जो समग्र मॉडल उपयोगिता को संरक्षित करते हुए संवेदनशील जानकारी को कुशलतापूर्वक हटाने के लिए मल्टीप्लिकेटिव पैरामीटर अपडेट का उपयोग करता है।

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su2026-05-20
💬 NLP

Dynamic Model Merging Made Slim

यह शोध पत्र DiDi-Merging को प्रस्तुत करता है, जो एक कॉम्पैक्ट डायनेमिक मॉडल मर्जिंग फ्रेमवर्क है जो विजन, लैंग्वेज और मल्टीमॉडल कार्यों में मौजूदा तरीकों की तुलना में काफी कम मापदंडों के साथ बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त करने के लिए डिफरेंशिएबल रैंक एलोकेशन और डेटा-फ्री रिफाइनमेंट का उपयोग करता है।

Guodong Du, Wanyu Lin2026-05-20
💬 NLP

The Annotation Scarcity Paradox in Low-Resource NLP Evaluation: A Decade of Acceleration and Emerging Constraints

यह शोध पत्र "एनोटेशन स्कैरसिटी पैराडॉक्स" (अंकन दुर्लभता विरोधाभास) को प्रस्तुत करता है ताकि यह तर्क दिया जा सके कि जबकि स्केलिंग और ट्रांसफर लर्निंग के माध्यम से लो-रिसोर्स एनएलपी (NLP) ने तेजी से प्रगति की है, इसकी प्रगति एक न्यायसंगत, विशेषज्ञ मानव मूल्यांकन की गंभीर कमी के कारण ज्ञानमीमांसीय रूप से खतरे में है, जिसके लिए लेनदेन संबंधी डेटा निष्कर्षण से समुदाय-अंतर्निहित, संप्रभु मूल्यांकन प्रथाओं की ओर एक प्रतिमान परिवर्तन की आवश्यकता है।

Vukosi Marivate2026-05-20
💬 NLP

Benchmarking Commercial ASR Systems on Code-Switching Speech: Arabic, Persian, and German

यह शोध पत्र अरबी, फारसी और जर्मन भाषा युग्मों के कोड-स्विचिंग भाषण पर पांच वाणिज्यिक एएसआर (ASR) प्रणालियों के लिए एक नया बेंचमार्क डेटासेट और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इलेवनलैब्स स्क्राइब v2 (ElevenLabs Scribe v2) सर्वश्रेष्ठ प्रदर्शन प्राप्त करता है, जबकि लिप्यंतरण भिन्नता को संभालने के लिए पारंपरिक वर्ड एरर रेट (Word Error Rate) पर BERTScore की श्रेष्ठता को उजागर करता है और कठिनाई-स्तरीकृत विश्लेषण के माध्यम से प्रदर्शन अंतराल को प्रकट करता है।

Sajjad Abdoli (MAD), Ghassan Al-Sumaidaee (MAD), Clayton W. Taylor (MAD), Ahmad (MAD), ElShiekh, Ahmed Rashad2026-05-20
🤖 AI

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

यह शोधपत्र DecisionBench को प्रस्तुत करता है, जो विविध मॉडलों और कार्यों में दीर्घ-क्षितिज (long-horizon) एजेंटिक वर्कफ़्लो के उभरते हुए डेलीगेशन (delegation) के मूल्यांकन के लिए एक व्यापक बेंचमार्क सबस्ट्रेट है, जो यह प्रकट करता है कि जबकि जागरूकता स्थितियों (awareness conditions) में कार्य की गुणवत्ता स्थिर रहती है, रूटिंग फिडेलिटी (routing fidelity) और समग्र ऑर्केस्ट्रेशन प्रदर्शन को सुधारने के लिए महत्वपूर्ण अप्राप्त क्षमता मौजूद है।

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu2026-05-20
💬 NLP

Prompting language influences diagnostic reasoning and accuracy of large language models

यह अध्ययन प्रदर्शित करता है कि प्रॉम्पटिंग भाषा नैदानिक सेटिंग्स में अधिकांश बड़े भाषा मॉडलों के नैदानिक तर्क और सटीकता को महत्वपूर्ण रूप से प्रभावित करती है, जिसमें पांच में से चार मूल्यांकित मॉडलों में अंग्रेजी आम तौर पर फ्रांसीसी से बेहतर प्रदर्शन करती है, जो न्यायसंगत वैश्विक तैनाती के लिए एक महत्वपूर्ण बाधा को रेखांकित करती है।

Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud2026-05-20
💬 NLP

MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent

यह शोध पत्र MMoA को प्रस्तुत करता है, जो एक रिकरेंट मिक्स्चर-ऑफ-एजेंट्स फ्रेमवर्क है जो ऐतिहासिक संदर्भ के आधार पर एजेंटों के योगदान को गतिशील रूप से नियंत्रित करने के लिए LSTM-आधारित गेटिंग का उपयोग करता है, जिससे पारंपरिक MoA प्रणालियों के तुलनीय प्रदर्शन के साथ-साथ कंप्यूटेशनल ओवरहेड में भी महत्वपूर्ण कमी आती है।

Rui Chu2026-05-20