💬 NLP

Fragile Knowledge, Robust Instruction-Following: The Width Pruning Dichotomy in Llama-3.2

यह शोध पत्र प्रकट करता है कि Llama-3.2 मॉडलों में GLU-MLP परतों की संरचित चौड़ाई प्रूनिंग (structured width pruning) एक अनूठा व्यापार-समझौता (trade-off) उत्पन्न करती है जहाँ विस्तार अनुपात (expansion ratio) को कम करने से पैरामीट्रिक ज्ञान घटता है और ऊर्जा दक्षता बढ़ती है, फिर भी विरोधाभासी रूप से यह बहु-चरणीय तर्क क्षमताओं को सुरक्षित रखते हुए निर्देश-अनुपालन और सत्यता को बढ़ाता है।

Pere Martra2026-05-07✓ Author reviewed
💬 NLP

Language Markers of Emotion Flexibility Predict Depression and Anxiety Treatment Outcomes

12,000 से अधिक रोगियों के 12 सप्ताह के टेलीथेरेपी ट्रांसक्रिप्ट के विश्लेषण के माध्यम से, यह अध्ययन प्रदर्शित करता है कि भावनात्मक कठोरता के निष्क्रिय रूप से कैप्चर किए गए भाषाई मार्कर, विशेष रूप से टेम्पोरल नेटवर्क में उदासी और चिंता का प्रभुत्व, चिंता विकारों और अवसाद में उपचार के प्रति गैर-प्रतिक्रिया और लक्षणों के बिगड़ने की प्रभावी ढंग से भविष्यवाणी कर सकते हैं।

Benjamin Brindle, George A. Bonanno, Thomas Derrick Hull, Nicolas Charon, Matteo Malgaroli2026-05-07
🤖 machine learning

Single-Position Intervention Fails: Distributed Output Templates Drive In-Context Learning

यह लेख प्रदर्शित करता है कि इन-कॉन्टेक्स्ट लर्निंग टास्क की पहचान विशिष्ट परतों या टोकन तक सीमित नहीं है, जैसा कि लीनियर प्रोबिंग द्वारा सुझाव दिया गया है, बल्कि यह प्रदर्शन टोकन (डेमोंस्ट्रेशन टोकन्स) में वितरित आउटपुट फॉर्मेट टेम्पलेट्स के रूप में कार्यगत रूप से एनकोडेड है, जिसमें एक महत्वपूर्ण हस्तक्षेप विंडो नेटवर्क की गहराई के लगभग 30% पर स्थित है।

Bryan Cheng, Jasper Zhang2026-05-07
💬 NLP

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

यह शोध पत्र FREIA को प्रस्तुत करता है, जो एक नवीन अनसुपरवाइज्ड (unsupervised) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो विकसित होती तर्क क्षमताओं के अनुकूल गतिशील रूप से ढलने के लिए फ्री एनर्जी-ड्रिवन रिवॉर्ड (Free Energy-Driven Reward) और एडेप्टिव एडवांटेज शेपिंग (Adaptive Advantage Shaping) का लाभ उठाता है, जिससे यह बिना ग्राउंड-ट्रुथ सुपरविजन के गणितीय तर्क जैसे कार्यों में मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu2026-05-07
💬 NLP

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

यह शोध पत्र एडेप्टिव पावर-मीन पॉलिसी ऑप्टिमाइज़ेशन (APMPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो एक सामान्यीकृत पावर-मीन ऑब्जेक्टिव और फीडबैक-एडेप्टिव क्लिपिंग के माध्यम से लार्ज लैंग्वेज मॉडल की तर्क क्षमता को बढ़ाता है, और कई तर्क कार्यों में अत्याधुनिक बेसलाइनों पर बेहतर प्रदर्शन प्राप्त करता है।

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu2026-05-07
🤖 machine learning

Balanced Aggregation: Understanding and Fixing Aggregation Bias in GRPO

यह शोध पत्र 'बैलेंस्ड एग्रीगेशन' (Balanced Aggregation) का प्रस्ताव देकर सत्यापन योग्य पुरस्कारों (verifiable rewards) वाले GRPO-शैली के सुदृढीकरण लर्निंग (reinforcement learning) में एकत्रीकरण पूर्वाग्रह (aggregation bias) की पहचान और समाधान करता है, जो सकारात्मक और नकारात्मक प्रतिक्रियाओं के लिए टोकन-स्तरीय ग्रेडिएंट्स को पुनर्संयोजित करने से पहले अलग-अलग औसत निकालता है, जिससे रीजनिंग और कोडिंग बेंचमार्क में प्रशिक्षण स्थिरता और प्रदर्शन में सुधार होता है।

Zhiyuan Zeng, Jiameng Huang, Zhangyue Yin, Jiashuo Liu, Ziniu Li, Bingrui Li, Yuhao Wu, Yining Zheng, Ge Zhang, Wenhao H (…)2026-05-07
🤖 machine learning

HERCULES: Hardware-Efficient, Robust, Continual Learning Neural Architecture Search

यह शोध पत्र HERCULES को प्रस्तुत करता है, जो न्यूरल आर्किटेक्चर सर्च के लिए एक नया फ्रेमवर्क और वर्गीकरण (taxonomy) है जो तैनात करने योग्य, आजीवन सीखने वाले (lifelong-learning) एआई सिस्टम के विकास को निर्देशित करने के लिए हार्डवेयर दक्षता, सुदृढ़ता (robustness) और निरंतर सीखने (continual learning) के महत्वपूर्ण उद्देश्यों को एकीकृत करता है।

Matteo Gambella, Fabrizio Pittorino, Manuel Roveri2026-05-07
💻 computer science

TSCG: Deterministic Tool-Schema Compilation for Agentic LLM Deployments

TSCG एक नियत (deterministic), निर्भरता-मुक्त (dependency-free) टूल-स्कीमा कंपाइलर है जो अक्षम JSON स्कीमा को टोकन-कुशल संरचित टेक्स्ट में परिवर्तित करके उत्पादन परिवेशों (production environments) में छोटे और उन्नत LLMs के लिए टूल-उपयोग सटीकता में महत्वपूर्ण सुधार करता है, जिससे उस फॉर्मेट मिसमैच को हल किया जाता है जो वर्तमान में टूल-उपयोग की अधिकांश त्रुटियों का कारण बनता है।

Furkan Sakizli2026-05-07
🤖 machine learning

Position: the Stochastic Parrot in the Coal Mine. Model Collapse is a Threat to Low-Resource Communities

यह स्थिति पत्र तर्क देता है कि मॉडल कोलैप्स (model collapse), जो जनरेटिव एआई को उसके अपने आउटपुट पर प्रशिक्षित करने से प्रेरित होता है, डेटा की गुणवत्ता और दक्षता को कम करके एआई के लोकतंत्रीकरण के लिए खतरा पैदा करता है, जिससे सांस्कृतिक पूर्वाग्रहों को सुदृढ़ करने और पर्यावरणीय लागतों के माध्यम से कम-संसाधन वाले और हाशिए पर स्थित समुदायों को असमान रूप से नुकसान पहुँचता है।

Devon Jarvis, Richard Klein, Benjamin Rosman, Steven James, Stefano Sarao Mannelli2026-05-07
💻 computer science

Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation

यह कार्य एक बिब्लियोमेट्रिक परीक्षण प्रस्तुत करता है जो दर्शाता है कि एआई (AI) क्षमताओं के शैक्षणिक आकलन व्यवस्थित रूप से वर्तमान अत्याधुनिक अवस्था से एक दशक से अधिक पीछे हैं, एक ऐसा अंतराल जो प्रकाशन विलंब के कारण चौड़ा होता जा रहा है और जिसे मॉडल कॉन्फ़िगरेशन के व्यापक गलत निरूपण के साथ-साथ विशिष्ट रूप से मूल्यांकित प्रणालियों के बजाय "एआई" के बारे में अति-सामान्यीकृत दावों द्वारा और भी बढ़ा दिया गया है।

David Gringras, Misha Salahshoor2026-05-07