💻 computer science

SAPO: Step-Aligned Policy Optimization for Reasoning-Based Generative Recommendation

SAPO (Step-Aligned Policy Optimization) वैश्विक परिणाम पुरस्कारों (global outcome rewards) को स्टेप-अलाइन्ड, ग्रुप-रिलेटिव एडवांटेज से बदलकर जनरेटिव रिकमेंडेशन को बेहतर बनाता है, जो व्यक्तिगत रीजनिंग स्टेप्स और उनके संबंधित सिमेंटिक आइडेंटिफायर टोकन्स को क्रेडिट असाइन करता है, जिससे बड़े-कैटलॉग वाले परिदृश्यों में प्रशिक्षण को स्थिर करने और प्रदर्शन में सुधार करने में मदद मिलती है जहाँ सटीक-मैच फीडबैक अपर्याप्त होता है।

Zaiyi Zheng, Guanghui Min, Yaochen Zhu, Liang Wu, Liangjie Hong, Chen Chen, Jundong Li2026-05-19
🤖 machine learning

LLMForge: Multi-Backend Hardware-Aware Neural Architecture Search with Infinite-Head Attention for Edge Language Models

LLMForge एक हार्डवेयर-जागरूक न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है जो विशिष्ट एज डिवाइस बाधाओं के अनुरूप अनुकूलित सब-बिलियन-पैरामीटर लैंग्वेज मॉडल्स को स्वचालित रूप से उत्पन्न करने के लिए इनफिनिट-हेड अटेंशन और एक मल्टी-बैकएंड कॉस्ट मॉडल का लाभ उठाता है, जो मौजूदा बेसलाइनों की तुलना में ऊर्जा दक्षता, लेटेंसी और मॉडल सटीकता में महत्वपूर्ण सुधार प्राप्त करता है।

Xinting Jiang, Junyi Luo, Ruichen Qi, Kauna Lei, Ben Laurie, Gregory Kielian, Mehdi Saligane2026-05-19
📊 statistics

Training Infinitely Deep and Wide Transformers

यह शोध पत्र उनके गतिकी को एक न्यूरल PDE के रूप में मॉडल करके, फॉरवर्ड और बैकवर्ड पास की सुव्यवस्थितता (well-posedness) को सिद्ध करते हुए और यह प्रदर्शित करते हुए कि न्यूरल टेंगेंट कर्नेल (Neural Tangent Kernel) की इंजेक्टिविटी की विशिष्ट स्थितियों के तहत ग्रेडिएंट फ्लो वैश्विक न्यूनतम (global minima) की ओर अभिसरित होता है, मीन-फील्ड रिजीम में अनंत रूप से गहरे और चौड़े ट्रांसफॉर्मर्स को प्रशिक्षित करने के लिए एक कठोर गणितीय ढांचा स्थापित करता है।

Raphaël Barboni, Maarten V. de Hoop, Takashi Furuya, Gabriel Peyré2026-05-19
💻 computer science

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

यह शोध पत्र WJoconde, जो कि एक मल्टीमॉडल फ्रांसीसी सांस्कृतिक विरासत ज्ञान ग्राफ है, को प्रस्तुत करता है और एक विशेष सत्यापन पाइपलाइन के माध्यम से उच्च विश्वसनीयता के साथ ऐसे ग्राफों को स्वचालित रूप से विस्तारित करने के लिए लार्ज लैंग्वेज मॉडल्स और विजन-लैंग्वेज मॉडल्स का लाभ उठाने वाला एक नवीन ढांचा प्रस्तावित करता है।

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi2026-05-19
🤖 machine learning

PEIRA: Learning Predictive Encoders through Inter-View Regressor Alignment

यह शोध पत्र PEIRA को प्रस्तुत करता है, जो एक नॉन-कॉन्ट्रास्टिव सेल्फ-सुपरवाइज्ड लर्निंग विधि है जो एक इष्टतम लीनियर रिग्रेसर के ट्रेस (trace) के माध्यम से एक सुपरिभाषित उद्देश्य स्थापित करती है ताकि स्थिर, नॉन-कोलैप्स्ड ट्रेनिंग डायनेमिक्स सुनिश्चित किया जा सके जो अग्रणी नॉनलीनियर कैनोनिकल कोरिलेशन सबस्पेस के साथ संरेखित हो, जिससे ImageNet-1K और CIFAR-10 पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Michael Arbel, Basile Terver, Jean Ponce2026-05-19
💬 NLP

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

यह शोध पत्र मल्टी-लेबल कानूनी मिसाल उपचार वर्गीकरण पर लार्ज लैंग्वेज मॉडल्स को बेंचमार्क करने के लिए एक नया विशेषज्ञ-एनोटेटेड डेटासेट और एक नया एवरेज सेवेरिटी एरर मेट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ जेमिनी 2.5 फ्लैश उच्च-स्तरीय कार्यों में उत्कृष्ट है, वहीं GPT-5-mini जटिल सूक्ष्म-स्तरीय स्कीमा पर बेहतर प्रदर्शन करता है।

M. Mikail Demir, M. Abdullah Canbaz2026-05-19
💻 computer science

Divergence-Suppressing Couplings for Rectified Flow

यह शोध पत्र रेक्टिफाइड फ्लो (Rectified Flow) के लिए एक ऑफलाइन सुधार विधि प्रस्तावित करता है जो विकृत प्रक्षेप पथों (trajectories) को सीधा करने के लिए सीखे गए वेग क्षेत्र (velocity field) के अपसारी घटक (divergent component) को दबा देता है, जिससे इन्फरेंस लागत बढ़ाए बिना सिंथेटिक और इमेज बेंचमार्क दोनों पर जनरेशन की गुणवत्ता में सुधार होता है।

Yimeng Min, Carla P. Gomes2026-05-19
💻 computer science

Harnessing LLM Agents with Skill Programs

यह शोध पत्र HASP को प्रस्तुत करता है, जो एक मॉड्यूलर फ्रेमवर्क है जो सलाहकार टेक्स्टुअल स्किल्स (advisory textual skills) को निष्पादनीय प्रोग्राम फंक्शन्स (Program Functions - PFs) में परिवर्तित करता है ताकि इन्फरेंस-टाइम गाइडेंस (inference-time guidance), पोस्ट-ट्रेनिंग सुपरविजन (post-training supervision), या सेल्फ-इम्प्रूवमेंट (self-improvement) के माध्यम से LLM एजेंट लूप्स में सक्रिय रूप से हस्तक्षेप किया जा सके, जिससे वेब सर्च, गणितीय तर्क और कोडिंग जैसे जटिल कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao2026-05-19
💬 NLP

Bridging the Version Gap: Multi-version Training Improves ICD Code Prediction, Especially for Rare Codes

यह शोध पत्र प्रदर्शित करता है कि ICD-9 और ICD-10 डेटा के संयोजन पर एक संशोधित लेबल-वाइज अटेंशन मॉडल को प्रशिक्षित करने से ICD-10 कोड भविष्यवाणी प्रदर्शन में महत्वपूर्ण सुधार होता है, विशेष रूप से दुर्लभ कोडों के लिए, जो कम मापदंडों के साथ संस्करण अंतराल को प्रभावी ढंग से पाटता है और लॉन्ग-टेल समस्या का समाधान करता है।

Jinghui Liu, Anthony Nguyen2026-05-19
🤖 machine learning

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR एक तैनात करने योग्य (deployable) 2-बिट KV कैश क्वांटाइजेशन विधि है जो अटेंशन-अलाइन्ड रोटेशन और क्लिपिंग थ्रेशोल्ड प्राप्त करने के लिए ऑफलाइन स्पेक्ट्रल कोवेरिएंस एस्टीमेशन का लाभ उठाती है, जो आधुनिक LLM सर्विंग फ्रेमवर्क में मेमोरी उपयोग को महत्वपूर्ण रूप से कम करने और इन्फरेंस थ्रूपुट में सुधार करने के साथ-साथ लॉन्ग-कॉन्टेक्स्ट रीजनिंग कार्यों पर लगभग लॉसलेस सटीकता सक्षम करती है।

Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu2026-05-19