💬 NLP

MiniPIC: Flexible Position-Independent Caching in <100LOC

MiniPIC एक न्यूनतम, लचीला vLLM डिज़ाइन है जो बार-बार आने वाले संरचित इनपुट्स के लिए कुशल स्थिति-स्वतंत्र (position-independent) कैशिंग को सक्षम बनाता है, जो अनरोटेटेड (unrotated) K वेक्टर्स को स्टोर करता है और अटेंशन के दौरान प्रति-अनुरोध पोजीशनल एनकोडिंग लागू करता है, जिससे 100 से कम कोर-इंजन परिवर्तनों के साथ महत्वपूर्ण थ्रूपुट और लेटेंसी सुधार प्राप्त होता है।

Nathan Ordonez (IBM Research), Thomas Parnell (IBM Research)2026-06-12
🤖 machine learning

Learning-Augmented Approximation for Unrelated-Machines Makespan Scheduling

यह शोधपत्र अनरिलेटेड-मशीन मेक्सपैन शेड्यूलिंग के लिए एक लर्निंग-ऑगमेंटेड एल्गोरिदम प्रस्तुत करता है जो सटीक भविष्यवाणियों के लिए बहुपद-समय (polynomial-time) (1+ε)(1+\varepsilon)-अनुमान प्राप्त करता है और जैसे-जैसे भविष्यवाणी की त्रुटि बढ़ती है, सुचारू रूप से सबसे खराब स्थिति वाले 2-अनुमान तक घट जाता है, जिससे चयन समस्याओं से परे एंटोनियाडिस एट अल (Antoniadis et al.) के ढांचे का विस्तार होता है।

Kaito Baba, Evripidis Bampis, Giorgos Mitropoulos2026-06-12
🤖 machine learning

Loss-Shift Transfer via Bayes Quotients

यह शोध पत्र "लॉस शिफ्ट" (loss shift) की अवधारणा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक स्थिर डेटा वितरण के बावजूद, एक मोटा (coarser) लॉस होने पर अनुकूलतम रहने वाला प्रतिनिधित्व एक सख्त सूक्ष्म (finer) लॉस के लिए अपर्याप्त हो सकता है, एक ऐसी घटना जिसे बेयस कोटिएंट्स (Bayes quotients) के माध्यम से औपचारिक रूप दिया गया है जहाँ परिणामी प्रदर्शन अंतराल को उस सशर्त सूचना (conditional information) द्वारा परिमाणित किया जाता है जो प्रतिनिधित्व द्वारा लक्ष्य चर (target variable) के बारे में त्याग दी गई है।

Vasileios Sevetlidis2026-06-12
💬 NLP

Understanding helpfulness and harmless tension in reward models

यह शोध पत्र RLHF में रिवॉर्ड मॉडल्स के आंतरिक तंत्रों की जांच करता है, जो यह प्रकट करता है कि हेल्पफुलनेस (helpfulness) और हार्मलेसनेस (harmlessness) उद्देश्यों के बीच का हस्तक्षेप उन साझा न्यूरॉन्स से उत्पन्न होता है जो एक लक्ष्य का कारण से समर्थन करते हैं जबकि दूसरे को कमजोर करते हैं, जिससे यह स्पष्ट होता है कि मिश्रित-उद्देश्य वाले मॉडल अक्सर एकल-उद्देश्य वाले मॉडल्स की तुलना में खराब प्रदर्शन क्यों करते हैं।

Eshaan Tanwar, Pepa Atanasova2026-06-12
💬 NLP

Layer-Resolved Optimal Transport for Hallucination Detection in NMT and Abstractive Summarization

यह शोध पत्र न्यूरल मशीन ट्रांसलेशन और एब्स्ट्रैक्टिव समराइजेशन में मतिभ्रम (hallucinations) का पता लगाने के लिए क्रॉस-अटेंशन डिस्ट्रीब्यूशन के लेयर-रिजॉल्व्ड ऑप्टिमल ट्रांसपोर्ट विश्लेषण का विस्तार करता है, जो सोर्स डिसएंगेजमेंट (source disengagement) को पहचानने में अपनी प्रभावशीलता को प्रदर्शित करता है और साथ ही उन फौथफुलनेस विफलताओं (faithfulness failures) का पता लगाने में अपनी अंतर्निहित सीमाओं को रेखांकित करता है जहाँ अटेंशन सही रहता है लेकिन सामग्री गलत तरीके से प्रस्तुत की जाती है।

Mariia Onyshchuk, Maksym-Vasyl Tarnavskyi, Marta Sumyk2026-06-12
📊 statistics

Decoding Insect Song: A Multitask Semisupervised Orthoptera Bioacoustic Classifier

यह शोध पत्र PULSE को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semi-supervised), बहु-कार्य (multi-task) ढांचा है जो ऑर्थोप्टेरा (Orthoptera) प्रजातियों के वर्गीकरण में अत्याधुनिक सामान्य मॉडलों से काफी बेहतर प्रदर्शन करता है और स्व-पर्यवेक्षित शिक्षण (self-supervised learning) एवं ज्ञान आसवन (knowledge distillation) के माध्यम से पारिस्थितिक रूप से सार्थक पैटर्न प्रकट करता है।

Olga Isupova, Danil Kuzin, Ella Browning, Tom Mills, Steven Reece2026-06-12
📊 statistics

Towards More General Control of Diffusion Models Using Jeffrey Guidance

यह शोध पत्र जेफ्री गाइडेंस (Jeffrey guidance) प्रस्तुत करता है, जो एक सिद्धांतपूर्ण ढांचा है जो मानक सशर्त नमूनाकरण (conditional sampling) से परे डिफ्यूजन मॉडल नियंत्रण को विस्तारित करने के लिए जेफ्री के नियम का लाभ उठाता है, जो संयुक्त वितरण (joint distribution) को न्यूनतम रूप से बाधित करते हुए निर्धारित लक्ष्यों की ओर सीमांत वितरणों (marginal distributions) को अपडेट करता है, जिससे बेहतर छवि गुणवत्ता और निष्पक्षता प्राप्त होती है।

Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei2026-06-12
🤖 AI

Different Layers, Different Manifolds: Module-Wise Weight-Space Geometry in Transformer Optimization

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर अनुकूलन (transformer optimization) मॉड्यूल-विशिष्ट मैनिफोल्ड बाधाओं (module-specific manifold constraints) से लाभान्वित होता है, विशेष रूप से यह दिखाते हुए कि अटेंशन परतों पर स्टिफ़ल ज्यामिति (Stiefel geometry) और एमएलपी परतों पर डीग्राम ज्यामिति (DGram geometry) लागू करना अटेंशन वेट्स में सिंगुलर वैल्यू वृद्धि के कारण होने वाली अस्थिरता को रोकने के लिए समान कॉन्फ़िगरेशन की तुलना में बेहतर प्रदर्शन करता है।

Kirato Yoshihara2026-06-12
📊 statistics

ProtoX-AD: Self-Explainable Time Series Anomaly Detection and Characterization

ProtoX-AD एक स्व-व्याख्यात्मक (self-explainable), प्रोटोटाइप-आधारित ढांचा है जो विसंगतिपूर्ण प्रोफाइल्स की अर्थपूर्ण व्याख्यात्मकता प्रदान करते हुए प्रतिस्पर्धी टाइम सीरीज़ विसंगति पहचान प्रदर्शन प्राप्त करता है, जो मौजूदा स्व-पर्यवेक्षित वर्गीकरण विधियों में व्याख्यात्मकता की कमी को संबोधित करता है।

Aitor Sánchez-Ferrera, Elisabeth Wetzer, Kristoffer Wickstrøm, Michael Kampffmeyer, Robert Jenssen2026-06-12
🔢 mathematics

Clipping Makes Distributed and Federated Asynchronous SGD Robust to Stragglers

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि ग्रेडिएंट क्लिपिंग, एक सब-वीबुल (sub-Weibull) शोर मॉडल का उपयोग करके अपेक्षित और उच्च-प्रायिकता अभिसरण गारंटी स्थापित करते हुए, अधिकतम विलंब पर अभिसरण दरों की निर्भरता को समाप्त करके स्ट्रैग्लर्स (stragglers) के विरुद्ध एसिंक्रोनस स्टोकेस्टिक ग्रेडिएंट डिसेंट की मजबूती को बढ़ाता है।

Samuel Erickson, Mikael Johansson2026-06-12