🤖 machine learning

DOT-MoE: Differentiable Optimal Transport for MoEfication

DOT-MoE एक नवीन फ्रेमवर्क है जो न्यूरॉन डीकंपोजिशन को एक डिफरेंशिएबल ऑप्टिमल ट्रांसपोर्ट समस्या के रूप में स्वरूपित करके प्री-ट्रेंड डेंस LLMs को कुशल मिक्चर ऑफ एक्सपर्ट्स मॉडल्स में परिवर्तित करता है, जो असाइनमेंट्स के एंड-टू-एंड लर्निंग को सक्षम बनाता है जो मौजूदा ह्यूरिस्टिक विधियों से काफी बेहतर प्रदर्शन करता है और साथ ही 50% कम सक्रिय पैरामीटर्स के साथ मूल प्रदर्शन का 90% बनाए रखता है।

Udbhav Bamba, Arnav Chavan, Aryamaan Thakur, Steve Teig, Deepak Gupta2026-06-02
🤖 machine learning

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS एक एजेंटिक टेस्ट-टाइम स्केलिंग फ्रेमवर्क पेश करता है जहाँ एक LLM ऑर्केस्ट्रेटर पूरी रीजनिंग प्रक्रिया को गतिशील रूप से नियंत्रित करता है—जिसमें यह शामिल है कि कब अन्वेषण करना है, किस सॉल्वर का उपयोग करना है, और उत्तरों को कैसे संश्लेषित करना है—जो विविध बेंचमार्क पर फिक्स्ड-वर्कफ्लो बेसलाइन से बेहतर प्रदर्शन करता है और साथ ही API कॉल लागत को काफी कम करता है।

Peijia Qin, Qi Cao, Pengtao Xie2026-06-02
🤖 machine learning

RDA: Reward Design Agent for Reinforcement Learning

यह शोध पत्र RDA को प्रस्तुत करता है, जो एक विज़न-लैंग्वेज मॉडल-आधारित एजेंट है जो ट्रैजेक्टरीज (trajectories) का दृश्य रूप से मूल्यांकन करके और मानव निर्देशों के साथ बेहतर संरेखण प्राप्त करने के लिए रिवॉर्ड कोड को पुनरावृत्ति के साथ परिष्कृत करके सुदृढीकरण शिक्षण (reinforcement learning) रिवॉर्ड डिज़ाइन में सुधार करता है, जबकि उच्च कार्य सफलता दर बनाए रखता है।

Hojoon Lee, Ajay Subramanian, Ben Abbatematteo, Vijay Veerabadran, Pedro Matias, Karl Ridgeway, Nitin Kamra2026-06-02
💻 computer science

Don't Let a Few Network Failures Slow the Entire AllReduce

यह शोध पत्र OptCC को प्रस्तुत करता है, जो एक नवीन चार-चरणीय पाइपलाइन वाला AllReduce एल्गोरिदम है जो बड़े पैमाने के GPU क्लस्टर्स में नेटवर्क विफलताओं के कारण होने वाले प्रदर्शन ह्रास को कम करने के लिए एक सूचना-सैद्धांतिक निचली सीमा (information-theoretic lower bound) का लाभ उठाता है, और 50% तक बैंडविड्थ हानि के साथ भी दोष-मुक्त गति के करीब पहुंच प्राप्त करता है।

Peiqing Chen, Jiedong Jiang, Nengneng Yu, Yuefeng Wang, Sixian Xiong, Wei Wang, Zaoxing Liu2026-06-02
💬 NLP

Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning

यह शोध पत्र चंक-लेवल गाइडेड जनरेशन (Chunk-Level Guided Generation) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो छोटे मॉडलों से निश्चित लंबाई के रीजनिंग चंक्स (reasoning chunks) चुनने के लिए ऑफ-द-शेल्फ लार्ज लैंग्वेज मॉडल्स को प्रोसेस स्कोरर्स के रूप में उपयोग करता है, जो प्रभावी रूप से त्रुटि प्रसार (error propagation) को रोकता है और गणितीय बेंचमार्क पर मेजरिटी वोटिंग (majority voting) और प्रशिक्षित प्रोसेस रिवॉर्ड मॉडल्स (Process Reward Models) दोनों से बेहतर प्रदर्शन करता है।

Atoosa Chegini, Soheil Feizi2026-06-02
🤖 machine learning

CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models

यह शोध पत्र CANARY को प्रस्तुत करता है, जो एक ज़ीरो-लेबल फ्रेमवर्क है जो स्पार्स ऑटोएनकोडर (Sparse Autoencoders) के माध्यम से हिडन-स्टेट ज्योमेट्री (hidden-state geometry) का विश्लेषण करके लैंग्वेज मॉडल्स में फाइन-ट्यूनिंग कंटैमिनेशन (fine-tuning contamination) का पता लगाता है, उसे सत्यापित करता है और उसका उपचार करता है, और उन कंटैमिनेशन स्तरों पर भी पूर्ण डिटेक्शन प्राप्त करता है जो 1% तक कम हैं जहाँ पारंपरिक आउटपुट-लेवल डिफेंस विफल हो जाते हैं।

Swapnil Parekh2026-06-02
💻 computer science

KDH-CAD: Knowledge-data hybrid CAD learning under data scarcity

यह शोध पत्र KDH-CAD को प्रस्तुत करता है, जो एक ज्ञान-डेटा हाइब्रिड फ्रेमवर्क है जो प्रीट्रेंड फाउंडेशन मॉडल्स को संरचित डोमेन ज्ञान और न्यूनतम लेबल किए गए डेटा के साथ एकीकृत करके CAD लर्निंग में डेटा की कमी को संबोधित करता है ताकि बिना फाइन-ट्यूनिंग के लो-डेटा रिजीम में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Ziqin Gao, Zhijie Yang, Qiang Zou2026-06-02
🤖 machine learning

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

यह शोध पत्र 2FFS को प्रस्तुत करता है, जो एक नवीन टू-फिडेलिटी (two-fidelity) ट्री-सर्च एल्गोरिदम है जो सस्ते, पक्षपाती ह्यूरिस्टिक मूल्यांकन और महंगे, सटीक रोलआउट्स के बीच अनुकूल रूप से संतुलन बनाकर स्टोकेस्टिक मिनिमैक्स पेड़ों में सर्वश्रेष्ठ क्रिया की कुशलतापूर्वक पहचान करता है, जिससे मौजूदा बेसलाइनों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ निश्चित-कॉन्फिडेंस शुद्धता प्राप्त की जा सकती है।

Peter Chen, Xi Chen2026-06-02
💻 computer science

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

यह शोध पत्र डेंसिटी-अवेयर ट्रांसलेशन (DAT) का प्रस्ताव करता है, जो एक अंशांकन (कैलिब्रेशन) विधि है जो CLIP फीचर स्पेस की एनिसोट्रोपिक ज्यामिति के कारण उत्पन्न होने वाले स्प्यूरियस कोरिलेशन के प्रवर्धन को कम करने के लिए स्थानीय एम्बेडिंग डेंसिटी के आधार पर इमेज-टेक्स्ट सिमिलैरिटी स्कोर को रीस्केल करके ज़ीरो-शॉट VLM वर्गीकरण में सुधार करता है।

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani2026-06-02
🤖 machine learning

Fair Finetuning Mitigates Distribution Inference Attacks

यह शोध पत्र फेयर फाइन-ट्यूनिंग (FFt) प्रस्तुत करता है, जो एक ऐसी विधि है जो इक्वलाइज्ड ऑड्स (Equalized Odds) बाधाओं के तहत पूरक डेटा पर मॉडलों को फाइन-ट्यून करके डिस्ट्रीब्यूशन इन्फरेंस हमलों को कम करती है, जो सैद्धांतिक रूप से यह सिद्ध करता है कि एडवरसेरियल लाभ निष्पक्षता विषमता (fairness disparity) द्वारा सीमित है और विविध डेटासेटों में हमले की सफलता में महत्वपूर्ण कमी को अनुभवजन्य रूप से प्रदर्शित करता है।

Rakshit Naidu2026-06-02✓ Author reviewed