🤖 machine learning

ParetoPilot: Zero-Surrogate Offline Multi-Objective Optimization via Infer-Perturb-Guide Diffusion

ParetoPilot एक नवीन ज़ीरो-सरोगेट डिफ्यूजन फ्रेमवर्क है जो ऑफलाइन मल्टी-ऑब्जेक्टिव ऑप्टिमाइज़ेशन के लिए है, जो जनरेशन को विविध पारेटो-ऑप्टिमल समाधानों की ओर गतिशील रूप से निर्देशित करने के लिए डीनॉइज़िंग प्रक्रिया के भीतर एक इन्फर-पर्टर्ब-गाइड इंजन को समाहित करके बाहरी सरोगेट मॉडल की आवश्यकता को समाप्त करता है।

Ruiqing Sun, Sen Yang, Dawei Feng, Bo Ding, Yijie Wang, Huaimin Wang2026-06-04
🤖 AI

AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning

AgentJet एक लचीला, वितरित स्वार्म ट्रेनिंग फ्रेमवर्क है जो हेट्रोजेनियस मल्टी-मॉडल रिइन्फोर्समेंट लर्निंग, फॉल्ट-टॉलरेंट मल्टी-टास्क ट्रेनिंग और लाइव कोड इटरेशन को सक्षम करने के लिए एजेंट निष्पादन को मॉडल अनुकूलन से अलग करता है, जबकि स्वायत्त लॉन्ग-होरिज़न आरएल रिसर्च के लिए एक स्वचालित प्रणाली पेश करता है।

Qingxu Fu, Boyin Liu, Shuchang Tao, Zhaoyang Liu, Bolin Ding2026-06-04
🤖 machine learning

LimiX-2M: Mitigating Low-Rank Collapse and Attention Bottlenecks in Tabular Foundation Models

यह शोध पत्र LimiX-2M को प्रस्तुत करता है, जो एक 2M-पैरामीटर वाला टैबुलर फाउंडेशन मॉडल है, जो बेहतर वैल्यू सेंसिटिविटी के लिए RaBEL वाले एक एकीकृत टोकेनाइज-एंड-रूट फ्रेमवर्क और अनुकूलित कॉन्टेक्स्ट एग्रीगेशन के लिए एक S\rightarrowN\rightarrowF पुनर्व्यवस्थित ब्लॉक का उपयोग करके सटीकता और दक्षता में बड़े बेसलाइन्स से बेहतर प्रदर्शन करता है।

Yuanrui Wang, Xingxuan Zhang, Han Yu, Mingchao Ming, Gang Ren, Hao Yuan, Li Mao, Yunjia Zhang, Chun Yuan, Peng Cui2026-06-04
📊 statistics

Global Sketch-Based Watermarking for Diffusion Language Models

यह शोध पत्र मास्क्ड डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन वैश्विक, क्रम-अज्ञेय (order-agnostic) वॉटरमार्किंग योजना प्रस्तावित करता है जो डिटेक्शन को स्थानीय जेनरेशन कॉन्टेक्स्ट से अलग करने के लिए एक वेक्टर-वैल्यूड स्केच रिप्रेजेंटेशन का उपयोग करता है, जो पारंपरिक ऑटोरेग्रेसिव टोकन-बायस विधियों की तुलना में विशिष्ट लाभ प्रदान करता है।

Daniel Zhao2026-06-04
🤖 machine learning

Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots

यह शोध पत्र पिवटट्रेस (PivotTrace) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो अनलेबल डेटा में अनिश्चितता को मापने के लिए मेटाकॉग्निटिव पिवोट्स (metacognitive pivots) को ट्रैक करने हेतु अटेंशन डायनेमिक्स का लाभ उठाता है, जिससे सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण शिक्षण (Reinforcement Learning with Verifiable Rewards - RLVR) को कुशल बनाया जा सके, जो पूरी तरह से पर्यवेक्षित दृष्टिकोणों की तुलना में काफी कम एनोटेटेड नमूनों और तेज़ अभिसरण (convergence) के साथ बेहतर प्रदर्शन प्राप्त करता है।

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Bowen Song, Weiqiang Wang (…)2026-06-04
💬 NLP

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA एक स्पार्स (sparse), डिकपल्ड अटेंशन आर्किटेक्चर पेश करता है जिसमें एक समर्पित "फोरकास्ट" (Forecast) प्रोजेक्शन है जो कुशल लुकअहेड सिलेक्शन और ओवरलैपिंग CPU-GPU प्रीफेचिंग को सक्षम बनाता है, जिससे KV कैश बाधाओं को दूर किया जा सकता है और चयन जटिलता को कम करते हुए सटीकता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को महत्वपूर्ण रूप से त्वरित किया जा सकता है।

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa2026-06-04
🤖 machine learning

GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling

GeoMin एक डेटा-कुशल सेमी-सुपरवाइज्ड सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो सही और गलत रोलआउट्स के बीच अंतर करने के लिए वैश्विक फीचर वितरणों को मॉडल करता है, जिससे यह अनलेबल उदाहरणों का प्रभावी ढंग से लाभ उठाकर केवल 10% एनोटेशन डेटा का उपयोग करके भी पूरी तरह से सुपरवाइज्ड मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।

Guangcheng Zhu, Shenzhi Yang, Haobo Wang, Xing Zheng, Yingfan MA, Xuening Feng, Zhongqi Chen, Kai Tang, Zhengqing Zang (…)2026-06-04
🤖 AI

ANN Search: Recall What Matters

यह शोध पत्र यह तर्क देता है कि एप्रोक्सिमेट नियरएस्ट नेबर (ANN) सर्च के लिए मानक रिकॉल@k (Recall@k) मीट्रिक वास्तविक उपयोगिता के लिए एक त्रुटिपूर्ण प्रॉक्सी है क्योंकि यह परिणाम की गुणवत्ता के बजाय सेट ओवरलैप को प्राथमिकता देता है, और इसके स्थान पर इनवर्स एप्रोक्सिमेशन रेशियो (1/Ratio@k) प्रस्तावित करता है जो एक अधिक सटीक, कुशल और तैनात करने योग्य मीट्रिक है जो अनावश्यक कम्प्यूटेशनल ओवरहेड को कम करते हुए डाउनस्ट्रीम टास्क प्रदर्शन के साथ बेहतर सहसंबंध रखता है।

Dimitris Dimitropoulos, Nikos Mamoulis2026-06-04
🤖 machine learning

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

यह शोध पत्र रोलआउट-लेवल एडवांटेज-प्रायोरिटाइज्ड एक्सपीरियंस रिप्ले (Rollout-Level Advantage-Prioritized Experience Replay) का प्रस्ताव करता है, जो एक ऐसी विधि है जो एज इविक्शन (age eviction) और फ्रेश-एंकर्ड कंपोजिशन (fresh-anchored composition) के माध्यम से स्टेलेनेस (staleness) को सीमित करते हुए एडवांटेज मैग्नीट्यूड (advantage magnitude) के आधार पर व्यक्तिगत रोलआउट्स को संग्रहीत और प्राथमिकता देकर GRPO की सैंपल इनएफिशिएंसी (sample inefficiency) को कम करती है, जिसके परिणामस्वरूप विभिन्न गणितीय बेंचमार्क पर विभिन्न मॉडल स्केल्स पर महत्वपूर्ण प्रदर्शन और दक्षता लाभ प्राप्त होते हैं।

Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon2026-06-04
🤖 machine learning

SurvPFN: Towards Foundation Models for Survival Predictions

यह शोध पत्र SurvPFN को प्रस्तुत करता है, जो लाखों सिंथेटिक कार्यों पर प्री-ट्रेन्ड एक प्रायर-डेटा फिटेड नेटवर्क है ताकि फाउंडेशन मॉडल्स को सर्वाइवल प्रेडिक्शन के लिए सेंसर डेटा को संभालने में सक्षम बनाया जा सके, जिससे प्रति-डेटासेट फिटिंग या विशिष्ट आर्किटेक्चर की आवश्यकता के बिना वास्तविक दुनिया के डेटासेट पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Samuel Böhm (Institute of Epidemiology and Prevention, Medical Center - University of Freiburg, Faculty of Medicine, Uni (…)2026-06-04