💻 computer science

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA (Decoupled Importance-Sampled Anchoring) एक नवीन ऑफलाइन डिस्ट्रीब्यूशन-मैचिंग RL पद्धति है जो कैलिब्रेशन त्रुटियों को समाप्त करने के लिए इम्पोर्टेंस सैंपलिंग के माध्यम से पार्टीशन फंक्शन अनुमानों को प्री-कंप्यूट और फ्रीज करती है, जिससे यह LLMs को विविध समाधान रणनीतियों को सीखने में सक्षम बनाती है जो रिवॉर्ड-मैक्सिमाइजेशन बेसलाइन और ऑनलाइन-कपल्ड डिस्ट्रीब्यूशन-मैचिंग दृष्टिकोणों दोनों से बेहतर प्रदर्शन करते हैं।

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xumin (…)2026-05-19
💬 NLP

Weak-to-Strong Elicitation via Mismatched Wrong Drafts

यह शोध पत्र प्रदर्शित करता है कि वर्तमान समस्या से मेल न खाने वाले एक छोटे, डोमेन-प्रशिक्षित मॉडल से गणितीय रूप से गलत ड्राफ्ट को एक मजबूत लर्नर के GRPO प्रशिक्षण संदर्भ में इंजेक्ट करना, मानक ऑन-पॉलिक फाइन-ट्यूनिंग और अन्य वेरिएंट्स की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे बिना SFT, रिवॉर्ड मॉडल या सिंथेसाइज्ड डेटा की आवश्यकता के, Mathstral-7B मॉडल के लिए MATH-500 पर 71.98% का एक नया स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होता है।

Wei Deng2026-05-19
🤖 machine learning

Learning Higher-Order Structure from Incomplete Spatiotemporal Data: Multi-Scale Hypergraph Laplacians with Neural Refinement

यह शोध पत्र मल्टी-स्केल हाइपरग्राफ लैपलेसियन्स विद न्यूरल रिफाइनमेंट (MSHL) को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो मल्टी-स्केल हाइपरग्राफ के माध्यम से उच्च-क्रम समूह संबंधों की खोज करके और सुरक्षित, अनुकूली गैर-रेखीय सुधार लागू करके सेंसर नेटवर्क में संरचित लुप्त डेटा को प्रभावी ढंग से प्रतिस्थापित करता है, जिससे यह वास्तविक ट्रैफ़िक परिदृश्यों में पारंपरिक युग्मवार ग्राफ विधियों से बेहतर प्रदर्शन करता है।

Keshu Wu, Sixu Li, Zihao Li, Zhiwen Fan, Xiaopeng Li, Yang Zhou2026-05-19
🤖 machine learning

Leveraging Error Diversity in Group Rollouts for Reinforcement Learning

यह शोध पत्र एरर डाइवर्सिटी एडवांटेज शेपिंग (EDAS) को प्रस्तुत करता है, जो एक हल्का पोस्ट-हॉक तकनीक है जो इंट्रा-ग्रुप एरर डाइवर्सिटी के आधार पर एडवांटेज सिग्नल्स को मॉड्युलेट करके रिइन्फोर्समेंट लर्निंग फ्रॉम वेरिफिएबल रिवार्ड्स (RLVR) को बेहतर बनाता है ताकि बार-बार होने वाली विफलताओं को दंडित किया जा सके और खोजपूर्ण तर्क (एक्सप्लोरेटरी रीजनिंग) को प्रोत्साहित किया जा सके, जिसके परिणामस्वरूप कई बेंचमार्क पर निरंतर प्रदर्शन सुधार प्राप्त होता है।

Wenpu Liu, Yuqi Xu, Weichu Xie, Yongfu Zhu, Shuai Dong, Ziyue Wang, Wenqi Shao, Xiaoying Zhang, Tong Yang, Nan Duan, Jia (…)2026-05-19
🤖 machine learning

Olivia: Harmonizing Time Series Foundation Models with Power Spectral Density

यह शोध पत्र ओलिविया (Olivia) को प्रस्तुत करता है, जो एक नवीन टाइम सीरीज़ फाउंडेशन मॉडल है जो डेटासेट्स को नॉर्मलाइज्ड पावर स्पेक्ट्रल डेंसिटी के माध्यम से संरेखित करने के लिए एक हारमोनाइज़र मॉड्यूल और हार्मोनिकअटेंशन मैकेनिज्म का लाभ उठाता है, जिससे ज़ीरो-शॉट, फ्यू-शॉट और फुल-शॉट पूर्वानुमान परिदृश्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jingru Fei, Kun Yi, Alex Xing Wang, Qingsong Wen, Xiangxiang Zhu, Wei Fan2026-05-19
💻 computer science

Position: Age Estimation Models Do Not Process Biometric Data

यह स्थिति पत्र तर्क देता है कि आयु अनुमान मॉडल बायोमेट्रिक डेटा को संसाधित नहीं करते हैं क्योंकि अनुभवजन्य साक्ष्य दर्शाते हैं कि उनमें व्यक्तिगत पहचान के लिए आवश्यक पहचान-विभेदक क्षमताओं का अभाव है, जो नियामकों से इस प्रकार के क्षणिक प्रसंस्करण को टेम्पलेट भंडारण से अलग करने का आग्रह करता है ताकि अनावश्यक कानूनी बोझ से बचा जा सके।

Nikita Marshalkin2026-05-19
🤖 machine learning

\textsc{MasFACT}: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer

यह शोध पत्र \textsc{MasFACT} प्रस्तुत करता है, जो एक ज्यामिति-जागरूक (geometry-aware) पोस्टीरियर ट्रांसफर फ्रेमवर्क है, जो विकसित होते कार्यों के बीच ऐतिहासिक सहयोग ज्ञान को संरक्षित और पुन: उपयोग करने के लिए फ्यूज्ड ग्रोमोव-वासरस्टीन ऑप्टिमल ट्रांसपोर्ट और PAC-बेयस-निर्देशित अनुकूलन का लाभ उठाकर निरंतर मल्टी-एजेंट सिस्टम में टोपोलॉजी विस्मृति (topology forgetting) को कम करता है।

Xuefei Wang, Jialu Wang, Fengbo Zhang, Yihan Hu, Di Zhang, Yutong Ye, Yikun Ban, Jun Han, Ruijie Wang2026-05-19
💻 computer science

ADR: An Agentic Detection System for Enterprise Agentic AI Security

यह शोध पत्र ADR को प्रस्तुत करता है, जो मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) एजेंटों को सुरक्षित करने के लिए एक उत्पादन-सिद्ध (production-proven) एंटरप्राइज फ्रेमवर्क है, जो ऑब्जर्वेबिलिटी (observability), मजबूती और लागत संबंधी चुनौतियों को दूर करने के लिए हाई-फिडेलिटी टेलीमेट्री, व्यवस्थित रेड टीमिंग और एक स्केलेबल टू-टियर डिटेक्शन सिस्टम को जोड़ता है, जिससे वास्तविक दुनिया के परिनियोजन (deployment) और बेंचमार्क मूल्यांकन में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zh (…)2026-05-19
💻 computer science

Heterogeneous Information-Bottleneck Coordination Graphs for Multi-Agent Reinforcement Learning

यह शोध पत्र हेटेरोजेनियस इंफॉर्मेशन-बॉटलनेक कोऑर्डिनेशन ग्राफ्स (HIBCG) का प्रस्ताव करता है, जो एक सैद्धांतिक रूप से आधारित ढांचा है जो सहकारी मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) के लिए ग्राफ इंफॉर्मेशन बॉटलनेक का उपयोग करके सिद्धांतपूर्ण एज चयन के लिए एक समूह-संरेखित प्रायर (group-aligned prior) और इष्टतम संदेश क्षमता आवंटन के लिए एक वॉटर-फिलिंग सिद्धांत का उपयोग करता है।

Wei Duan, Junyu Xuan, En Yu, Xiaoyu Yang, Jie Lu2026-05-19
💬 NLP

MiniGPT: Rebuilding GPT from First Principles

यह शोध पत्र MiniGPT प्रस्तुत करता है, जो एक संक्षिप्त, सिंगल-नोटबुक PyTorch कार्यान्वयन है जो बिना किसी नए वास्तुशिल्प नवाचार के, टाइनी शेक्सपियर (Tiny Shakespeare) डेटासेट पर कैरेक्टर-लेवल लैंग्वेज मॉडल्स की प्रशिक्षण और पीढ़ी क्षमताओं को प्रदर्शित करने के लिए प्रथम सिद्धांतों (first principles) से मूल GPT ऑटोरेग्रेसिव पाइपलाइन को पुनर्गठित करता है।

Jibin Joseph2026-05-19