💬 NLP

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

यह शोध पत्र डीप डेंस एक्सप्लोरेशन (DDE) का प्रस्ताव करता है, जो DEEP-GRPO के रूप में स्थापित एक नवीन रणनीति है जो असफल प्रक्षेप पथों (trajectories) के भीतर "पिवट" अवस्थाओं की पहचान करके और उन्हें सघन रूप से पुन: नमूनाकरण (resampling) करके LLM सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि उच्च गुणवत्ता वाले समाधानों को कुशलतापूर्वक खोजा जा सके, जिससे यह गणितीय तर्क संबंधी बेंचमार्क पर मौजूदा GRPO और ट्री-आधारित विधियों से बेहतर प्रदर्शन करती है।

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu2026-06-15
🤖 machine learning

NeST: Neuron Selective Tuning for LLM Safety

NeST एक पैरामीटर-कुशल पोस्ट-हॉक सुरक्षा संरेखण ढांचा है जो केवल साधारण दुर्भावनापूर्ण प्रॉम्प्ट्स का उपयोग करके सुरक्षा-प्रासंगिक फीड-फॉरवर्ड न्यूरॉन्स के क्लस्टर्स की पहचान करता है और उन्हें चुनिंदा रूप से ट्यून करता है, जिससे टेक्स्ट और मल्टीमॉडल मॉडल्स में विविध जेलब्रेक्स के विरुद्ध न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ एक मजबूत रक्षा प्राप्त होती है।

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi2026-06-15
🤖 machine learning

Let's Ask Gauss: Improved One-Run Privacy Auditing

यह शोधपत्र "Let's Ask Gauss" प्रस्तुत करता है, जो डिफरेंशियल प्राइवेट मशीन लर्निंग के लिए एक उन्नत वन-रन (one-run) प्राइवेसी ऑडिटिंग फ्रेमवर्क है, जो पूर्ववर्ती बाइनरी-थ्रेशोल्डिंग विधियों की तुलना में कैनरी-अलाइन्ड सिग्नल्स के एसिम्प्टोटिक गॉसियन डिस्ट्रीब्यूशन का लाभ उठाकर अधिक सटीक प्राइवेसी लोअर बाउंड्स प्राप्त करता है।

Adya Agrawal, Yu Wei, Jaspal Singh, Malik Magdon-Ismail, Vassilis Zikas2026-06-15
🤖 machine learning

From Uncertain Judgments to Calibrated Rankings: Conformal Elo Estimation for LLM Evaluation

यह शोध पत्र Conformal Elo प्रस्तुत करता है, जो एक कम लागत वाला मूल्यांकन ढांचा है जो स्थानीय अनिश्चितता का अनुमान लगाने के लिए कैलिब्रेटेड जीत की संभावनाओं को प्रसारित करके और मानव निर्णयों के साथ वैश्विक असहमति को सीमित करने के लिए स्प्लिट कॉन्फॉर्मल प्रेडिक्शन लागू करके LLM रैंकिंग सटीकता को बढ़ाता है, जिससे बड़े पैमाने पर मानव एनोटेशन के बिना विश्वसनीय Elo अनुमान प्रदान किए जाते हैं।

Bora Kargi, David Salinas2026-06-15
🤖 machine learning

Generative Modeling of Bach-Style Symbolic Music: A Comparative Study of Autoregressive, Latent-Variable, and Adversarial Approaches

यह शोध पत्र बाख-शैली के प्रतीकात्मक संगीत (symbolic music) उत्पन्न करने के लिए ऑटोरेग्रेसिव, लेटेंट-वेरिएबल और एडवरसेरियल मॉडलों की तुलना करता है, जिसमें यह पाया गया है कि अटेंशन-आधारित एलएसटीएम (LSTM) सबसे सुसंगत रचनाएँ उत्पन्न करते हैं जबकि वेक्टर-क्वांटाइज्ड वीएई (VAE) संरचित आउटपुट प्रदान करते हैं और एडवरसेरियल नेटवर्क विश्वसनीय सामान्यीकरण (generalization) में संघर्ष करते हैं।

Dezhi Yu, Kyuil Lee, Yongkang Huang2026-06-15
⚡ electrical engineering

Active Inference for Adaptive Traffic Signal Control in Noisy Nonstationary IoT Environments

यह शोध पत्र शोर वाले, गैर-स्थिर (नॉन-स्टेशनरी) IoT वातावरण में आइडल टाइम और CO2 उत्सर्जन को कम करने के लिए अपेक्षित मुक्त ऊर्जा (एक्सपेक्टेड फ्री एनर्जी) को न्यूनतम करके, नियम-आधारित ह्यूरिस्टिक्स और डीप रिइन्फोर्समेंट लर्निंग दोनों से बेहतर प्रदर्शन करने वाले अनुकूलन योग्य यातायात सिग्नल प्रबंधन के लिए एक ट्रैसेबल एक्टिव इन्फरेंस कंट्रोलर का प्रस्ताव करता है।

Dénes Toth, George Ambroladze, Edwin Sundberg, Ali Beikmohammadi, Alfreds Lapkovskis2026-06-15
💻 computer science

Position: AI Must Become Planet-Centered, Not Just Human-Centered

यह शोध पत्र मानव-केंद्रित से ग्रह-केंद्रित एआई (PCAI) की ओर एक प्रतिमान परिवर्तन का तर्क देता है, जो एक ऐसी डिज़ाइन दर्शन है जो सिस्टम थिंकिंग पर आधारित है और जो कृत्रिम बुद्धिमत्ता को वर्तमान अनिश्चितता की गहरी स्थितियों के तहत प्रणालीगत जोखिमों को बढ़ने से रोकने के लिए ग्रह की सामाजिक-पारिस्थितिक स्थिरता की ओर पुनोरिorient करता है।

Maria Perez-Ortiz2026-06-15
📊 statistics

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

यह शोध पत्र लोकलाइज्ड मल्टीडायरेक्शनल करेक्शन (LoMC) प्रस्तुत करता है, जो एक सपोर्ट-गेटेड हस्तक्षेप ढांचा है जो एक संक्षिप्त, पहचाने गए एडिट सपोर्ट के भीतर प्रोटोटाइप सुधार दिशाओं को एकत्रित करके रूटेड फाउंडेशन मॉडल्स में इनकार (refusals) को प्रभावी ढंग से दबाता है, जिससे सामान्य क्षमताओं को संरक्षित करते हुए गैर-इनकार प्रतिक्रियाओं को बढ़ाया जाता है।

Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang2026-06-15
🤖 AI

Hybrid Open-Ended Tri-Evolution Makes Better Deep Researcher

यह शोध पत्र हाइब्रिड ओपन-एंडेड ट्राई-इवोल्यूशन (HOTE) फ्रेमवर्क का प्रस्ताव करता है, जो एक प्रपोजर (proposer), सॉल्वर (solver) और जज (judge) को सहयोगात्मक रूप से विकसित करने के लिए हाइब्रिड-मोड सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करता है, जिससे एक 8B मॉडल को कम समय के ओवरहेड के साथ ओपन-एंडेड कार्यों पर बड़े स्टैटिक और अत्याधुनिक डीप रिसर्च मॉडल्स से बेहतर प्रदर्शन करने में सक्षम बनाया जा सके।

Hongming Piao, Chi Liu, Mengzhuo Chen, Yan Shu, Derek Li, Ying Wei, Bryan Dai2026-06-15
🤖 machine learning

Efficient On-Device Diffusion LLM Inference with Mobile NPU

यह शोध पत्र llada.cpp को प्रस्तुत करता है, जो पहला NPU-सचेत (NPU-aware) इन्फरेंस फ्रेमवर्क है जो मल्टी-ब्लॉक स्पेक्युलेटिव डिकोडिंग, ड्यूल-पाथ प्रोग्रेसिव रिवीज़न और एक स्वैप-ऑप्टिमाइज़्ड मेमोरी रनटाइम का उपयोग करके ऑन-डिवाइस डिफ्यूजन LLMs को त्वरित करता है ताकि मोबाइल हार्डवेयर की सीमाओं को दूर किया जा सके और CPU बेसलाइन की तुलना में 42x तक लेटेंसी में कमी लाई जा सके।

Tuowei Wang, Yanfan Sun, Ju Ren2026-06-15