🤖 machine learning

Generative Frontier Planning for Adaptive Peer-Referral Recruitment under Covariate-Dependent Arrivals

यह शोध पत्र जेनेरेटिव फ्रंटियर प्लानिंग (GFP) को प्रस्तुत करता है, जो एक मॉडल-आधारित एल्गोरिदम है जो एक लेटेंट सरोगेट पर एक डिटरमिनिस्टिक बैकअप का उपयोग करके यथार्थवादी कोवेरिएट-डिपेंडेंट आगमन के तहत एडेप्टिव पीयर-रेफरल भर्ती को अनुकूलित करता है ताकि (11/e)(1-1/e)-अनुमान प्राप्त किया जा सके, जिससे यह मौजूदा रैंडम, सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग), और i.i.d. डायनेमिक प्रोग्रामिंग बेसलाइनों से बेहतर प्रदर्शन करता है।

Lingkai Kong, Hezi Jiang, Andrew Ma, Keyu Wang, Akseli Kangaslahti, Milind Tambe2026-06-09
🤖 machine learning

An Information-Theoretic Definition for Open-Ended Learning

यह शोध पत्र रिवॉर्ड प्राप्ति के लिए आवश्यक सूचना को मापने के लिए "बिट-इक्विवेलेंट" (bit-equivalent) की अवधारणा पर आधारित ओपन-एंडेड लर्निंग की एक सूचना-सैद्धांतिक परिभाषा प्रस्तुत करता है, जो यह प्रदर्शित करता है कि इस मीट्रिक में रैखिक वृद्धि ओपन-एंडेड वातावरण को क्लासिकल बैंडिट्स से अलग करती है और एक ऐसे एल्गोरिदम को प्रस्तुत करती है जो इस तरह की लर्निंग प्राप्त करता है।

Wanqiao Xu, Yifan Zhu, Benjamin Van Roy2026-06-09
🤖 machine learning

Few-step Cofolding with All-Atom Flow Maps

यह शोध पत्र DeCAF को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो अत्याधुनिक ऑल-एटम कोफोल्डिंग डिफ्यूजन मॉडल्स को कुशल फ्यू-स्टेप फ्लो मैप्स में आसुत (distill) करता है, जिससे प्रोटीन-लिगैंड संरचना भविष्यवाणी के लिए सटीकता और भौतिक वैधता को बनाए रखते हुए या उसमें सुधार करते हुए कम्प्यूटेशनल लागत को काफी कम किया जाता है।

Gianluca Scarpellini, Ron Shprints, Peter Holderrieth, Juno Nam, Pranav Murugan, Rafael Gómez-Bombarelli, Tommi Jaakola (…)2026-06-09
🤖 machine learning

RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations

रिस्कनेट (RiskNet) समाचार स्रोतों से प्राप्त एआई जोखिम घटनाओं का एक बड़े पैमाने का, बहुभाषी डेटासेट है जो एआई सुरक्षा, शासन और जोखिम विश्लेषण में अनुभवजन्य अनुसंधान का समर्थन करने के लिए पहचान, संरेखण और बहु-आयामी एनोटेशन के लिए एक संरचित पाइपलाइन का उपयोग करता है।

Leihan Zhang, Wecheng Ye, Xianlong Ma, Haochuan Liu, Yang Li, Qianyu Zhang, Jinliang Chen, Qiang Yan2026-06-09
💰 quantitative finance

TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution

यह शोध पत्र TT-DAC-PS प्रस्तुत करता है, जो एक नवीन नियत (deterministic) एक्टर-क्रिटिक एल्गोरिदम है जिसे पॉलिसी स्मूथिंग और कंजर्वेटिव Q-लर्निंग तकनीकों के साथ उन्नत किया गया है, जो वास्तविक लिमिट ऑर्डर बुक डेटा का उपयोग करके बड़े स्टॉक सेल प्रोग्रामों के लिए इम्प्लीमेंटेशन शॉर्टफॉल को कम करने में शास्त्रीय निष्पादन रणनीतियों और मानक सुदृढीकरण शिक्षण (reinforcement learning) बेसलाइनों दोनों से बेहतर प्रदर्शन करता है।

Ilia Zaznov, Atta Badii, Julian Kunkel, Alfonso Dufour2026-06-09
🤖 machine learning

STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control

STAR-KV एक एडेप्टिव लो-रैंक KV कैश कंप्रेशन फ्रेमवर्क है जो सटीकता में गिरावट को न्यूनतम करते हुए 75% तक कैश कंप्रेशन और 3.1x एंड-टू-एंड थ्रूपुट स्पीडअप प्राप्त करने के लिए डिफरेंशिएबल सॉफ्ट थ्रेशोल्डिंग, हाइब्रिड डिकंपोजिशन और लो-रैंक-अवेयर क्वांटाइजेशन का उपयोग करता है।

Priyansh Bhatnagar, Ashkan Moradifirouzabadi, Se-Hyun Yang, SeungJae Lee, Jungwook Choi, Mingu Kang2026-06-09
📊 statistics

The Spectral Dynamics and Noise Geometry of Muon

यह शोध पत्र म्यूऑन (Muon) ऑप्टिमाइज़र के उस अनूठे तंत्र का विश्लेषण करता है जिसमें मैट्रिक्स ग्रेडिएंट्स को उनके पोलर फैक्टर्स (polar factors) से प्रतिस्थापित करके अपडेट स्पेक्ट्रम को सपाट किया जाता है, जो यह प्रदर्शित करता है कि यह एंट्रॉपी-अधिकतम बनाने वाला दृष्टिकोण नैनोगप्ट (NanoGPT) प्रीट्रेनिंग जैसे विशिष्ट रेगिम्स में स्थिर रैंक और बेहतर प्रदर्शन को बढ़ावा देता है, जबकि इसकी प्रभावशीलता रेगिम-निर्भर बनी रहती है और यह सरल ग्रेडिएंट रीस्केलिंग या लो-रैंक मिनिमाइजेशन से भिन्न है।

Pierfrancesco Beneventano, Mahmoud Abdelmoneum, Tomaso Poggio2026-06-09
📊 statistics

When Are Neural Interaction Discoveries Real? Identifiability, Recoverability, and a Pre-Fit Diagnostic

यह शोध पत्र स्थापित करता है कि तंत्रिका अंतःक्रिया (neural interaction) की खोजों की पहचान क्षमता मौलिक रूप से मॉडल आर्किटेक्चर के बजाय प्रेक्षित इनपुट सपोर्ट (observed input support) की ज्यामिति पर निर्भर करती है, और यह प्रभावी रैंक (effective rank) और एक स्थिरता जांच (stability check) पर आधारित एक प्री-फिट डायग्नोस्टिक पेश करता है ताकि यह निर्धारित किया जा सके कि क्या ऐसी अंतःक्रियाओं को विश्वसनीय रूप से पुनः प्राप्त किया जा सकता है।

Valentina Kuskova, Dmitry Zaytsev, Michael Coppedge2026-06-09
🤖 machine learning

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

यह शोध पत्र स्पैरो (Sparrow) को प्रस्तुत करता है, जो एक गतिशील स्पर्सिटी शेड्यूलिंग विधि है जो स्पार्स-टू-डेंस एक्टर-पॉलिसी मिसमैच के लिए एक महत्वपूर्ण थ्रेशोल्ड बनाए रखकर कुशल लॉन्ग-कॉन्टेक्स्ट सुदृढीकरण लर्निंग (reinforcement learning) को स्थिर करती है, जिससे विभिन्न Qwen3 मॉडलों और डोमेन में महत्वपूर्ण रोलआउट स्पीडअप प्राप्त होता है और साथ ही एक हल्के डिस्टिलस्पार्स (DistillSparse) डिस्टिलेशन तकनीक के माध्यम से प्रदर्शन को और बेहतर बनाया जाता है।

Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram (…)2026-06-09
🤖 machine learning

Theoretical Foundations of Continual Learning via Drift-Plus-Penalty

यह शोध पत्र COLD को प्रस्तुत करता है, जो ड्रिफ्ट-प्लस-पेनल्टी (Drift-Plus-Penalty) सिद्धांत पर आधारित एक कंट्रोल-थ्योरेटिक कॉन्टिनुअल लर्निंग फ्रेमवर्क है, जो गैर-स्थिर (nonstationary) डेटा स्ट्रीम पर अत्याधुनिक प्रदर्शन प्राप्त करने के साथ-साथ कैटास्ट्रोफिक फॉरगेटिंग को कम करने के लिए वर्चुअल क्यूज़ (virtual queues) के माध्यम से स्थिरता-प्लास्टिसिटी (stability-plasticity) के बीच के संतुलन को स्पष्ट रूप से नियंत्रित करता है।

Nazreen Shah, Govinda Arya, Bharath B. N., Ranjitha Prasad2026-06-09