🤖 machine learning

TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels

TraCeS एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो ज्ञात लागत फलन (cost function) या थ्रेशोल्ड की आवश्यकता के बिना, विरल प्रक्षेपवक्र-स्तर (sparse trajectory-level) के लेबल से प्रति-टाइमस्टेप सुरक्षा उल्लंघन क्रेडिट सीखता है, जिससे निरंतर-नियंत्रण कार्यों में बाधा संतुष्टि और फीडबैक दक्षता में सुधार होता है।

Siow Meng Low, Ze Gong, Akshat Kumar2026-07-01
💬 NLP

From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary

यह सर्वेक्षण टिप्पणीकार की क्षमताओं पर आधारित एक एकीकृत ढांचे और नवीन वर्गीकरण को पेश करते हुए, एआई-जनित गेम कमेंट्री अनुसंधान की खंडित स्थिति को संबोधित करता है, साथ ही क्षेत्र में भविष्य की प्रगति का मार्गदर्शन करने के लिए विधियों, डेटासेट और मूल्यांकन मेट्रिक्स की एक व्यापक समीक्षा प्रदान करता है।

Qirui Zheng, Xingbo Wang, Keyuan Cheng, Yunlong Lu, Muhammad Asif Ali, Lingfeng Li, Yongyi Wang, Wenxin Li2026-07-01
📊 statistics

Physics-Constrained Fine-Tuning of Flow-Matching Models for Generation and Inverse Problems

यह शोध पत्र एक ऐसे ढांचे (framework) को प्रस्तुत करता है जो भौतिक रूप से सुसंगत समाधान उत्पन्न करने और वैज्ञानिक प्रणालियों में व्युत्क्रम समस्याओं (inverse problems) को हल करने के लिए डिफरेंशिएबल PDE रेसिडुअल मिनिमाइजेशन और संयुक्त लेटेंट पैरामीटर ऑप्टिमाइज़ेशन के माध्यम से फ्लो-मैचिंग जनरेटिव मॉडल्स को फाइन-ट्यून करता है।

Jan Tauberschmidt, Sophie Fellenz, Sebastian J. Vollmer, Andrew B. Duncan2026-07-01
🤖 machine learning

One Shot vs. Iterative: Rethinking Pruning Strategies for Model Compression

यह शोध पत्र वन-शॉट (one-shot) और पुनरावृत्ति (iterative) प्रूनिंग रणनीतियों की व्यवस्थित रूप से तुलना करता है, जो यह प्रकट करता है कि वन-शॉट विधियाँ कम प्रूनिंग अनुपात पर उत्कृष्ट होती हैं जबकि पुनरावृत्ति दृष्टिकोण उच्च अनुपातों पर बेहतर होते हैं, जिससे अनुकूलित मॉडल संपीड़न के लिए एक हाइब्रिड दृष्टिकोण और धैर्य-आधारित (patience-based) प्रूनिंग का प्रस्ताव मिलता है।

Mikołaj Janusz, Tomasz Wojnar, Yawei Li, Luca Benini, Kamil Adamczewski2026-07-01
💬 NLP

Deductive Logic in Language Models: Horizontal vs Vertical Reasoning

यह शोध पत्र इस बात की जांच करता है कि सिंथेटिक निगमनात्मक कार्यों (synthetic deductive tasks) पर प्रशिक्षित छोटे ट्रांसफार्मर मॉडल किस प्रकार विशिष्ट क्षैतिज (ऑटोरेग्रेसिव) और ऊर्ध्वाधर (निहित) तंत्रों के माध्यम से तर्क को लागू करते हैं, जो यह प्रकट करता है कि चेन-ऑफ-थॉट (Chain-of-Thought) पर्यवेक्षण क्षैतिज परिवेश में वास्तविक नियम-आधारित अनुमान को बढ़ावा देता है, जबकि ऊर्ध्वाधर परिवेश में जटिल तर्क पैटर्न विकसित करने के लिए पाठ्यक्रम शिक्षण (curriculum learning) के रूप में कार्य करता है।

Davide Maltoni, Matteo Ferrara2026-07-01
🤖 machine learning

Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning

यह शोध पत्र डिफ्यूजन मॉडल्स के लिए एक चयनात्मक अनलर्निंग दृष्टिकोण प्रस्तावित करता है जो उनके असमान फॉरगेटिंग डायनेमिक्स के आधार पर विशिष्ट समय और आवृत्ति घटकों को लक्षित करता है, जिससे मौजूदा यूनिफॉर्म विधियों की तुलना में उच्च अनलर्निंग सफलता दर और बेहतर जनरेशन गुणवत्ता प्राप्त होती है।

Jinseong Park, Mijung Park2026-07-01
🤖 AI

DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing

यह शोध पत्र DDSA को प्रस्तुत करता है, जो एक संसाधन-कुशल प्रतिकूल सुदृढ़ता परीक्षण ढांचा (adversarial robustness testing framework) है जो महत्वपूर्ण फ्रेमों को रणनीतिक रूप से चुनने और एक दोहरे-डोमेन दृष्टिकोण के माध्यम से प्रभावशाली पिक्सेल क्षेत्रों को लक्षित करके वास्तविक समय की इमेज प्रणालियों में कम्प्यूटेशनल उपयोग को अनुकूलित करता है।

Jinwei Hu, Shiyuan Meng, Yi Dong, Xiaowei Huang2026-07-01
🤖 AI

Reward Redistribution for CVaR MDPs using a Bellman Operator on L-infinity

यह शोध पत्र मार्कोव डिसीजन प्रोसेसिस (Markov Decision Processes) में स्टैटिक कंडीशनल वैल्यू-एट-रिस्क (CVaR) के लिए एक नवीन स्टेट-ऑगमेंटेशन फॉर्मूलेशन प्रस्तावित करता है जो सघन पुरस्कारों (dense rewards) और एक कॉन्ट्रैक्टिंग बेलमैन ऑपरेटर को सक्षम बनाता है, जिससे अभिसरण योग्य जोखिम-अवरोधक वैल्यू इटरेशन और Q-लर्निंग एल्गोरिदम प्राप्त होते हैं जिनके प्रमाणित सन्निकटन सीमाएँ (approximation bounds) और प्रभावी सुरक्षा-प्रदर्शन ट्रेड-ऑफ्स हैं।

Aneri Muni, Vincent Taboga, Esther Derman, Pierre-Luc Bacon, Erick Delage2026-07-01
📈 economics

DeXposure-FM: A Time-series, Graph Foundation Model for Credit Exposures and Stability on Decentralized Financial Networks

DeXposure-FM एक नवीन टाइम-सीरीज ग्राफ फाउंडेशन मॉडल है जिसे एक विशाल मल्टी-चेन डेटासेट पर प्रशिक्षित किया गया है जो DeFi क्रेडिट एक्सपोजर के पूर्वानुमान में मौजूदा तरीकों से बेहतर प्रदर्शन करता है और मैक्रोप्रूडेंशियल निगरानी तथा प्रणालीगत जोखिम स्ट्रेस टेस्टिंग के लिए आवश्यक उपकरण प्रदान करता है।

Aijie Shu, Wenbin Wu, Gbenga Ibikunle, Fengxiang He2026-07-01
🤖 AI

Improved Upper Bounds for Slicing the Hypercube

यह शोध पत्र एक nn-आयामी हाइपरक्यूब के सभी किनारों (edges) को काटने के लिए आवश्यक हाइपरप्लेन की न्यूनतम संख्या के ज्ञात ऊपरी बाउंड (upper bound) को 5n/6\lceil 5n/6 \rceil से घटाकर लगभग 4n/54n/5 तक सुधारता है, जो कि CPro1 टूल का उपयोग करके n=10n=10 के लिए एक विशिष्ट समाधान का निर्माण करके प्राप्त किया गया है, जो रीजनिंग LLMs को ऑटोमेटेड हाइपरपैरामीटर ट्यूनिंग के साथ जोड़ता है।

Duncan Soiffer, Nathaniel Itty, Christopher D. Rosin, Blake Bruell, Mason DiCicco, Gábor N. Sárközy, Ryan Offstein, Dani (…)2026-07-01