🤖 AI

Robust and Efficient Guardrails with Latent Reasoning

यह शोध पत्र COLAGUARD को प्रस्तुत करता है, जो एक गार्डरेल मॉडल है जो स्पष्ट रीजनिंग बेसलाइन की तुलना में इन्फरेंस लेटेंसी और टोकन उपयोग को काफी कम करते हुए, अत्याधुनिक सुरक्षा प्रदर्शन प्राप्त करने के लिए मल्टी-स्टेप सुरक्षा तर्क को एक निरंतर लेटेंट स्पेस (continuous latent space) में स्थानांतरित करता है।

Siddharth Sai, Xiaofei Wen, Muhao Chen2026-05-29
🤖 machine learning

Ensemble Score Filtering for Real-Data Energy Consumption Forecast Correction

यह शोध पत्र वास्तविक दुनिया के ऊर्जा उपभोग डेटा के लिए एक पूर्व-प्रशिक्षित ब्लैक-बॉक्स स्थानिक-कालिक मॉडल के पूर्वानुमानों को सुधारने के लिए एन्सेम्बल स्कोर फ़िल्टर (EnSF) का उपयोग करने का प्रस्ताव देता है, जो यह प्रदर्शित करता है कि EnSF आंशिक और शोर वाले अवलोकनों को प्रभावी ढंग से संभालता है और गैर-रेखीय सेटिंग्स में एन्सेम्बल कलमान फ़िल्टर से बेहतर प्रदर्शन करता है।

Ruoyu Hu, Dahai Yu, Feng Bao, Guang Wang, Guannan Zhang2026-05-29
🤖 AI

Bridging the Sim-to-Real Gap in Reinforcement Learning-Based Industrial Dispatching through Execution Semantics

यह शोध पत्र एक नीति-तटस्थ (policy-neutral) निष्पादन और मापन परत का प्रस्ताव करता है जो वैध निर्णय स्नैपशॉट्स का निर्माण करके, स्पष्ट क्रिया स्वीकार्यता को परिभाषित करके, और निष्पादन विचलन को संरचनात्मक रूप से आरोपित करके औद्योगिक सुदृढीकरण शिक्षण (reinforcement learning) प्रेषण में सिम-टू-रियल अंतराल को पाटता है, जिससे अनिश्चितता को नीति परिशोधन के लिए कार्रवाई योग्य पर्यवेक्षी डेटा में परिवर्तित किया जा सके।

Jonathan Hoss, Noah Klarmann2026-05-29
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

यह शोध पत्र OISD को प्रस्तुत करता है, जो एक नवीन ऑन-पॉलिसी इंटरनल सेल्फ-डिस्टिलेशन फ्रेमवर्क है जो GRPO ऑप्टिमाइज़ेशन के दौरान लॉजिट और अटेंशन अलाइनमेंट के माध्यम से मध्यवर्ती निरूपणों (इंटरमीडिएट रिप्रेजेंटेशन्स) को अंतिम परत के प्रेडिक्टिव सिग्नल्स के साथ संरेखित करके भाषा मॉडल की तर्क क्षमता को बढ़ाता है, जिससे बिना किसी बाहरी विशेषाधिकार प्राप्त जानकारी की आवश्यकता के गणितीय तर्क कार्यों पर मौजूदा RL बेसलाइन्स की तुलना में महत्वपूर्ण सुधार प्राप्त होता है।

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He2026-05-29
🤖 machine learning

Model Merging by Output-Space Projection

यह शोध पत्र एक नवीन मॉडल मर्जिंग फ्रेमवर्क प्रस्तावित करता है जो फाइन-ट्यून्ड चेकपॉइंट्स के संयोजन को रेसिडुअल अपडेट्स पर एक उत्तल द्विघातीय प्रोग्राम (convex quadratic program) के रूप में सूत्रबद्ध करता है, जो मर्ज की गुणवत्ता का पूर्वानुमान लगाने के लिए एक सैद्धांतिक रूप से आधारित, क्लोज्ड-फॉर्म डायग्नोस्टिक प्रदान करता है और भाषा एवं विजन बेंचमार्क पर मौजूदा ह्यूरिस्टिक विधियों से अनुभवजन्य रूप से बेहतर प्रदर्शन करता है।

Bethan Evans, Benjamin Etheridge, Stephen Roberts, Jared Tanner2026-05-29
🤖 machine learning

Bridging Chemists and AI: An Expert-Augmented Framework for Interpretable Route Evaluation

यह शोध पत्र एक विशेषज्ञ-संवर्धित, डेटा-संचालित ढांचे को प्रस्तुत करता है जो बहु-चरणीय सिंथेटिक मार्गों का मूल्यांकन और व्याख्या करने के लिए मशीन लर्निंग को रसायनशास्त्रियों के डोमेन ज्ञान के साथ एकीकृत करता है, जिससे पिछले बेसलाइन की तुलना में काफी उच्च सटीकता और व्याख्यात्मकता प्राप्त होती है।

Yujia Guo, Mikhail Kabeshov, Tat Hong Duong Le, Samuel Genheden, Marco V. Mijangos, Varvara Voinarvoska, Giulia Bergonzi (…)2026-05-29
💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

यह शोध पत्र पहला व्यवस्थित ब्लैक-बॉक्स अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्वायत्त ड्राइविंग के लिए रीजनिंग-सक्षम विजन-लैंग्वेज-एक्शन मॉडल यथार्थवादी टेक्स्ट इनपुट व्यवधानों के प्रति अत्यधिक संवेदनशील हैं, जो तर्क करने की क्षमताओं और ड्राइविंग सुरक्षा को महत्वपूर्ण रूप से कम कर देते हैं, जिससे मजबूत मूल्यांकन ढांचे और बेहतर सुरक्षा उपायों की तत्काल आवश्यकता रेखांकित होती है।

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29
💻 computer science

Eulerian Gaussian Splatting using Hashed Probability Pyramids

यह शोध पत्र यूलेरियन गॉसियन स्प्लेटिंग (Eulerian Gaussian Splatting) प्रस्तुत करता है, जो एक संभाव्य रेडिएंस फील्ड फ्रेमवर्क है जो ह्यूरिस्टिक गॉसियन हेरफेर को हैश की गई प्रायिकता पिरामिडों (hashed probability pyramids) का उपयोग करके एक सीखने योग्य वॉल्यूमेट्रिक प्रायिकता घनत्व के ग्रेडिएंट-आधारित अनुकूलन से बदल देता है, जिससे 3DGS-स्तर की रेंडरिंग गति बनाए रखते हुए mip-NeRF 360 पर अत्याधुनिक पुनर्निर्माण गुणवत्ता प्राप्त की जा सकती है।

Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin2026-05-29
🤖 machine learning

Do Deep Networks Forget Initialization? A Forgetting-Time View of Practical Inductive Bias

यह शोध पत्र प्रदर्शित करता है कि प्रशिक्षित डीप नेटवर्क्स का व्यावहारिक इंडक्टिव बायस (inductive bias) न केवल उनकी वास्तुकला द्वारा निर्धारित होता है, बल्कि इस बात से भी निर्धारित होता है कि प्रशिक्षण गतिकी—विशेष रूप से लर्निंग रेट, ऑप्टिमाइज़र का चयन और रेगुलराइजेशन—रैंडम इनिशियलाइजेशन की स्मृति को कैसे फ़िल्टर या मिटाती है, जिसमें लो-लर्निंग-रेट SGD इस प्रारंभिक बायस को संरक्षित करता है जबकि एडेप्टिव मेथड्स और स्पष्ट नॉर्म कंट्रोल इसे प्रभावी ढंग से मिटा देते हैं।

Mohua Das, Pierfrancesco Beneventano, Shibshankar Dey, Gareth H. McKinkey, Tomaso Poggio2026-05-29
🤖 machine learning

Parallax: Parameterized Local Linear Attention for Language Modeling

यह शोध पत्र पैरलैक्स (Parallax) को प्रस्तुत करता है, जो एक स्केलेबल और संख्यात्मक रूप से स्थिर पैरामीटराइज्ड लोकल लीनियर अटेंशन (Local Linear Attention) तंत्र है, जो LLA की कम्प्यूटेशनल बाधाओं को समाप्त करके, हार्डवेयर दक्षता को अनुकूलित करके और म्यूऑन (Muon) ऑप्टिमाइज़र के साथ एक नवीन तालमेल प्रदर्शित करके लैंग्वेज मॉडलिंग में पारेटो सुधार (Pareto improvements) प्राप्त करता है।

Yifei Zuo, Dhruv Pai, Zhichen Zeng, Alec Dewulf, Shuming Hu, Zhaoran Wang2026-05-29