🤖 AI

GRAFT: Decoupling Ranking and Calibration for Survival Analysis

यह शोध पत्र GRAFT का प्रस्ताव करता है, जो एक नवीन हाइब्रिड सर्वाइवल एनालिसिस मॉडल है जो एक लीनियर AFT मॉडल को नॉन-लीनियर रेसिडुअल न्यूरल नेटवर्क और स्टोकेस्टिक फीचर सिलेक्शन के साथ जोड़कर प्रोगनोस्टिक रैंकिंग को कैलिब्रेशन से अलग करता है, जिससे उच्च-आयामी, सेंसर डेटा सेटिंग्स में बेहतर डिस्क्रिमिनेशन और कैलिब्रेशन प्रदर्शन प्राप्त होता है।

Mohammad Ashhad, Robert Hoehndorf, Ricardo Henao2026-05-19
🤖 AI

Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning

यह शोध पत्र R&B-EnCoRe प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) ढांचा है जो एम्बोडीड रीजनिंग (embodied reasoning) को एक लेटेंट वेरिएबल के रूप में मानकर उसे बूटस्ट्रैप करता है ताकि इंटरनेट-स्केल ज्ञान से एक्शन-प्रेडिक्टिव रणनीतियों को आसवन (distill) किया जा सके, जिससे बिना किसी कठोर टेम्पलेट या बाहरी पुरस्कारों पर निर्भर रहे विभिन्न VLA मॉडलों में हेरफेर (manipulation), नेविगेशन और ड्राइविंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Milan Ganai, Katie Luo, Jonas Frey, Clark Barrett, Marco Pavone2026-05-19
🤖 AI

Perception-based Image Denoising via Generative Compression

यह शोध पत्र इमेज डिनोइजिंग (image denoising) के लिए एक जनरेटिव कंप्रेशन फ्रेमवर्क प्रस्तावित करता है जो यथार्थवादी बनावट की रिकवरी (texture recovery) प्राप्त करने के लिए एंट्रॉपी-कोडेड लेटेंट रिप्रेजेंटेशन्स (entropy-coded latent representations) और परसेप्चुअल-ड्रिवन डिकोडर्स (कंडीशनल WGANs या डिफ्यूजन मॉडल्स के माध्यम से) का लाभ उठाता है, साथ ही पुनर्निर्माण त्रुटि (reconstruction error) और डिकोडिंग प्रोबेबिलिटी पर सैद्धांतिक गारंटी भी प्रदान करता है।

Nam Nguyen, Thinh Nguyen, Bella Bose2026-05-19
🤖 AI

Learning Native Continuation for Action Chunking Flow Policies

यह शोध पत्र लेगैटो (Legato) को पेश करता है, जो एक्शन-चंक्ड विजन लैंग्वेज एक्शन मॉडल्स के लिए एक ट्रेनिंग-टाइम निरंतरता विधि (continuation method) है, जो फ्लो डायनेमिक्स को नया रूप देती है और स्मूथ एवं अधिक सुसंगत प्रक्षेपवक्र (trajectories) उत्पन्न करने के लिए रैंडमाइज्ड शेड्यूल कंडीशनिंग का उपयोग करती है, जिससे यह वास्तविक दुनिया के मैनिपुलेशन कार्यों में मौजूदा रियल-टाइम चंकिंग दृष्टिकोणों से बेहतर प्रदर्शन करती है।

Yufeng Liu, Hang Yu, Juntu Zhao, Bocheng Li, Di Zhang, Mingzhu Li, Wenxuan Wu, Yingdong Hu, Junyuan Xie, Junliang Guo, D (…)2026-05-19
💬 NLP

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

यह शोध पत्र कैलिब्रेट-देन-एक्ट (CTA) फ्रेमवर्क प्रस्तुत करता है, जो LLM एजेंटों को लेटेंट एनवायरनमेंट स्टेट्स के बारे में अनुमानित प्रायर्स (priors) से सुसज्जित करता है ताकि वे लागत-अनिश्चितता ट्रेडऑफ्स (cost-uncertainty tradeoffs) के बारे में स्पष्ट रूप से तर्क कर सकें, जिससे उन्हें मानक सुदृढीकरण शिक्षण (reinforcement learning) पर निर्भर रहे बिना रिट्रीवल-ऑगमेंटेड QA और कोडिंग जैसे कार्यों में अधिक इष्टतम अनुक्रमिक निर्णय लेने की रणनीतियों को खोजने में सक्षम बनाया जा सके।

Wenxuan Ding, Nicholas Tomlin, Greg Durrett2026-05-19
🤖 AI

Online Algorithms with Unreliable Guidance

यह शोध पत्र ऑनलाइन एल्गोरिदम विद अनरिलायबल गाइडेंस (OAG) मॉडल और एक जेनेरिक "ड्रॉप-ऑर-ट्रस्ट-ब्लाइंडली" कंपाइलर प्रस्तुत करता है जो मानक ऑनलाइन एल्गोरिदम को लर्निंग-ऑगमेंटेड एल्गोरिदम में रूपांतरित करता है जो मजबूत कंसिस्टेंसी-रोबस्टनेस गारंटी प्राप्त करते हैं, और कैशिंग, यूनिफॉर्म मेट्रिकल टास्क सिस्टम्स और बाइटाइट मैचिंग जैसी क्लासिक समस्याओं के लिए इष्टतम या बेहतर परिणाम प्राप्त करते हैं।

Julien Dallot, Yuval Emek, Yuval Gil, Maciej Pacut, Stefan Schmid2026-05-19
💬 NLP

Surgical Post-Training: Proximal On-Policy Distillation for Reasoning with Knowledge Retention

यह शोध पत्र सर्जिकल पोस्ट-ट्रेनिंग (SPOT) का प्रस्ताव करता है, जो एक प्रॉक्सिमल ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एलएलएम (LLM) की रीजनिंग क्षमताओं को कुशलतापूर्वक बढ़ाने और कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को प्रभावी ढंग से कम करने के लिए एक डेटा रेक्टिफिकेशन पाइपलाइन और एक केएल-कंस्ट्रेंड (KL-constrained) रिवॉर्ड ऑब्जेक्टिव का उपयोग करता है।

Wenye Lin, Kai Han2026-05-19
🤖 machine learning

Automatic Generation of High-Performance RL Environments

यह शोध पत्र एक क्लोज्ड-लूप कार्यप्रणाली प्रस्तुत करता है जो जेनेरिक प्रॉम्प्ट्स, पदानुक्रमित सत्यापन (hierarchical verification) और पुनरावृत्ति सुधार (iterative repair) का उपयोग करके न्यूनतम कंप्यूट लागत के साथ उच्च-प्रदर्शन वाले सुदृढीकरण लर्निंग (reinforcement learning) वातावरण को स्वचालित रूप से उत्पन्न करता है ताकि प्रत्यक्ष अनुवाद, प्रदर्शन समानता सत्यापन और नवीन वातावरण निर्माण सहित विविध वर्कफ़्लो में समानता सुनिश्चित की जा सके।

Seth Karten, Rahul Dev Appapogu, Chi Jin2026-05-19
🤖 AI

AgentWall: A Runtime Safety Layer for Local AI Agents

यह शोध पत्र AgentWall को पेश करता है, जो स्थानीय AI एजेंटों के लिए एक ओपन-सोर्स रनटाइम सुरक्षा परत है जो मानव निरीक्षण के साथ घोषणात्मक नीतियों (declarative policies) के विरुद्ध प्रस्तावित कार्यों को इंटरसेप्ट और मूल्यांकित करती है, जिससे प्रमुख विकास परिवेशों में 92.9% प्रवर्तन सटीकता और सब-मिलीसेकंड ओवरहेड प्राप्त होता है।

Ashwin Aravind2026-05-19
🤖 machine learning

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

यह शोध पत्र एक LLM-संचालित ट्राइएजिंग एजेंट प्रस्तुत करता है जो धोखाधड़ी या विवादों का सामना कर रहे बैंक ग्राहकों को विशेषज्ञ टीमों तक रूट करने की सटीकता और दक्षता में सुधार करने के लिए मल्टी-टर्न बातचीत और सिंथेटिक डिजिटल ट्विन्स का उपयोग करता है, जिससे वर्गीकरण सटीकता में 30.6% की वृद्धि हुई है।

Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias Jr, Patrick Sinclair, Giulio Pe (…)2026-05-19