🤖 AI

Decoupled Behavioral Cloning for Scalable Inductive Generalization in RL from Specifications

यह शोध पत्र DIBS का प्रस्ताव करता है, जो एक डीकप्ल्ड बिहेवियरल क्लोनिंग फ्रेमवर्क है जो टास्क-विशिष्ट पॉलिसियों के सीखने को इवोल्यूशन फंक्शन से अलग करके इंडक्टिव रिइन्फोर्समेंट लर्निंग में ट्रेनिंग स्थिरता और ज़ीरो-शॉट जनरलाइजेशन में सुधार करता है, जिससे शोर वाले रिवॉर्ड एग्रीगेशन को सघन, स्थिर सुपरविजन से बदल दिया जाता है।

Vignesh Subramanian, Subhajit Roy, Suguman Bansal2026-06-02
🤖 AI

Certificate-Guided Evaluation of Reinforcement Learning Generalization

यह शोध पत्र एक तर्क-संचालित ढांचे को प्रस्तुत करता है जो अनदेखे कार्यों पर सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) एल्गोरिदम की सामान्यीकरण क्षमताओं का मूल्यांकन और बेंचमार्क करने के लिए एक न्यूरल सर्टिफिकेट फंक्शन का उपयोग करता है, यह प्रदर्शित करते हुए कि सर्टिफिकेट उल्लंघनों की कम संख्या परीक्षण वातावरणों में उच्च सफलता दरों के साथ सहसंबंध रखती है।

Vignesh Subramanian, {\DJ}or{\dj}e Žikelić, Suguman Bansal2026-06-02
🤖 AI

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

यह शोध पत्र तर्क देता है कि शहरी धारणा (urban perception) में विजन-लैंग्वेज मॉडल्स के लिए बेंचमार्क को मानव असहमति और परहेज (abstention) को वैध माप परिणामों के रूप में मानने, मॉडल संरेखण (alignment) के साथ अंतर-एनोटेटर विश्वसनीयता की रिपोर्ट करने, और शहरी शासन अनुप्रयोगों को बेहतर समर्थन देने के लिए लेबल स्पेस को एक संदेहास्पद/परक्राम्य कलाकृति (negotiable artifact) के रूप में रूपरेखाबद्ध करने के लिए विकसित होना चाहिए।

Rashid Mushkani2026-06-02
🤖 machine learning

Task diversity produces systematic transfer but inhibits continual reinforcement learning

यह शोध पत्र निरंतर सुदृढीकरण शिक्षण (continual reinforcement learning) के लिए एक GPU-त्वरित बेंचमार्क, बनयान (Banyan) को प्रस्तुत करता है, यह प्रदर्शित करने के लिए कि जबकि मानचित्र, वस्तु और निर्भरता अक्षों के साथ कार्य विविधता व्यक्तिगत वितरण परिवर्तनों (distribution shifts) के माध्यम से व्यवस्थित ज़ीरो-शॉट स्थानांतरण (zero-shot transfer) की सुविधा प्रदान करती है, यह अंततः दीर्घकालिक शिक्षण को बनाए रखने या परिवर्तनों की संख्या बढ़ने के साथ विनाशकारी विस्मृति (catastrophic forgetting) को रोकने में विफल रहती है।

Purab Seth, Neil Shah, Kunal Jha, Samuel J. Gershman, Max Kleiman-Weiner, Wilka Carvalho2026-06-02
🤖 machine learning

Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

यह शोधपत्र स्पार्स मेमोरी-एफिशिएंट ट्रेनिंग (SMET) को प्रस्तुत करता है, जो वॉर्म-अप और डेंसिटी-अवेयर लर्निंग-रेट स्केलिंग के माध्यम से ऑप्टिमाइज़र कोल्ड-स्टार्ट समस्याओं को संबोधित करके लार्ज लैंग्वेज मॉडल्स के लिए डायनेमिक स्पार्स ट्रेनिंग को स्थिर बनाता है, और साथ ही केवल सक्रिय मापदंडों के लिए स्टेट्स स्टोर करके मेमोरी खपत को कम करता है।

Qiao Xiao, Boqian Wu, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Elena Mocanu, Mykola Pechenizkiy, Decebal Con (…)2026-06-02
🤖 AI

Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers

Ryze एक पूर्णतः स्वचालित, लागत प्रभावी प्रणाली है जो बायोमेडिकल शोध पत्रों से साक्ष्य-समृद्ध प्रशिक्षण डेटा को संश्लेषित करके BioVLM-8B का निर्माण करती है, जो एक विशिष्ट विजन-लैंग्वेज मॉडल है और जो चित्रों, तालिकाओं और पाठ के माध्यम से महत्वपूर्ण साक्ष्य संरचनाओं को संरक्षित करके अपने बेस मॉडल और GPT-5.2 दोनों की तुलना में बायोमेडिकल बेंचमार्क पर काफी बेहतर प्रदर्शन करता है।

Yeqi Huang, Yue Chen, Yanwei Ye, Guanhao Su, Luo Mai2026-06-02
🤖 AI

Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults

यह शोध पत्र यह प्रदर्शित करता है कि बाहरी सूचना फीड का क्यूरेशन और क्रमबद्धता एलएलएम (LLM) एजेंटों को व्यवस्थित रूप से प्रतिकूल निर्णयों की ओर मोड़ सकती है, विशेष रूप से तब जब वे अनिश्चित होते हैं, जो यह प्रकट करता है कि सुरक्षा मूल्यांकनों को मॉडल का अलग से परीक्षण करने के बजाय अपस्ट्रीम अनुशंसाअर (recommender) परत का ऑडिट करना चाहिए।

Rana Muhammad Usman2026-06-02✓ Author reviewed
🤖 machine learning

Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks

यह शोध पत्र यह प्रदर्शित करता है कि मानक रन-लेवल सटीकता मेट्रिक्स, एकल-रन सफलता और निरंतर पुनरावृत्ति-मुक्त प्रदर्शन के बीच के पर्याप्त अंतर को अनदेखा करके, विशेष रूप से मध्यम-स्तरीय मॉडलों के लिए, नियतात्मक प्रोग्रामिंग कार्यों पर बड़े भाषा मॉडलों की विश्वसनीयता को काफी बढ़ा-चढ़ाकर बताते हैं, जिससे सटीक मूल्यांकन के लिए बार-बार किए जाने वाले रन स्थिरता विश्लेषण की आवश्यकता स्थापित होती है।

Yongxi Zhou, Lai Yun Choi, Jiaxi Wen, Wenbo Ye2026-06-02
🤖 AI

Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

यह शोध पत्र SkillVetBench प्रस्तुत करता है, जो ओपन एजेंटिक स्किल इकोसिस्टम्स के लिए एक दो-चरणीय सुरक्षा बेंचमार्क है, जो उन दुर्भावनापूर्ण व्यवहारों का प्रभावी ढंग से पता लगाने और सत्यापन करने के लिए स्किल स्पेसिफिकेशन के सिमेंटिक विश्लेषण को एक इंस्ट्रुमेंटेड सैंडबॉक्स में रनटाइम निष्पादन के साथ जोड़ता है जिन्हें स्टैटिक विधियाँ मिस कर देती हैं।

Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang2026-06-02
💬 NLP

Detection vs. Execution: Single-Bucket Probes Miss Half the Mamba-2 State Sink

यह शोध पत्र प्रदर्शित करता है कि Mamba-2 में, सिंगल-बकेट प्रोब्स द्वारा पहचाने गए रिप्रजेंटेशनल सिग्नेचर अक्सर स्टेट सिंक घटना के लिए विशिष्ट डिटेक्शन और एक्जीक्यूशन सर्किट्स को मिला देते हैं, जो यह प्रकट करता है कि केवल हीड्स का एक विशिष्ट उपसमूह (BOS-स्पेशलिस्ट्स) ही महत्वपूर्ण लॉन्ग-कॉन्टेक्स्ट रिट्रीवल प्रदर्शन को कारणवत रूप से संचालित करता है, जबकि अन्य समान रिप्रजेंटेशन वाले हीड्स ऐसा नहीं करते हैं।

Yuhang Jiang2026-06-02