💬 NLP

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

यह शोध पत्र न्यूरल प्रोसीजरल मेमोरी (NPM) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो स्पष्ट पाठ्य निर्देशों को ऐतिहासिक अनुभवों से संकलित निहित सक्रियण स्टीयरिंग वेक्टर्स (activation steering vectors) से बदलकर स्वायत्त LLM एजेंटों को उन्नत करता है, जिससे सुदृढ़ और निरंतर कार्य निष्पादन प्राप्त करने के लिए सीधे कार्य-प्रासंगिक तंत्रों को सक्रिय किया जाता है।

Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu2026-06-30
💬 NLP

Exploring Motivations for Algorithm Mention in the Domain of Natural Language Processing: A Deep Learning Approach

यह अध्ययन एनएलपी (NLP) शोध पत्रों में एल्गोरिदम के उल्लेखों के पीछे के उद्देश्यों को पहचानने और विश्लेषण करने के लिए एक डीप लर्निंग-आधारित ढांचे का प्रस्ताव करता है, जो यह प्रकट करता है कि प्रत्यक्ष उपयोग प्रमुख उद्देश्य है, समय के साथ उद्देश्य विविध हुए हैं, और डेटा ऑग्मेंटेशन के साथ डीप लर्निंग मॉडल इन उद्देश्यों को वर्गीकृत करने में पारंपरिक तरीकों से बेहतर प्रदर्शन करते हैं।

Yuzhuo Wang, Yi Xiang, Chengzhi Zhang2026-06-30
🤖 machine learning

RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning

यह शोध पत्र RoAd-RL को प्रस्तुत करता है, जो एक एकीकृत ओपन-सोर्स लाइब्रेरी और बेंचमार्क है जो विभिन्न प्रतिकूल हमलों (adversarial attacks) और रक्षा प्रणालियों (defenses) के विरुद्ध नीतियों के परीक्षण के लिए पुनरुत्पादक पाइपलाइन प्रदान करके डीप रिइन्फोर्समेंट लर्निंग में मजबूती (robustness) के मूल्यांकन को मानकीकृत करता है, जिससे कुछ रक्षा प्रणालियों के संभावित नुकसान और टेम्पोरल स्मूथिंग (temporal smoothing) की प्रभावशीलता जैसे महत्वपूर्ण अंतर्दृष्टि का पता चलता है।

Adithya Mohan, Daniel Kriegl, Torsten Schön2026-06-30
💬 NLP

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

यह शोध पत्र ARKD का प्रस्ताव करता है, जो एक अनुकूली सुदृढीकरण शिक्षण (adaptive reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों के लिए ज्ञान आसवन (knowledge distillation) में टेक्स्ट जनरेशन की गुणवत्ता और सामान्यीकरण में सुधार करने के लिए फॉरवर्ड और रिवर्स KL डाइवर्जेंस उद्देश्यों को गतिशील रूप से संतुलित करता है।

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao2026-06-30
🧬 biology

Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency

यह शोध पत्र NEJM मामलों पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए क्लिनिकल रीजनिंग ग्राफ्स प्रस्तुत करता है और यह पाता है कि हालांकि LLMs नैदानिक सक्षमता प्रदर्शित करते हैं, लेकिन उनमें नैदानिक रूप से समान मामलों में सुसंगत, स्कीमा-स्तरीय तर्क पैटर्न की कमी है, जो अंतिम-उत्तर सटीकता से परे प्रक्रिया-स्तरीय मूल्यांकन की आवश्यकता को रेखांकित करता है।

Nisarg A. Patel (University of California, San Francisco)2026-06-30
💻 computer science

SafePyramid: A Hierarchical Benchmark for In-context Policy Guardrailing

यह शोध पत्र SafePyramid को प्रस्तुत करता है, जो एक पदानुक्रमित बेंचमार्क है जिसमें 1,000 बहु-चरण (multi-turn) वार्तालाप और 3,000 अनुप्रयोग-विशिष्ट नीतियां शामिल हैं, जो इन-कॉन्टेक्स्ट पॉलिसी गार्डरेलिंगिंग का मूल्यांकन करता है, और यह प्रकट करता है कि अत्याधुनिक मॉडल भी जटिलता के विभिन्न स्तरों के माध्यम से सुरक्षा उल्लंघनों को सटीक रूप से पहचानने और नवीन नीति ढांचों के अनुकूल होने में संघर्ष करते हैं।

Jiacheng Zhang, Haoyu He, Sen Zhang, Shen Wang, Xiaolei Xu, Yuhao Sun, Meng Shen, Feng Liu2026-06-30
💻 computer science

Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models

यह शोध पत्र T²VLA को प्रस्तुत करता है, जो एक टेस्ट-टाइम सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो विज़न-लैंग्वेज-एक्शन मॉडल्स को आंतरिक आत्मविश्वास संकेतों और एक ड्यूल-एक्सपर्ट बूटस्ट्रैपिंग तंत्र का लाभ उठाकर स्व-बूटस्ट्रैपिंग पॉलिसी सुधार प्राप्त करने में सक्षम बनाता है, जिससे बाहरी पर्यावरणीय पुरस्कारों की आवश्यकता समाप्त हो जाती है।

Siyao Chen, Jiakang Yuan, Jiaxin Wang, Tao Chen2026-06-30
⚡ electrical engineering

Child-Centric Voice Anonymization in Single and Multi-Speaker Speech via Domain-Adapted SSL Models

यह शोधपत्र डोमेन-अनुकूलित स्व-पर्यवेक्षित शिक्षण मॉडलों का उपयोग करते हुए एक बाल-केंद्रित वॉयस एनोनिमाइजेशन फ्रेमवर्क का प्रस्ताव करता है जो सिंगल-स्पीकर और मल्टी-स्पीकर दोनों परिदृश्यों में मजबूत गोपनीयता सुरक्षा सुनिश्चित करते हुए स्पीच इंटेलिजिबिलिटी और गुणवत्ता को प्रभावी ढंग से संरक्षित करता है।

Pranav Tushar, Xiao Xiao Miao, Rong Tong2026-06-30
💻 computer science

Critical Interval MSE: Toward Reliable Offline Validation for Robot Manipulation Policies

यह शोध पत्र क्रिटिकल इंटरवल MSE (CI-MSE) प्रस्तुत करता है, जो एक सुदृढ़ ऑफलाइन वैलिडेशन मेट्रिक है जो त्रुटि गणना को कार्य-महत्वपूर्ण खंडों तक सीमित करता है और वास्तविक दुनिया के रोबोटिक मैनिपुलेशन प्रदर्शन के साथ काफी मजबूत सहसंबंध प्राप्त करने के लिए एक्शन-अलाइनमेंट प्रक्रियाओं को शामिल करता है, जो मानक रॉ MSE की तुलना में बेहतर है।

Haoxu Huang, Tongsam Zheng, Yifan Chen, Jiacheng You, Yang Gao2026-06-30
⚡ electrical engineering

Semi-Supervised Sound Event Detection with Conditional Mixup and Embedding-Level Contrastive Loss

यह शोध पत्र एक अर्ध-पर्यवेक्षित (semi-supervised) साउंड इवेंट डिटेक्शन फ्रेमवर्क प्रस्तावित करता है जो प्रचुर मात्रा में उपलब्ध अनलेबल डेटा का प्रभावी ढंग से लाभ उठाने के लिए कंडीशनल मिक्सअप को एम्बेडिंग-लेवल कंट्रास्टिव लॉस के साथ एकीकृत करता है, जिससे DESED डेटासेट पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त होता है।

Nian Shao, Xian Li, Xiaofei Li2026-06-30