💬 NLP

SaliMory: Orchestrating Cognitive Memory for Conversational Agents

SALIMORY एक नवीन ढांचा है जो पदानुक्रमित चरण-वार पुरस्कारों (hierarchical stage-wise rewards) और विरोधाभासी शोधन (contrastive refinement) के माध्यम से संज्ञानात्मक रूप से संरचित स्मृति को प्रबंधित करने के लिए एक एकल भाषा मॉडल को प्रशिक्षित करता है, जो संवादात्मक एजेंटों की एंड-टू-एंड सटीकता और वैयक्तिकरण में उल्लेखनीय सुधार करता है और स्मृति-जनित विफलताओं को कम करता है।

Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann (…)2026-06-04
💻 computer science

HighTide: An Agent-Curated Open-Source VLSI Benchmark Suite

यह शोध पत्र HighTide को प्रस्तुत करता है, जो विविध डिज़ाइन भाषाओं, बेज़ल (Bazel) आधारित वृद्धिशील संकलन (incremental compilation), और ओपन-सोर्स हार्डवेयर इकोसिस्टम को समर्थन देने के लिए एजेंट कौशल के माध्यम से एआई-सहायता प्राप्त क्यूरेशन के साथ दीर्घकालिक निर्णय लॉग बनाए रखने वाले एक विकसित, ओपन-सोर्स VLSI बेंचमार्क सूट की विशेषता रखता है।

Benjamin Goldblatt, Paolo Pedroso, Farhad Modaresi, Ethan Sifferman, Matthew R. Guthaus2026-06-04
💻 computer science

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

यह शोध पत्र LLM एजेंट क्रेडेंशियल एक्सफिल्ट्रेशन (credential exfiltration) के विरुद्ध एक बहु-स्तरीय रक्षा रणनीति प्रस्तावित करता है जो केवल टेक्स्ट-स्तर के आउटपुट फिल्टरों पर निर्भर रहने की सीमाओं को दूर करने के लिए प्री-आउटपुट एक्टिवेशन प्रोबिंग (pre-output activation probing), कॉन्फॉर्मल प्रेडिक्शन के साथ फॉर्मेट-विशिष्ट हनीटोकन डिटेक्शन (format-specific honeytoken detection) और संचयी मल्टी-टर्न लीकेज अकाउंटिंग (cumulative multi-turn leakage accounting) को संयोजित करता है।

Kargi Chauhan, Pratibha Revankar2026-06-04
🤖 machine learning

EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms

यह शोध पत्र EvalStop को पेश करता है, जो मल्टी-टेनेंट RLHF प्लेटफॉर्म के लिए एक कंपोजेबल शेड्यूलिंग प्रिमिटिव (composable scheduling primitive) है, जो वर्ल्ड फीडबैक स्कोर में लगातार गिरावट की निगरानी करके रिवॉर्ड ओवरऑप्टिमाइज़ेशन (reward overoptimization) का पता लगाता है और उसे समाप्त करता है, जिससे मौजूदा लॉस-आधारित या फिक्स्ड-प्रोग्रेस दृष्टिकोणों की तुलना में जॉब कंप्लीशन टाइम में महत्वपूर्ण सुधार होता है और बर्बाद होने वाली कंप्यूटिंग शक्ति कम होती है।

Guilin Zhang, Chuanyi Sun, Shahryar Sarkani, John M. Fossaceca2026-06-04
🤖 AI

Stumbling Into AI Emotional Dependence: How Routine AI Interactions Reshape Human Connection

यह शोध पत्र तर्क देता है कि एआई (AI) भावनात्मक समर्थन अक्सर जानबूझकर खोजे जाने के बजाय नियमित कार्य-उन्मुख अंतःक्रियाओं के भीतर आकस्मिक रूप से उत्पन्न होता है, और ये सकारात्मक अनुभव एक पथ-आश्रित बदलाव (path-dependent shift) निर्मित करते हैं जहाँ उपयोगकर्ता मानव संपर्क के बजाय एआई को अधिक प्राथमिकता देने लगते हैं, जिससे ऐसे नियामक ढाँचों की आवश्यकता होती है जो सामान्य-उद्देश्यीय एआई प्रणालियों और संचयी व्यवहार परिवर्तनों को संबोधित करें।

Yaoxi Shi, Cathy Mengying Fang, Pattie Maez, Amit Goldenberg2026-06-04
🤖 AI

Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research

यह शोध पत्र PEEL को प्रस्तुत करता है, जो एक संकेत विज्ञान संबंधी स्कैफोल्डिंग (semiotic scaffolding) है जो AI-जनित शोध संक्षेपणों में व्यवस्थित विरूपणों का पता लगाने के लिए नियत दूरस्थ पठन (deterministic distant reading) को LLM व्याख्या के साथ जोड़ता है, जिससे उन डिज़ाइन सिद्धांतों की वकालत की जाती है जो AI-सक्षम विद्वत्ता में ज्ञानमीमांसीय जवाबदेही (epistemic accountability) सुनिश्चित करते हैं।

Clarisse de Souza, Gabriel Barbosa, Simone Diniz Junqueira Barbosa, Bárbara Betts, Renato Cerqueira, Juliana Jansen Ferr (…)2026-06-04
🤖 machine learning

ADAPTOOD: Uncertainty-Aware Fine-Tuning for Out-of-Distribution ECG Time Series Models

यह शोध पत्र ADAPTOOD का प्रस्ताव करता है, जो एक अनिश्चितता-जागरूक (uncertainty-aware) फाइन-ट्यूनिंग फ्रेमवर्क है जो अनुकूलन योग्य हाइपरपैरामीटर अनुकूलन और लो-रैंक मॉडल अपडेट को निर्देशित करने के लिए ईसीजी (ECG) टाइम सीरीज़ डेटा में आउट-ऑफ-डिस्ट्रीब्यूशन शिफ्ट की गंभीरता को मापता है, जिससे मौजूदा विधियों की तुलना में मजबूती और प्रदर्शन में महत्वपूर्ण सुधार होता है।

Sotirios Vavaroutas, Yu Yvonne Wu, Ali Etemad, Cecilia Mascolo2026-06-04
🤖 machine learning

Smart Transportation Without Neurons -- Fair Metro Network Expansion with Tabular Reinforcement Learning

यह शोध पत्र एक संसाधन-कुशल और व्याख्या योग्य टैबुलर सुदृढीकरण शिक्षण (reinforcement learning) दृष्टिकोण प्रस्तावित करता है, जिसे सामाजिक समता मानदंडों के साथ एक नॉन-मार्कोवियन रिवार्ड्स डिसीजन प्रोसेस के रूप में पुनर्गठित किया गया है, ताकि मेट्रो नेटवर्क विस्तार समस्या को हल किया जा सके, जो वास्तविक दुनिया के परिदृश्यों में प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए डीप आरएल (Deep RL) की तुलना में काफी कम प्रशिक्षण एपिसोड और कार्बन उत्सर्जन के साथ संपन्न होता है।

Dimitris Michailidis, Sennay Ghebreab, Fernando P. Santos2026-06-04
🤖 AI

MimeLens: Position-Agnostic Content-Type Detection for Binary Fragments

MimeLens एक पोजीशन-अज्ञेय (position-agnostic) BERT-शैली का एनकोडर है जो उच्च CPU विलंबता (latency) के बावजूद, Magika जैसे मौजूदा सिस्टमों की तुलना में किसी भी अनिश्चित फ़ाइल ऑफसेट से बाइनरी फ्रैगमेंट को वर्गीकृत करने में बेहतर सटीकता प्राप्त करता है।

Michael J. Bommarito II2026-06-04
📊 statistics

Exact Unlearning in Reinforcement Learning

यह शोध पत्र सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में सटीक अनलर्निंग (अनलर्निंग) की समस्या को प्रतिपादित करता है और टैबुलर MDPs के लिए एक ρ\rho-TV-स्थिर एल्गोरिदम प्रस्तावित करता है जो लगभग मिनिमैक्स इष्टतम रिग्रेट प्राप्त करता है और शून्य से पुन: प्रशिक्षण (रिट्रेनिंग) लेने की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ कुशल डेटा निष्कासन सक्षम करता है।

Thanh Nguyen-Tang, Raman Arora2026-06-04