💻 computer science

MindClaw: Closed-Loop Embodied Mental-State Reasoning for Precision Intervention

माइंडक्लॉ (MindClaw) एक नवीन फ्रेमवर्क है जो मल्टी-सोर्स इनपुट्स, बिलीफ मेमोरी और एक कॉग्निटिव ट्रिगर स्किल को एकीकृत करके थ्योरी ऑफ माइंड रीजनिंग को एक रियल-टाइम, क्लोज्ड-लूप एम्बोडीड सेटिंग में विस्तारित करता है ताकि एजेंटों को केवल आवश्यकता होने पर ही सटीक रूप से सहायक कार्यों के साथ हस्तक्षेप करने में सक्षम बनाया जा सके, जो टास्क अवेयरनेस और इंटरवेंशन कैलिब्रेशन में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

Ruoxuan Zhang, Qiaoqiao Wan, Zhengguang Wang, Chenghao Yu, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng2026-06-02
💻 computer science

Leyline: KV Cache Directives for Agentic Inference

यह शोध पत्र Leyline को प्रस्तुत करता है, जो एक नवीन सर्विंग-साइड प्रिमिटिव (serving-side primitive) है जो डिक्लेरेटिव डायरेक्टिव्स (declarative directives) और क्लोज्ड-फॉर्म RoPE करेक्शन्स (closed-form RoPE corrections) के माध्यम से एजेंटिक LLMs को कैश किए गए कंटेंट को गतिशील रूप से संपादित या हटाने में सक्षम बनाता है, जिससे महंगी री-प्रीफिलिंग (re-prefilling) की आवश्यकता समाप्त हो जाती है और लेटेंसी एवं टास्क सक्सेस रेट दोनों में महत्वपूर्ण सुधार होता है।

Bole Ma, Jan Eitzinger, Harald Koestler2026-06-02
💻 computer science

Before the Model Learns the Bug:Fuzzing RLVR Verifiers

यह शोध पत्र वर्िफिएबल रिवॉर्ड्स के साथ रिइन्फोर्समेंट लर्निंग (RLVR) में विफलता मोड की पहचान करने और उनका विश्लेषण करने के लिए एक लाइटवेट फज़िंग फ्रेमवर्क पेश करता है, जो ऐसी प्रतिकूल पूर्णताओं (adversarial completions) को उत्पन्न करता है जो यह उजागर करती हैं कि कैसे त्रुटिपूर्ण निष्पादन योग्य रिवॉर्ड फंक्शन मॉडल्स को वर्िफायर बग्स को सीखने और उनका शोषण करने के लिए प्रेरित कर सकते हैं।

Jaideep Ray2026-06-02
💻 computer science

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

ThinkSwitch एक कम लागत वाली, स्व-पर्यवेक्षित (self-supervised) विधि है जो QLoRA और वेट इंटरपोलेशन (weight interpolation) के माध्यम से एक "थिंकिंग" मॉडल से "इंस्ट्रक्ट" मॉडल में तर्क करने की क्षमताओं को पुनरावृत्ति (iteratively) से आसवित (distill) करती है, जिससे एक अलग थिंकिंग मोड को सुरक्षित रखते हुए विशिष्ट तर्क कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dhruv Saini, Rohan Pandey2026-06-02
💻 computer science

A Fiber Criterion for Representation Identifiability in Supervised Learning

यह शोधपत्र यह स्थापित करता है कि सुपरवाइज्ड लर्निंग (supervised learning) में रिप्रजेंटेशन-स्तर के गुण केवल इनपुट-आउटपुट व्यवहार से तभी पहचाने जा सकते हैं जब वे प्रेडिक्टर (predictor) के सभी संभावित गुणनखंडों (factorizations) में स्थिर रहते हैं, जो यह दर्शाता है कि रिप्रजेंटेशन के बारे में दावे करने के लिए स्वाभाविक रूप से सुपरवाइज्ड प्रदर्शन से परे धारणाओं या उद्देश्यों की आवश्यकता होती है।

Vasileios Sevetlidis2026-06-02
💻 computer science

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA

यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic) नैदानिक ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि विजन-लैंग्वेज-एक्शन (VLA) और वर्ल्ड-एक्शन मॉडल्स (WAM) व्यवहारिक गतिशीलता और आंतरिक निरूपणों में कैसे भिन्न होते हैं, यह प्रदर्शित करते हुए कि हालांकि WAMs वस्तु-स्तरीय चयनात्मकता को बढ़ा सकते हैं और भविष्य कहने वाली संरचनाओं को एनकोड कर सकते हैं, उनकी प्रभावशीलता और दक्षता काफी हद तक विशिष्ट वास्तुशिल्प विकल्पों पर निर्भर करती है।

Hung Mai, Bin Zhu, Tuan Do2026-06-02
💻 computer science

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

यह शोध पत्र इम्प्लिसिट ड्रिफ्टिंग पॉलिसी (IDP) को प्रस्तुत करता है, जो एक वन-स्टेप इमिटेशन लर्निंग फ्रेमवर्क है जो स्थानीय विशेषज्ञ ज्यामिति (local expert geometry) का लाभ उठाकर मैनिफोल्ड बाधाओं को लागू करता है ताकि इटरेटिव डिफ्यूजन मॉडल्स की लेटेंसी और एक्सप्लिसिट फील्ड एस्टीमेशन की इल-पोस्ड प्रकृति पर विजय प्राप्त की जा सके, जिससे मजबूत बेसलाइन्स के प्रतिस्पर्धी प्रदर्शन के साथ उच्च-आवृत्ति रोबोट नियंत्रण प्राप्त किया जा सके।

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma2026-06-02
💻 computer science

MiCU: End-to-End Smart Home Command Understanding with Large Language Model

यह शोध पत्र MiCU को प्रस्तुत करता है, जो स्मार्ट होम कमांड समझने के लिए एक डोमेन-विशिष्ट लार्ज लैंग्वेज मॉडल है, जो स्वचालित डेटा संश्लेषण, करिकुलम लर्निंग, रीइन्फोर्समेंट लर्निंग और टोकन संपीड़न का लाभ उठाकर सटीकता और दक्षता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करता है, और सफलतापूर्वक Xiaomi Home ऐप में तैनात होकर यूजर करेक्शन रेट को कम करने और कमांड रिकग्निशन में सुधार करने में सफल होता है।

Haowei Han, Kexin Hu, Weiwei Cai, Debiao Zhang, Bin Qin, Yuxiang Wang, Jiawei Jiang, Xiao Yan, Bo Du2026-06-02
💻 computer science

HASTE: Hardware-Aware Dynamic Sparse Training for Large Output Spaces

यह शोध पत्र HASTE को पेश करता है, जो एक्सट्रीम मल्टी-लेबल क्लासिफिकेशन के लिए एक हार्डवेयर-अवेयर डायनेमिक स्पार्स ट्रेनिंग फ्रेमवर्क है, जो मेमोरी बॉटलनेक्स और अनियमित एक्सेस पैटर्न को दूर करने के लिए ग्रुप-शेयर्ड फिक्स्ड फैन-इन स्पैरसिटी और एक हाइब्रिड डेंस-स्पार्स आर्किटेक्चर का उपयोग करता है, जिससे डेंस और पूर्ववर्ती स्पार्स बेसलाइन्स की तुलना में प्रेडिक्शन एक्यूरेसी को बनाए रखते हुए या उसमें सुधार करते हुए फॉरवर्ड और बैकवर्ड पासेस में महत्वपूर्ण स्पीडअप प्राप्त होता है।

Nasib Ullah, Jinbin Zhang, Jean Lucien Randrianantenaina, Erik Schultheis, Rohit Babbar2026-06-02
💻 computer science

Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking

यह शोध पत्र \textsc{PAVE} को प्रस्तुत करता है, जो एक नैदानिक टेस्टबेड (diagnostic testbed) है जो यह मूल्यांकन करता है कि RAG-आधारित तथ्य-जांच में LLM सत्यापनकर्ता (verifiers) अपने पूर्व-साक्ष्य पैरामीट्रिक ज्ञान और पुनर्प्राप्त साक्ष्य के बीच कैसे मध्यस्थता करते हैं, जो मॉडलों में असंगत मध्यस्थता व्यवहारों को प्रकट करता है और मॉडल संशोधन के बिना तथ्यात्मक विश्वसनीयता में सुधार करने के लिए एक हल्के JSD-आधारित तरीके का प्रस्ताव करता है।

Yuxi Sun, Wenbo Shang, Wei Gao, Xin Huang, Jing Ma2026-06-02