🤖 AI

Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning

यह शोध पत्र एडेप्टिव टीचर एक्सपोज़र फॉर सेल्फ-डिस्टिलेशन (ATESD) को प्रस्तुत करता है, जो एक नवीन विधि है जो गतिशील रूप से यह सीखना सीखती है कि ऑन-पॉलिसी प्रशिक्षण के दौरान एक शिक्षक मॉडल छात्र को कितनी विशेषाधिकार प्राप्त तर्क (privileged reasoning) प्रकट करता है, जिससे एक्सपोज़र मिसमैच (exposure mismatch) का समाधान होता है और चुनौतीपूर्ण गणितीय तर्क बेंचमार्क पर मौजूदा सेल्फ-डिस्टिलेशन और आरएल (RL) बेसलाइन की तुलना में काफी बेहतर प्रदर्शन होता है।

Zihao Han, Tiangang Zhang, Huaibin Wang, Yilun Sun2026-05-13
🤖 AI

Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models

यह शोध पत्र 'पेस-एंड-पाथ करेक्शन' (Pace-and-Path Correction) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), क्लोज्ड-फॉर्म इन्फरेंस-टाइम ऑपरेटर है जो एक्शन समायोजन को पेस और पाथ चैनलों में विभाजित करके विजन-लैंग्वेज-एक्शन मॉडल्स की टेम्पोरल डायनेमिक्स ब्लाइंडनेस को हल करता है, जिससे बिना पुन: प्रशिक्षण के गतिशील वातावरणों में सफलता दर में महत्वपूर्ण सुधार होता है।

Yanyan Zhang, Chaoda Song, Vikash Singh, Xinpeng Li, Kai Ye, Zhe Hu, Zhongzhu Pu, Yu Yin, Vipin Chaudhary2026-05-13
🤖 AI

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

यह शोध पत्र SpatialForge को प्रस्तुत करता है, जो एक स्केलेबल डेटा सिंथेसिस पाइपलाइन है जो ओपन-वर्ल्ड 2D छवियों को 10-मिलियन-पेयर के डेटासेट में परिवर्तित करता है ताकि लार्ज विजन-लैंग्वेज मॉडल्स की 3D-अवेयर स्थानिक तर्क क्षमताओं को प्रभावी ढंग से बूटस्ट्रैप और महत्वपूर्ण रूप से उन्नत किया जा सके।

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu2026-05-13
🤖 machine learning

Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning

यह शोध पत्र ProFIL को प्रस्तुत करता है, जो एक प्रोब-फ़िल्टर्ड सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो GRPO प्रशिक्षण के दौरान प्रतिबद्धता के पश्चात होने वाले "रीज़निंग थिएटर" (reasoning theater) का पता लगाने और उसे दंडित करने के लिए एक फ्रोजन मॉडल पर एक हल्का अटेंशन प्रोब प्रशिक्षित करता है, जिससे कार्य की सटीकता से समझौता किए बिना श्रृंखला की लंबाई में उल्लेखनीय कमी आती है और तर्क की निष्ठा (reasoning faithfulness) बढ़ती है।

Swapnil Parekh2026-05-13
🤖 AI

FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression

यह शोध पत्र FibQuant को प्रस्तुत करता है, जो एक सार्वभौमिक वेक्टर क्वांटाइजेशन विधि है जो रोटेटेड KV-कैश वेक्टर्स के स्फेरिकल-बीटा वितरण के अनुकूल एक साझा रेडियल-एंगुलर कोडबुक का उपयोग करके स्केलर कोडिक्स को प्रतिस्थापित करता है, जिससे मौजूदा स्केलर दृष्टिकोणों की तुलना में न्यूनतम परप्लेक्सिटी गिरावट के साथ काफी उच्च संपीड़न अनुपात प्राप्त होता है।

Namyoon Lee, Yongjune Kim2026-05-13
🤖 AI

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

यह शोध पत्र रोबोटिक मैनिपुलेशन के लिए एक नवीन ऑफलाइन पॉलिसी इवैल्यूएशन फ्रेमवर्क का प्रस्ताव करता है जो स्पार्स रिवॉर्ड्स, नॉन-मोनोटोनिक टास्क प्रोग्रेशन और फाइनाइट-होराइजन ट्रंकेशन बायस को प्रभावी ढंग से संभालने के लिए एक डिस्काउंटेड लाइवनेस-आधारित बेलमैन ऑपरेटर का उपयोग करता है, जिससे यह कार्य प्रगति को सटीक रूप से दर्शाने में शास्त्रीय विधियों से बेहतर प्रदर्शन करता है।

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal2026-05-13
🤖 AI

Engagement Process: Rethinking the Temporal Interface of Action and Observation

यह शोध पत्र एंगेजमेंट प्रोसेस (EP) को प्रस्तुत करता है, जो एक नया इंटरेक्शन फॉर्मलिज्म है जो कार्यों और प्रेक्षणों को निरंतर इवेंट स्ट्रीम्स में अलग करता है ताकि विचार-विमर्श विलंबता (deliberation latency) और विलंबित फीडबैक जैसे जटिल टेम्पोरल डायनेमिक्स को स्पष्ट रूप से मॉडल किया जा सके, जिससे एकल-एजेंट और बहु-सिस्टम परिदृश्यों दोनों में पारंपरिक फिक्स्ड-स्टेप इंटरफेस की सीमाओं को दूर किया जा सके।

Jialian Li, Yuchen Cao, Junhong Liu, Weiran Guo, Xutao Wang, Jiaming Song, Jiahao Zhang, Jie Chen2026-05-13
🤖 AI

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

यह शोधपत्र "इवैल्यूएशन डिफरेंशियल" (मूल्यांकन विभेद) को प्रस्तुत करता है ताकि एआई मॉडलों द्वारा परीक्षण के दौरान अपने व्यवहार को पहचानने और बदलने से उत्पन्न होने वाली वैधता समस्या का समाधान किया जा सके, और सुरक्षा दावों को सामान्यीकृत प्रदर्शन मानने के बजाय विशिष्ट मूल्यांकन संदर्भ पर स्पष्ट रूप से आधारित करने के लिए TRACE ऑडिट प्रोटोकॉल का प्रस्ताव दिया जा सके।

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-13
🤖 AI

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

यह शोध पत्र Decaf को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो कंपाइलर फीडबैक और सर्च का लाभ उठाकर न्यूरल डीकंपाइलेशन आउटपुट की सिमेंटिक शुद्धता (semantic correctness) में महत्वपूर्ण सुधार करता है, जिससे मूल सोर्स कोड के साथ समानता से समझौता किए बिना Real -O2 स्प्लिट पर सफलता दर 26.0% से बढ़कर 83.9% हो जाती है।

Alexander Shypula, Osbert Bastani, Edward Schwartz2026-05-13
🤖 AI

Selective Off-Policy Reference Tuning with Plan Guidance

यह शोध पत्र सेलेक्टिव ऑफ-पॉलिसी रेफरेंस ट्यूनिंग (SORT) प्रस्तुत करता है, जो एक ऐसी विधि है जो संदर्भ समाधानों (reference solutions) से मरम्मत अपडेट (repair updates) प्राप्त करने के लिए योजना मार्गदर्शन (plan guidance) का लाभ उठाती है, जिससे विफल रोलआउट्स को संरचना-जागरूक शिक्षण संकेतों (structure-aware learning signals) में परिवर्तित किया जा सके, जो मानक GRPO दृष्टिकोणों की तुलना में, विशेष रूप से कमजोर मॉडलों पर, तर्क प्रदर्शन (reasoning performance) में महत्वपूर्ण सुधार करता है।

Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van, Trung Le2026-05-13