🤖 machine learning

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

यह शोध पत्र हिंडसाइट सेल्फ-डिस्टिलेशन (HSD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो महत्वपूर्ण विचलन बिंदुओं पर सघन, पथ-विशिष्ट मार्गदर्शन प्रदान करने के लिए सफल पीयर रोलआउट्स पर एक टीचर मॉडल को कंडिशन करके लंबे रीजनिंग ट्रेसेस में टोकन-स्तरीय क्रेडिट असाइनमेंट में सुधार करती है, जिससे गणित और कोड बेंचमार्क पर मौजूदा सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) और डिस्टिलेशन बेसलाइनों से बेहतर प्रदर्शन होता है।

Yu Li, Shu Hong, Tian Lan2026-06-16
🤖 AI

Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers

यह सर्वेक्षण गणितीय अनुकूलन (मैथमेटिकल ऑप्टिमाइज़ेशन) में लार्ज लैंग्वेज मॉडल्स के उपयोग को प्रत्यक्ष, टूल-संवर्धित और टूल-निर्मित प्रतिमानों में वर्गीकृत करता है, उनके प्रदर्शन की सीमाओं का विश्लेषण करता है और यह तर्क देता है कि जहाँ प्रत्यक्ष विधियाँ भविष्य की क्षमता रखती हैं, वहीं वर्तमान में टूल-संवर्धित दृष्टिकोण बेहतर ऑडिटेबिलिटी प्रदान करते हैं और टूल-निर्मित रणनीतियाँ दोहराव वाली समस्याओं के लिए अंततः सर्वोत्तम परिचालन दक्षता प्रदान कर सकती हैं।

Roko Peran, Luka Hobor, Mihael Kovac, Mario Brcic2026-06-16
🤖 AI

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

यह शोध पत्र "बेस सीक्वेंस एनालिसिस" (Base Sequence Analysis) प्रस्तुत करता है, जो एक जीनोमिक-प्रेरित ढांचा है जो उच्च-जोखिम वाले पैटर्न और सत्यापन संबंधी कमियों की पहचान करने के लिए LLM एजेंट व्यवहारों को प्रतीकात्मक अनुक्रमों (symbolic sequences) में एनकोड करता है, जिससे "गवर्नर" (Governor) का विकास होता है, जो एक रनटाइम गवर्नेंस सिस्टम है जो स्वायत्त एजेंटों में कार्य सफलता दर में उल्लेखनीय सुधार करता है और टोकन खपत को कम करता है।

Sidi Deng2026-06-16✓ Author reviewed
🤖 machine learning

Is Code Better Than Language for Algorithmic Reasoning

यह शोध पत्र यह प्रदर्शित करता है कि टूल-संवर्धित भाषा मॉडलों (tool-augmented language models) के लिए, एल्गोरिद्मिक तर्क में प्राकृतिक भाषा की तुलना में कोड का प्रदर्शन लाभ मुख्य रूप से विश्वसनीय बाहरी निष्पादन (external execution) से उत्पन्न होता है, क्योंकि कोड-सिम्युलेटेड तर्क, प्राकृतिक भाषा आधारित तर्क की तुलना में कोई महत्वपूर्ण लाभ प्रदान नहीं करता है।

Terry Tong, Yu Feng, Surbhi Goel, Dan Roth2026-06-16
🤖 AI

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

यह शोध पत्र ARVRE को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो वैध समीकरण श्रृंखलाओं के निर्माण के लिए ऑफलाइन टेम्पोरल-डिफरेंस लर्निंग को एजेंटिक रिट्रीवल-ऑगमेंटेड जनरेशन और एलएलएम (LLMs) के साथ जोड़ता है ताकि नवीन, जटिल और गणितीय रूप से सही भौतिकी शब्द समस्याएँ (Physics Word Problems) उत्पन्न की जा सकें।

Tirthankar Mittra2026-06-16
⚡ electrical engineering

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

यह शोध पत्र SLS² को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संभाव्यता-आधारित सुरक्षा गारंटी के साथ सुरक्षित, विज़न-आधारित मोशन प्लानिंग को सक्षम करने के लिए एक्शन-कंडीशन्ड लेटेंट वर्ल्ड मॉडल्स को कॉन्फॉर्मल प्रेडिक्शन-एन्हांस्ड रोबस्ट मॉडल प्रिडिक्टिव कंट्रोल के साथ जोड़ता है।

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou2026-06-16
🤖 AI

SCAN: A Decision-Making Framework for Effective Task Allocation with Generative AI

यह शोध पत्र SCAN को प्रस्तुत करता है, जो वायगोत्स्की के ज़ोन ऑफ़ प्रॉक्सिमल डेवलपमेंट और मेटाकॉग्निशन पर आधारित एक मानव-केंद्रित ढांचा है, जो शिक्षार्थियों और ज्ञान श्रमिकों को हाइब्रिड इंटेलिजेंस और आजीवन सीखने को बढ़ावा देने के लिए चार विशिष्ट उप-क्षेत्रों (प्रतिस्थापित करना, पूरक बनाना, सहायता करना और गैर-परक्राम्य) के माध्यम से जेनरेटिव एआई को कार्यों को प्रभावी ढंग से आवंटित करने के लिए मार्गदर्शन देता है।

Fendi Tsim, Alina Gutoreva2026-06-16
💬 NLP

LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

यह शोध पत्र एक "जज डेटाशीट" प्रोटोकॉल प्रस्तुत करता है जो LLM-as-a-judge प्रणालियों को केवल साधारण स्कोरिंग उपकरणों के बजाय माप उपकरणों (measurement instruments) के रूप में मानता है, और डाउनस्ट्रीम दावों को करने से पहले विश्वसनीय मूल्यांकन सुनिश्चित करने के लिए "डार्क करंट" और स्थितिजन्य वरीयता (positional preference) जैसे विशिष्ट पूर्वाग्रहों को मापने हेतु एक साइकोमेट्रिक ढांचे का प्रस्ताव करता है।

Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi, Naohiko Matsuda2026-06-16✓ Author reviewed
🤖 AI

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation

यह शोध पत्र MuDuo का प्रस्ताव करता है, जो एक म्यूचुअल डिस्टिलेशन फ्रेमवर्क है जो केवल पांच लेबल किए गए मामलों का उपयोग करके अत्याधुनिक सेमी-सुपरवाइज्ड PET/CT अंग विभाजन के लिए एक लाइटवेट स्टूडेंट नेटवर्क को निर्देशित करने हेतु स्ट्रक्चरल (SAM-Med3D) और फंक्शनल (SegAnyPET) फाउंडेशन मॉडल्स का लाभ उठाता है।

Fuyou Mao, Beining Wu, Yanfeng Jiang, Bohan Xu, Lixin Lin, Naye Ji, Hao Zhang, Yan Tang2026-06-16
🤖 AI

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड (retrieval-augmented) दृष्टिकोण का प्रस्ताव करता है जो एक सस्ते एम्बॉडमेंट (embodiment) से प्रदर्शन (demonstrations) को इंडेक्स करके टेस्ट के समय फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स को नए कार्यों तक विस्तारित करता है, जिससे अनसीन टास्क और एम्बॉडमेंट्स पर बेहतर प्रदर्शन प्राप्त करते हुए प्रति-कार्य फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है।

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun2026-06-16