🤖 AI

Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights

यह शोध पत्र मिमिक स्कोर (Mimic Score) का परिचय देता है, जो एक ज्यामिति-आधारित मीट्रिक है जो नमूना ग्रेडिएंट्स को प्री-ट्रेन्ड मॉडल वेट्स के साथ संरेखित करके डेटा उपयोगिता का मूल्यांकन करता है, और कुशल ऑनलाइन प्रशिक्षण त्वरण और ऑफलाइन डेटा फ़िल्टरिंग के लिए इस मीट्रिक का लाभ उठाने हेतु ग्रेड-मिमिक (Grad-Mimic) फ्रेमवर्क का प्रस्ताव करता है, जो मॉडल प्रदर्शन में सुधार करते हुए कम्प्यूटेशनल लागत और नमूना आवश्यकताओं को महत्वपूर्ण रूप से कम करता है।

Tzu-Heng Huang, Manjot Bilkhu, John Cooper, Frederic Sala, Javier Movellan2026-05-27
🤖 machine learning

Yes, Q-learning Helps Offline In-Context RL

यह शोध पत्र यह प्रदर्शित करता है कि विभिन्न वातावरणों और डेटासेट स्थितियों में एल्गोरिदम डिस्टिलेशन (Algorithm Distillation) जैसे मौजूदा सुपरवाइज्ड तरीकों की तुलना में, ऑफलाइन इन-कॉन्टेक्स्ट रिइन्फोर्समेंट लर्निंग में रिइन्फोर्समेंट लर्निंग उद्देश्यों, विशेष रूप से कंजर्वेटिज्म (conservatism) के साथ एकीकरण को शामिल करना काफी बेहतर प्रदर्शन करता है।

Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Andrei Polubarov, Nikita Lyubaykin, Alexander Derevyagin (…)2026-05-27
🤖 AI

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB एक ऐसा फ्रेमवर्क है जो एक 'कोर्स-टू-फाइन विजुअल चेन-ऑफ-बॉक्सेस' रीजनिंग रणनीति का उपयोग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में डॉक्यूमेंट अंडरस्टैंडिंग को बढ़ाता है, जो वैश्विक संदर्भ (ग्लोबल कॉन्टेक्स्ट) को सुरक्षित रखते हुए धीरे-धीरे क्वेरी-प्रासंगिक लेआउट क्षेत्रों पर ध्यान केंद्रित करता है, जिसे 249k प्रशिक्षण नमूनों के एक नए डेटासेट द्वारा समर्थित किया गया है।

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, S (…)2026-05-27
🤖 machine learning

Message-Passing State-Space Models: Improving Graph Learning with Modern Sequence Modeling

यह शोध पत्र MP-SSM प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो कुशल, क्रम-विनिमेय (permutation-equivariant), और दीर्घ-परासी सूचना प्रसार को प्राप्त करने के लिए स्टेट-स्पेस मॉडल सिद्धांतों को सीधे मैसेज-पासिंग न्यूरल नेटवर्क आर्किटेक्चर में समाहित करता है, साथ ही स्थिर और टेम्पोरल दोनों प्रकार के ग्राफों के लिए सटीक संवेदनशीलता विश्लेषण और अनुकूलित समानांतर कार्यान्वयन को सक्षम बनाता है।

Andrea Ceni, Alessio Gravina, Claudio Gallicchio, Davide Bacciu, Carola-Bibiane Schonlieb, Moshe Eliasof2026-05-27
⚡ electrical engineering

Genre Controlled Music Generation via Activation Steering

यह शोध पत्र लीनियर प्रोब वेट्स का उपयोग करके मॉडल के रेसिड्यूअल स्ट्रीम (residual stream) में इन्फरेंस-टाइम एक्टिवेशन स्टीयरिंग (inference-time activation steering) लागू करके MusicGen में सूक्ष्म-स्तरीय शैली नियंत्रण (fine-grained genre control) के लिए एक विधि प्रस्तुत करता है, जिससे सह-सृजनात्मक पीढ़ी (co-creative generation) के लिए विविध संगीत शैलियों का सटीक और व्याख्या योग्य मिश्रण सक्षम होता है।

Swathi Narashiman, Pranay Mathur, Dipanshu Panda, Jayden Koshy Joe, Harshith M R, Anish Veerakumar, Aniruddh Krishna, Ke (…)2026-05-27
🤖 machine learning

Real-Time Progress Prediction in Reasoning Language Models

यह शोध पत्र यह प्रदर्शित करके रीजनिंग लैंग्वेज मॉडल्स में रियल-टाइम प्रोग्रेस प्रेडिक्शन की व्यवहार्यता की जांच करता है कि हिडन स्टेट्स प्रोग्रेस की जानकारी को एनकोड करते हैं और फाइन-ट्यून्ड मॉडल्स सटीक प्रोग्रेस अनुमान उत्पन्न कर सकते हैं, जिसमें बड़े मॉडल्स शेष समाधान की लंबाई में कम भिन्नता के कारण अधिक लेबल स्थिरता प्रदर्शित करते हैं।

Hans Peter Lyngsøe Raaschou-Jensen, Constanza Fierro, Anders Søgaard2026-05-27
💬 NLP

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

PICACO एक नवीन इन-कॉन्टेक्स्ट अलाइनमेंट विधि है जो टोटल कोरिलेशन मैक्सिमाइजेशन के माध्यम से एक मेटा-इंस्ट्रक्शन को अनुकूलित करके बहुलवादी मानवीय मूल्यों को संभालने में निर्देश बाधा (इंस्ट्रक्शन बॉटलनैक) को संबोधित करती है, जिससे बड़े भाषा मॉडल बिना फाइन-ट्यूनिंग के कई परस्पर विरोधी मूल्यों को प्रभावी ढंग से संतुलित करने में सक्षम होते हैं।

Han Jiang, Dongyao Zhu, Zhihua Wei, Xiaoyuan Yi, Ziang Xiao, Xing Xie2026-05-27
🤖 AI

How Chain-of-Thought Works? Tracing Information Flow from Decoding, Projection, and Activation

यह शोध पत्र डिकोडिंग, प्रोजेक्शन और एक्टिवेशन चरणों में सूचना प्रवाह का पता लगाकर चेन-ऑफ-थॉट प्रॉम्प्टिंग के आंतरिक तंत्र की जांच करता है, जो यह प्रकट करता है कि यह उत्तर टेम्पलेट्स द्वारा निर्देशित एक डिकोडिंग स्पेस प्रनर (decoding space pruner) के रूप में कार्य करता है और इस आधार पर न्यूरॉन जुड़ाव को अलग-अलग तरह से नियंत्रित करता है कि कार्य ओपन-डोमेन है या क्लोज्ड-डोमेन।

Hao Yang, Qinghua Zhao, Lei Li, Lingyi Meng, Mengda Yu2026-05-27
🤖 AI

EvoEmo: Towards Evolved Emotional Policies for Adversarial LLM Agents in Multi-Turn Price Negotiation

यह शोध पत्र EvoEmo को प्रस्तुत करता है, जो एक विकासवादी सुदृढीकरण शिक्षण (evolutionary reinforcement learning) ढांचा है जो बहु-चरण मूल्य वार्ता में LLM एजेंटों के लिए गतिशील भावनात्मक अभिव्यक्ति नीतियों को अनुकूलित करता है, और यह प्रदर्शित करता है कि अनुकूलन योग्य भावनात्मक रणनीतियाँ सफलता दर, दक्षता और खरीदार की बचत के मामले में निष्क्रिय या स्थिर-भावना वाले बेसलाइन की तुलना में काफी बेहतर प्रदर्शन करती हैं।

Yunbo Long, Liming Xu, Lukas Beckenbauer, Yuhan Liu, Alexandra Brintrup2026-05-27
🤖 AI

Scalable GANs with Transformers

यह शोध पत्र GAT को प्रस्तुत करता है, जो एक स्केलेबल जेनरेटिव एडवरसैरियल नेटवर्क (Generative Adversarial Network) है जो मॉडल की विभिन्न क्षमताओं में अत्याधुनिक, कुशल इमेज जनरेशन प्राप्त करने के लिए ट्रांसफार्मर-आधारित आर्किटेक्चर को लेटेंट-स्पेस ट्रेनिंग और लक्षित स्थिरीकरण तकनीकों के साथ जोड़ता है।

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo2026-05-27