🤖 machine learning

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

यह शोधपत्र "प्रोग्रेस एडवांटेज" (progress advantage) को प्रस्तुत करता है, जो कि RL-प्रशिक्षित और संदर्भ नीतियों के लॉग-संभाव्यता अनुपात (log-probability ratio) से सीधे प्राप्त एक एनोटेशन-मुक्त, डोमेन-अज्ञेय (domain-agnostic), स्टेप-स्तरीय स्कोरिंग सिग्नल है, जो LLM एजेंटों के टेस्ट-टाइम स्केलिंग, अनिश्चितता परिमाणीकरण (uncertainty quantification), और विफलता एट्रिब्यूशन कार्यों में समर्पित रिवॉर्ड मॉडल और कॉन्फिडेंस-आधारित बेसलाइन से बेहतर प्रदर्शन करता है।

Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li2026-06-25
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

यह शोध पत्र प्रकट करता है कि जहाँ सैम्पल्ड प्रदर्शनों (sampled demonstrations) के साथ ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (on-policy self-distillation) मजबूत पास@1 सटीकता प्राप्त करता है, वहीं यह अनजाने में कंपाउंडिंग फीडबैक (compounding feedback) के माध्यम से मौजूदा मॉडल पूर्वाग्रहों को बढ़ाकर आउटपुट विविधता को कम कर देता है और पास@k प्रदर्शन को सपाट कर देता है, जिससे अंततः आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों के लिए विविध रणनीतियाँ उत्पन्न करने की मॉडल की क्षमता सीमित हो जाती है।

Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville2026-06-25
🤖 AI

Learning Action Priors for Cross-embodiment Robot Manipulation

यह शोध पत्र एक दो-चरणीय प्रशिक्षण ढांचे का प्रस्ताव करता है जो अनकंडीशन्ड मोशन ट्राजेक्टरीज पर एक लाइटवेट एक्शन मॉड्यूल को प्रीट्रेन करता है ताकि क्रॉस-एम्बॉडीडमेंट टेम्पोरल प्रायर्स को सीखा जा सके, जिन्हें फिर डिकोडर पुन: उपयोग और लेटेंट डिस्टिलेशन के माध्यम से विजन-लैंग्वेज-एक्शन मॉडल्स में स्थानांतरित किया जाता है ताकि डेटा-दुर्लभ वास्तविक दुनिया के मैनिपुलेशन कार्यों में तेज़ अभिसरण, उच्च सफलता दर और बेहतर सामान्यीकरण प्राप्त किया जा सके।

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding2026-06-25
🤖 AI

Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian

यह शोध पत्र विख्र (Vikhr) को प्रस्तुत करता है, जो रूसी भाषा के लिए ओपन-सोर्स, द्विभाषी इंस्ट्रक्शन-ट्यून्डेड लार्ज लैंग्वेज मॉडल्स की एक श्रृंखला है, जो लाइटवेट लोरा (LoRA) एडेप्टर पर निर्भर रहने के बजाय टोकेनाइज़र वोकैबुलरी को अनुकूलित करके और सभी वेट्स को पूरी तरह से फाइन-ट्यून करके बेहतर प्रदर्शन और कम्प्यूटेशनल दक्षता प्राप्त करते हैं।

Aleksandr Nikolich, Konstantin Korolev, Sergei Bratchikov, Igor Kiselev, Artem Shelmanov2026-06-24
🤖 machine learning

Invariant Graph Representations for Continuous-Time Dynamic Graphs Under Distribution Shifts

यह शोध पत्र CIR का प्रस्ताव करता है, जो एक नवीन स्ट्रक्चरल कॉज़ल मॉडल (ICCM) और नॉर्मलाइज़्ड वेटेड ज्योमेट्रिक मीन सन्निकटन का लाभ उठाकर निरंतर-समय गतिशील ग्राफों के लिए इनवेरिएंट ग्राफ रिप्रजेंटेशन को कुशलतापूर्वक सीखने के लिए, आउट-ऑफ-डिस्ट्रीब्यूशन शिफ्ट के तहत मजबूत प्रदर्शन प्राप्त करने हेतु, जहाँ मौजूदा विधियाँ विफल हो जाती हैं, एक रूपरेखा प्रस्तुत करता है।

Lanting Fang, Yulian Yang, Yawei Zhang, Shanshan Feng, Kaiyu Feng, Hanning Yuan2026-06-24
💰 quantitative finance

When AI Meets Finance (StockAgent): Large Language Model-based Stock Trading in Simulated Real-world Environments

यह शोध पत्र StockAgent को प्रस्तुत करता है, जो एक बड़े भाषा मॉडल (large language model) पर आधारित मल्टी-एजेंट सिस्टम है जिसे टेस्ट सेट लीकेज के बिना वास्तविक दुनिया के स्टॉक ट्रेडिंग को सिम्युलेट करने के लिए डिज़ाइन किया गया है, जिससे इस बात का विश्लेषण संभव हो पाता है कि कैसे व्यापक अर्थशास्त्र (macroeconomics) और नीतिगत परिवर्तन जैसे बाहरी कारक निवेशक व्यवहार और बाजार लाभप्रदता को प्रभावित करते हैं।

Chong Zhang, Xinyi Liu, Zhongmou Zhang, Mingyu Jin, Lingyao Li, Zhenting Wang, Wenyue Hua, Dong Shu, Suiyuan Zhu, Xiaobo (…)2026-06-24
💬 NLP

CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark

यह शोध पत्र CORE-Bench प्रस्तुत करता है, जो तीन वैज्ञानिक विषयों में फैले 270 कार्यों वाला एक व्यापक बेंचमार्क है, जिसे एआई एजेंटों की अनुसंधान परिणामों को कम्प्यूटेशनल रूप से पुनरुत्पादित करने की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है, जो वैज्ञानिक वर्कफ़्लो को स्वचालित करने में वर्तमान महत्वपूर्ण सीमाओं को रेखांकित करता है।

Zachary S. Siegel, Sayash Kapoor, Nitya Nadgir, Benedikt Stroebl, Arvind Narayanan2026-06-24
📊 statistics

Variational Model Merging for Pareto Front Estimation in Multitask Finetuning

यह शोध पत्र वेरिएशनल मॉडल मर्जिंग (Variational Model Merging) का प्रस्ताव करता है, जो एक नवीन बेयसियन ढांचा (Bayesian framework) है जो मल्टीटास्क फाइनट्यूनिंग में पारेटो फ्रंट्स (Pareto fronts) की गुणवत्ता और अनुमान को प्रमाणित रूप से सुधारने के लिए लचीले गैर-गॉसियन पोस्टीरियर्स (non-Gaussian posteriors) का लाभ उठाता है, जो सरल गॉसियन धारणाओं पर निर्भर मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Hugo Monzón Maldonado, Nico Daheim, Thomas Möllenhoff, Iryna Gurevych, Mohammad Emtiyaz Khan2026-06-24
⚡ electrical engineering

CwA-T: A Channelwise AutoEncoder with Transformer for EEG Abnormality Detection

यह शोध पत्र CwA-T का प्रस्ताव करता है, जो एक कुशल और व्याख्या योग्य ढांचा है जो EEG असामान्यताओं का पता लगाने के लिए एक चैनल-वाइज CNN-आधारित ऑटोएन्कोडर को सिंगल-हेड ट्रांसफार्मर के साथ जोड़ता है, जिससे TUH Abnormal EEG Corpus पर बेसलाइन मॉडलों की तुलना में बेहतर प्रदर्शन और कम कम्प्यूटेशनल लागत प्राप्त होती है।

Youshen Zhao, Keiji Iramina2026-06-24