🤖 AI

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

यह शोध पत्र प्रकट करता है कि भाषा मॉडलों के लिए स्व-निर्मित प्रश्न-उत्तर पर्यवेक्षण (self-generated question-answer supervision) गैर-समान साक्ष्य चयन और निर्देश-अनुसरण पूर्वाग्रहों के कारण स्वाभाविक रूप से नाजुक है, लेकिन इन मुद्दों को निश्चित लक्ष्यों से प्रश्नों को जोड़ने और निर्देश-समान टेक्स्ट स्पैन को फ़िल्टर करके प्रभावी ढंग से कम किया जा सकता है।

Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov2026-07-01
🤖 machine learning

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

यह शोध पत्र TRIAGE का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) के लिए एक रोल-टाइप्ड क्रेडिट असाइनमेंट फ्रेमवर्क है, जो एक्शन सेगमेंट को सिमेंटिक भूमिकाओं (जैसे, निर्णायक प्रगति, अन्वेषण, प्रतिगमन) में वर्गीकृत करके बाउंडेड प्रोसेस रिवॉर्ड्स लागू करता है ताकि मानक GRPO को बेहतर बनाया जा सके, जिससे परिणाम-मात्र (outcome-only) की कमियों को सुधारा जा सके और विविध बेंचमार्क पर सफलता दर और दक्षता में महत्वपूर्ण सुधार किया जा सके।

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard2026-07-01
🤖 machine learning

Automated Background Swapping for Robustness against Spurious Backgrounds

यह शोध पत्र ऑटोमेटेड बैकग्राउंड स्वैपिंग (AutoBackSwap) को प्रस्तुत करता है, जो एक डेटा ऑग्मेंटेशन विधि है जो फोरग्राउंड को बैकग्राउंड से अलग करती है और नए बैकग्राउंड को सिंथेसाइज करती है ताकि उन क्लासिफायरों को प्रशिक्षित किया जा सके जो स्पूरियस बैकग्राउंड सहसंबंधों के विरुद्ध सुदृढ़ हों, भले ही मूल प्रशिक्षण डेटा में कोई काउंटर-एग्जांपल मौजूद न हो।

Cesar Roder, Kajetan Schweighofer2026-07-01
🤖 machine learning

AdaJEPA: An Adaptive Latent World Model

adaJEPA एक एडेप्टिव लेटेंट वर्ल्ड मॉडल है जो मॉडल प्रेडिक्टिव कंट्रोल लूप के भीतर टेस्ट-टाइम सेल्फ-सुपरवाइज्ड अडैप्टेशन को निष्पादित करके, प्रेक्षित स्टेट ट्रांजिशन का उपयोग करते हुए अतिरिक्त एक्सपर्ट डेमोंस्ट्रेशन की आवश्यकता के बिना मॉडल को निरंतर पुन: कैलिब्रेट करके, डिस्ट्रीब्यूशन शिफ्ट के तहत प्लानिंग रोबस्टनेस को बढ़ाता है।

Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren2026-07-01
🤖 machine learning

Freeform Preference Learning for Robotic Manipulation

यह शोध पत्र फ्रीफॉर्म प्रेफरेंस लर्निंग (FPL) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रोबोटिक मैनिपुलेशन पॉलिसियों को बाइनरी तुलनाओं के बजाय प्राकृतिक-भाषा वरीयता अक्षों (natural-language preference axes) से सीखने में सक्षम बनाती है, जिसके परिणामस्वरूप प्रदर्शन में महत्वपूर्ण सुधार, सघन प्रगति संकेत (dense progress signals), और बिना पुन: प्रशिक्षण के परीक्षण के समय व्यवहार को नियंत्रित करने की क्षमता प्राप्त होती है।

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn2026-07-01
💬 NLP

Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

यह शोधपत्र यह प्रदर्शित करता है कि काउंटरफैक्चुअल स्पष्टीकरणों (counterfactual explanations) के स्थिर डेटासेट पर प्रशिक्षित भाषा मॉडल "इंट्रोस्पेक्टिव कपलिंग" (introspective coupling) विकसित कर सकते हैं, जहाँ उनके द्वारा उत्पन्न स्पष्टीकरण केवल स्थिर प्रशिक्षण लक्ष्यों की नकल करने के बजाय उनके अपने विकसित होते व्यवहारों के प्रति वफादार रहते हैं और उनका अनुसरण करते हैं।

Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li2026-07-01
📈 economics

Multiply Robust Causal Mediation Analysis with Continuous Treatments

यह शोध पत्र निरंतर उपचारों (continuous treatments) के लिए एक बहु-सुदृढ़ (multiply robust) और स्पर्शोन्मुखी रूप से सामान्य (asymptotically normal) कारण मध्यस्थता अनुमानक (causal mediation estimator) प्रस्तावित करता है जो सुदृढ़ता संबंधी आवश्यकताओं को शिथिल करने और बिना किसी कड़े पैरामीट्रिक धारणाओं पर निर्भर रहे न्यूसेंस मापदंडों (nuisance parameters) के लिए धीमी अभिसरण दरों (convergence rates) को समायोजित करने के लिए कर्नेल स्मूथिंग और क्रॉस-फिटिंग का उपयोग करता है।

Yizhen Xu, AmirEmad Ghassami, Numair Sani, Ilya Shpitser2026-06-30
📊 statistics

A Deterministic Sampling Method via Maximum Mean Discrepancy Flow with Adaptive Kernel

यह शोध पत्र EVI-MMD का प्रस्ताव करता है, जो एक नवीन नियत (deterministic) सैंपलिंग विधि है जो एक ऊर्जात्मक वेरिएशनल इन्फरेंस (energetic variational inference) ढांचे और एक अनुकूली कर्नेल बैंडविड्थ रणनीति के माध्यम से मैक्सिमम मीन ディस्क्रीपेंसी (Maximum Mean Discrepancy) को न्यूनतम करके लक्षित वितरणों का सन्निकटन करता है, जो घनत्व-आधारित (density-based) और दो-नमूना जनरेटिव मॉडलिंग परिदृश्यों दोनों में उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

Yindong Chen, Yiwei Wang, Lulu Kang, Chun Liu2026-06-30
🤖 machine learning

Personalized Additive Modeling for Multi-level Federated Learning

यह शोधपत्र फेडरेटेड मल्टी-लेवल एडिटिव मॉडलिंग (FeMAM) का प्रस्ताव करता है, जो एक गतिशील और लागत-कुशल ढांचा है जो वैश्विक, उपसमूह और क्लाइंट-विशिष्ट मॉडलों के योगात्मक संयोजन के माध्यम से व्यक्तिगत भविष्यवक्ताओं का निर्माण करके फेडरेटेड लर्निंग में जटिल नॉन-आईआईडी (non-IID) डेटा विषमता को संबोधित करता है, जो प्रशिक्षण के दौरान अनुकूल रूप से विकसित और छंटनी (prune) होते हैं।

Shutong Chen, Guodong Long, Tianyi Zhou, Jie Ma, Jing Jiang, Chengqi Zhang2026-06-30
📊 statistics

BEACON: A Bayesian Optimization Inspired Strategy for Efficient Novelty Search

यह शोध पत्र BEACON को प्रस्तुत करता है, जो बेयसियन ऑप्टिमाइज़ेशन से प्रेरित एक सैंपल-कुशल नॉवेलिटी सर्च रणनीति है, जो मल्टी-आउटपुट गॉसियन प्रोसेस और अनिश्चितता-जागरूक डिस्टेंस-आधारित एक्विज़िशन का उपयोग करके सामग्रियों और आणविक डिज़ाइन जैसे महंगे ब्लैक-बॉक्स परिवेशों में विविध सिस्टम व्यवहारों को कुशलतापूर्वक खोजने के लिए किया जाता है।

Wei-Ting Tang, Ankush Chakrabarty, Joel A. Paulson2026-06-30