🤖 machine learning

RLVP: Penalize the Path, Reward the Outcome

यह शोध पत्र "पेनलाइज द पाथ, रिवॉर्ड द आउटकम" (RLVP) ढांचे का प्रस्ताव करता है, जो बाधाओं को लागू करने और महंगी विफलताओं को कम करने के लिए सत्यापन योग्य दंडों के साथ परिणाम-आधारित पुरस्कारों को जोड़कर वास्तविक दुनिया के एजेंटों की तैनात करने की क्षमता और नमूना दक्षता को बढ़ाता है।

Bojie Li, Noah Shi2026-07-09
🤖 machine learning

Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data

यह शोध पत्र पहली बार एक व्यवस्थित बेंचमार्क प्रस्तुत करता है जो यह मूल्यांकन करता है कि डिफरेंशियल प्राइवेट सिंथेटिक टैबुलर डेटा पर प्री-, इन-, और पोस्ट-प्रोसेसिंग निष्पक्षता हस्तक्षेप (fairness interventions) कैसे प्रदर्शन करते हैं, जिससे यह पता चलता है कि पोस्ट-प्रोसेसिंग विधियाँ निष्पक्षता, उपयोगिता और गोपनीयता के बीच सबसे स्थिर संतुलन प्रदान करती हैं।

Vinícius Gabriel Angelozzi, Héber H. Arcolezi2026-07-09
🤖 AI

Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning

यह शोध पत्र Pyligent को प्रस्तुत करता है, जो एक प्रशिक्षण ढांचा है जो विलंबित-विफलता रिकवरी (delayed-failure recovery) की आवश्यकता वाले कार्यों पर तर्क प्रदर्शन में सुधार करता है, जो निरंतरता, समापन और बैकट्रैकिंग क्रियाओं के लिए सत्यापित खोज वृक्षों (search trees) को सुपरवाइज्ड लक्ष्यों में परिवर्तित करके विभिन्न संरचित डोमेन में मानक सुपरवाइज्ड फाइन-ट्यूनिंग से बेहतर प्रदर्शन करता है।

Dmitry Beresnev, Vladimir Makharev, Roman Khalikov, Ivan Oseledets, Petr Anokhin2026-07-09
🤖 AI

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

यह शोध पत्र HIVE को प्रस्तुत करता है, जो एक ऐसा मूल्यांकन बुनियादी ढांचा है जो विजन लैंग्वेज मॉडल्स में पोस्ट-हैलुसिनेशन रीजनिंग (PHR) की जांच करता है, और यह प्रकट करता है कि हॉलुसिनेटेड कैप्शन आश्चर्यजनक रूप से विजन-लैंग्वेज कार्यों पर सटीकता में सुधार कर सकते हैं, क्योंकि वे व्यापक सेमेंटिक कवरेज प्रदान करते हैं और रीजनिंग डायनेमिक्स को नया आकार देते हैं, जबकि पारंपरिक रूप से उन्हें त्रुटियों के रूप में देखा जाता है।

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li2026-07-09
🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

यह शोध पत्र सिंगल-रोलआउट एसिंक्रोनस ऑप्टिमाइजेशन (SAO) को प्रस्तुत करता है, जो एक स्थिर और कुशल एसिंक्रोनस सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो ग्रुप-वाइज सैंपलिंग को सिंगल-रोलआउट रणनीतियों से बदल देता है और जटिल कोडिंग एवं रीजनिंग बेंचमार्क पर GLM-5.2 जैसे बड़े पैमाने के एजेंटिक मॉडलों को सफलतापूर्वक प्रशिक्षित करने के लिए सख्त टोकन-लेवल क्लिपिंग का उपयोग करता है।

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong2026-07-09
⚡ electrical engineering

Stability of Flow Models for Graph Signals

यह शोध पत्र ग्राफ न्यूरल नेटवर्क द्वारा पैरामीटराइज्ड निरंतर जनरेटिव फ्लो मॉडल्स की स्थिरता का विश्लेषण करता है, जो संरचनात्मक व्यवधानों (structural perturbations) के जनरेटित संकेतों पर पड़ने वाले प्रभावों पर स्पष्ट सीमाएँ निर्धारित करता है और एक नियमित प्रशिक्षण रणनीति प्रस्तावित करता है जो आउटपुट की गुणवत्ता से समझौता किए बिना ग्राफ शोर के प्रति मजबूती को बढ़ाता है।

Martin Schmidt, Gonzalo Mateos2026-07-09✓ Author reviewed
🤖 machine learning

Collaborative Synthetic Data Generation for Knowledge Transfer in Federated Learning

यह शोध पत्र FedKT-CSD का प्रस्ताव करता है, जो एक वन-शॉट फेडरेटेड लर्निंग फ्रेमवर्क है जो मॉडल की गुणवत्ता से समझौता किए बिना औपचारिक डिफरेंशियल प्राइवेसी, कम संचार ओवरहेड और विषम क्लाइंट वितरणों में मजबूत प्रदर्शन प्राप्त करने के लिए साझा ऑटोएनकोडर लेटेंट स्पेस के माध्यम से सहयोगात्मक सिंथेटिक डेटा जनरेशन का लाभ उठाता है।

Maximilian Andreas Hoefler, Karsten Mueller, Wojciech Samek2026-07-09
⚛️ quantum physics

QCNN with Rough Path Signature Kernels

यह शोध पत्र टाइम सीरीज़ वर्गीकरण के लिए एक हाइब्रिड क्वांटम-क्लासिकल आर्किटेक्चर प्रस्तावित करता है जो टाइम रीपैरामीट्रिज़ेशन इनवेरिएंस को संभालने के लिए पाथ सिग्नेचर कर्नेल को एकीकृत करता है और डाउनस्ट्रीम लर्निंग के लिए एक क्वांटम कनवल्शनल न्यूरल नेटवर्क (QCNN) का उपयोग करता है, जो हस्तलिखित अंक डेटा पर प्रयोगों के माध्यम से अपनी क्षमता प्रदर्शित करता है और साथ ही अपने वेरिएशनल लीनियर सॉल्वर घटकों की कम्प्यूटेशनल बाधाओं का विश्लेषण करता है।

Leonardo Nogueira Falabella, Vasily Sazonov2026-07-09
🤖 AI

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

यह शोधपत्र 1,250 हालिया अध्ययनों का सर्वेक्षण करता है ताकि सीमित, औद्योगिक स्व-परिष्करण (self-refinement) और मुक्त-अंत वाली पुनरावर्ती स्व-सुधार (recursive self-improvement) के बीच अंतर किया जा सके, और यह तर्क देता है कि बाद वाले की व्यवहार्यता मूल्यांकन संकेतों के एक पदानुक्रम द्वारा मौलिक रूप से बाधित है जहाँ सबसे कमजोर स्व-आकलन विधियाँ पतन की ओर ले जाती हैं और सबसे मजबूत औपचारिक सत्यापनकर्ता (formal verifiers) स्वायत्त अनुसंधान के लिए महत्वपूर्ण बाधा बने रहते हैं।

Mingguang Chen, Licheng Wang, Bo Qu2026-07-09
💬 NLP

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

यह शोध पत्र DiaLLM प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बड़े भाषा मॉडलों (large language models) में बोलियों संबंधी सुदृढ़ता (dialectal robustness) और सृजन (generation) के बीच एक महत्वपूर्ण अलगाव को प्रकट करता है, यह प्रदर्शित करते हुए कि जहाँ निरंतर प्री-ट्रेनिंग और SFT समझ में सुधार करते हैं, वहीं प्रामाणिक बोली संबंधी आउटपुट के लिए स्पष्ट विविधता-लक्षित अनुकूलन (variety-targeted adaptation) आवश्यक है, हालाँकि वर्तमान रिवॉर्ड-आधारित संरेखण विधियाँ अक्सर मानवीय प्राथमिकताओं के साथ संरेखित होने में विफल रहती हैं।

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin2026-07-09