🤖 machine learning

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

यह शोध पत्र सिंगल-रोलआउट एसिंक्रोनस ऑप्टिमाइजेशन (SAO) को प्रस्तुत करता है, जो एक स्थिर और कुशल एसिंक्रोनस सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचा है जो ग्रुप-वाइज सैंपलिंग को सिंगल-रोलआउट रणनीतियों से बदल देता है और जटिल कोडिंग एवं रीजनिंग बेंचमार्क पर GLM-5.2 जैसे बड़े पैमाने के एजेंटिक मॉडलों को सफलतापूर्वक प्रशिक्षित करने के लिए सख्त टोकन-लेवल क्लिपिंग का उपयोग करता है।

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong2026-07-09
⚡ electrical engineering

Stability of Flow Models for Graph Signals

यह शोध पत्र ग्राफ न्यूरल नेटवर्क द्वारा पैरामीटराइज्ड निरंतर जनरेटिव फ्लो मॉडल्स की स्थिरता का विश्लेषण करता है, जो संरचनात्मक व्यवधानों (structural perturbations) के जनरेटित संकेतों पर पड़ने वाले प्रभावों पर स्पष्ट सीमाएँ निर्धारित करता है और एक नियमित प्रशिक्षण रणनीति प्रस्तावित करता है जो आउटपुट की गुणवत्ता से समझौता किए बिना ग्राफ शोर के प्रति मजबूती को बढ़ाता है।

Martin Schmidt, Gonzalo Mateos2026-07-09✓ Author reviewed
🤖 machine learning

Collaborative Synthetic Data Generation for Knowledge Transfer in Federated Learning

यह शोध पत्र FedKT-CSD का प्रस्ताव करता है, जो एक वन-शॉट फेडरेटेड लर्निंग फ्रेमवर्क है जो मॉडल की गुणवत्ता से समझौता किए बिना औपचारिक डिफरेंशियल प्राइवेसी, कम संचार ओवरहेड और विषम क्लाइंट वितरणों में मजबूत प्रदर्शन प्राप्त करने के लिए साझा ऑटोएनकोडर लेटेंट स्पेस के माध्यम से सहयोगात्मक सिंथेटिक डेटा जनरेशन का लाभ उठाता है।

Maximilian Andreas Hoefler, Karsten Mueller, Wojciech Samek2026-07-09
⚛️ quantum physics

QCNN with Rough Path Signature Kernels

यह शोध पत्र टाइम सीरीज़ वर्गीकरण के लिए एक हाइब्रिड क्वांटम-क्लासिकल आर्किटेक्चर प्रस्तावित करता है जो टाइम रीपैरामीट्रिज़ेशन इनवेरिएंस को संभालने के लिए पाथ सिग्नेचर कर्नेल को एकीकृत करता है और डाउनस्ट्रीम लर्निंग के लिए एक क्वांटम कनवल्शनल न्यूरल नेटवर्क (QCNN) का उपयोग करता है, जो हस्तलिखित अंक डेटा पर प्रयोगों के माध्यम से अपनी क्षमता प्रदर्शित करता है और साथ ही अपने वेरिएशनल लीनियर सॉल्वर घटकों की कम्प्यूटेशनल बाधाओं का विश्लेषण करता है।

Leonardo Nogueira Falabella, Vasily Sazonov2026-07-09
🤖 AI

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

यह शोधपत्र 1,250 हालिया अध्ययनों का सर्वेक्षण करता है ताकि सीमित, औद्योगिक स्व-परिष्करण (self-refinement) और मुक्त-अंत वाली पुनरावर्ती स्व-सुधार (recursive self-improvement) के बीच अंतर किया जा सके, और यह तर्क देता है कि बाद वाले की व्यवहार्यता मूल्यांकन संकेतों के एक पदानुक्रम द्वारा मौलिक रूप से बाधित है जहाँ सबसे कमजोर स्व-आकलन विधियाँ पतन की ओर ले जाती हैं और सबसे मजबूत औपचारिक सत्यापनकर्ता (formal verifiers) स्वायत्त अनुसंधान के लिए महत्वपूर्ण बाधा बने रहते हैं।

Mingguang Chen, Licheng Wang, Bo Qu2026-07-09
💬 NLP

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

यह शोध पत्र DiaLLM प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बड़े भाषा मॉडलों (large language models) में बोलियों संबंधी सुदृढ़ता (dialectal robustness) और सृजन (generation) के बीच एक महत्वपूर्ण अलगाव को प्रकट करता है, यह प्रदर्शित करते हुए कि जहाँ निरंतर प्री-ट्रेनिंग और SFT समझ में सुधार करते हैं, वहीं प्रामाणिक बोली संबंधी आउटपुट के लिए स्पष्ट विविधता-लक्षित अनुकूलन (variety-targeted adaptation) आवश्यक है, हालाँकि वर्तमान रिवॉर्ड-आधारित संरेखण विधियाँ अक्सर मानवीय प्राथमिकताओं के साथ संरेखित होने में विफल रहती हैं।

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin2026-07-09
🤖 AI

SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents

SkillCenter स्वायत्त AI एजेंटों के लिए 216,000 से अधिक संरचित कौशलों (skills) वाली एक विशाल, ओपन-सोर्स लाइब्रेरी पेश करता है, जिसमें एक कठोर पाइपलाइन शामिल है जो आउटपुट को सही, सुरक्षित और पता लगाने योग्य सुनिश्चित करने के लिए सहकर्मी-समीक्षित जर्नल्स और तकनीकी रिपॉजिटरी से स्रोत-आधारित कौशलों को सामुदायिक योगदान के साथ एकीकृत करती है।

Tianming Sha, Yue Zhao, Lichao Sun, Yushun Dong2026-07-09
💬 NLP

Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

अगन (Agon) एक प्रतिस्पर्धी क्रॉस-मॉडल सुदृढीकरण लर्निंग (reinforcement learning) ढांचे को पेश करता है जहाँ दो मॉडल एक-दूसरे के विरुद्ध समस्याओं का मसौदा तैयार करने और उन्हें हल करने के माध्यम से परस्पर ग्रेडर के रूप में कार्य करते हैं, जो बिना प्रोसेस लेबल के श्रेष्ठ तर्क को अंतर्निहित रूप से पुरस्कृत करता है और जटिल तर्क कार्यों पर मानक सिंगल-मॉडल आरएल (RL) दृष्टिकोणों से काफी बेहतर प्रदर्शन करता है।

Vladislav Beliaev2026-07-09
🤖 AI

Breaking Database Lock-in: Agentic Regeneration of High Performance Storage Readers for Database Bypass

यह शोध पत्र "Jailbreak" को पेश करता है, जो एक LLM-सहायता प्राप्त दृष्टिकोण है जो पारंपरिक डेटाबेस ड्राइवरों को बायपास करते हुए स्टोरेज फाइलों को सीधे इन-मेमोरी कॉलमर बफ़र्स में पढ़ने और डिकोड करने के माध्यम से विश्लेषणात्मक वर्कलोड में 27 गुना तक प्रदर्शन सुधार प्राप्त करता है और डेटा लॉक-इन को तोड़ता है।

Victor Giannakouris, Immanuel Trummer2026-07-09
💬 NLP

Co-LMLM: Continuous-Query Limited Memory Language Models

यह शोध पत्र Co-LMLM को प्रस्तुत करता है, जो एक निरंतर-क्वेरी सीमित स्मृति भाषा मॉडल (continuous-query limited memory language model) है जो एक स्केलेबल एनोटेशन पाइपलाइन के माध्यम से एक लचीले वेक्टर-आधारित ज्ञान आधार (knowledge base) के लिए तथ्यात्मक ज्ञान को बाह्य रूप में प्रस्तुत करता है, और कई पैमानों पर पूर्ववर्ती LMLMs और वैनिला LLMs दोनों की तुलना में बेहतर परप्लेक्सिटी (perplexity) और तथ्यात्मक सटीकता प्राप्त करता है।

Yair Feldman, Linxi Zhao, Nathan Godey, Dongyoung Go, Yilun Hua, Kilian Q. Weinberger, Jennifer J. Sun, Yoav Artzi2026-07-09