🤖 machine learning

Scalable Dexterous Robot Learning with AR-based Remote Human-Robot Interactions

यह शोध पत्र कुशल हेरफेर (dexterous manipulation) के लिए एक स्केलेबल टू-फेज रोबोट लर्निंग फ्रेमवर्क प्रस्तुत करता है जो व्यवहार क्लोनिंग प्रीट्रेनिंग के लिए AR-आधारित रिमोट ह्यूमन डिमॉन्स्ट्रेशन और मौजूदा बेसलाइन्स की तुलना में तेज़ प्रशिक्षण, उच्च सफलता दर और बेहतर मजबूती प्राप्त करने के लिए कंट्रास्टिव लर्निंग-एन्हांस्ड रीइन्फोर्समेंट लर्निंग का लाभ उठाता है।

Yicheng Yang, Ruijiao Li, Lifeng Wang, Shuai Zheng, Shunzheng Ma, Keyu Zhang, Tuoyu Sun, Chenyun Dai, Jie Ding, Zhuo Zou2026-07-07
📊 statistics

Deriving Neural Scaling Laws from the statistics of natural language

यह शोध पत्र पहला ऐसा सिद्धांत प्रस्तुत करता है जो प्राकृतिक भाषा में युग्मवार टोकन सहसंबंधों (pairwise token correlations) के क्षय और अगले-टोकन की सशर्त एंट्रॉपी (next-token conditional entropy) के क्षय पर आधारित एक पैरामीटर-मुक्त सूत्र को व्युत्पन्न करके, प्रथम सिद्धांतों से बड़े भाषा मॉडलों के डेटा-सीमित न्यूरल स्केलिंग घातांकों (data-limited neural scaling exponents) की मात्रात्मक रूप से भविष्यवाणी करता है।

Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart2026-07-07✓ Author reviewed
🤖 AI

rePIRL: Learn PRM with Inverse RL for LLM Reasoning

यह शोध पत्र rePIRL को प्रस्तुत करता है, जो एक इनवर्स रिइन्फोर्समेंट लर्निंग से प्रेरित ढांचा है जो विशेषज्ञ नीतियों के बारे में न्यूनतम धारणाओं के साथ LLM रीजनिंग के लिए प्रभावी प्रोसेस रिवॉर्ड मॉडल को प्रशिक्षित करने के लिए एक दोहरी शिक्षण प्रक्रिया का उपयोग करता है, जो मौजूदा विधियों की तुलना में गणित और कोडिंग कार्यों में बेहतर प्रदर्शन और सामान्यीकरण प्रदर्शित करता है।

Xian Wu, Kaijie Zhu, Ying Zhang, Lun Wang, Wenbo Guo2026-07-07
🔢 mathematics

Learning to Discover Iterative Spectral Algorithms

यह शोध पत्र AutoSpec को पेश करता है, जो एक स्व-पर्यवेक्षित (self-supervised) न्यूरल नेटवर्क फ्रेमवर्क है जो बड़े पैमाने के संख्यात्मक रैखिक बीजगणित (numerical linear algebra) और अनुकूलन (optimization) के लिए पुनरावृत्ति स्पेक्ट्रल एल्गोरिदम (iterative spectral algorithms) की खोज करना सीखता है, जो विशिष्ट इनपुट ऑपरेटरों और कार्यों के अनुरूप पुनरावृत्ति गुणांकों (recurrence coefficients) की भविष्यवाणी करके पारंपरिक स्पेक्ट्रम-अज्ञेय (spectrum-agnostic) बेसलाइन की तुलना में सटीकता और दक्षता में महत्वपूर्ण सुधार प्राप्त करता है।

Zihang Liu, Oleg Balabanov, Yaoqing Yang, Michael W. Mahoney2026-07-07
🤖 machine learning

Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders

यह शोध पत्र "ज्यामितीय हस्तक्षेप" (Geometric Interference) को मानक डिफ्यूजन ट्रांसफॉर्मर के प्रतिनिधित्व एनकोडर (representation encoders) पर अभिसरण (converge) करने में विफल होने के मौलिक कारण के रूप में पहचान करता है और जेकोबी नियमितीकरण (Jacobi Regularization) के साथ रिमानियन फ्लो मैचिंग (Riemannian Flow Matching - RJF) का प्रस्ताव करता है ताकि जनरेटिव प्रक्रियाओं को मैनिफोल्ड जियोडेसिक्स (manifold geodesics) तक सीमित किया जा सके, जिससे कम्प्यूटेशनल रूप से महंगे विड्थ स्केलिंग (width scaling) के बिना कुशल उच्च-निष्ठा संश्लेषण (high-fidelity synthesis) सक्षम हो सके।

Amandeep Kumar, Vishal M. Patel2026-07-07
🤖 machine learning

LGQ: Learnable Geometric Quantization for Image Tokenization

यह शोधपत्र लर्नबल ज्योमेट्रिक क्वांटाइजेशन (LGQ) प्रस्तुत करता है, जो एक नवीन इमेज टोकनाइजेशन विधि है जो एक डायवर्सिटी और पीक्डनेस टर्म द्वारा नियमित सॉफ्ट-टू-हार्ड असाइनमेंट रणनीति के साथ एक लर्नबल कोडबुक को जोड़कर कोलैप्स-फ्री ट्रेनिंग और श्रेष्ठ रिकंस्ट्रक्शन एवं जनरेशन प्रदर्शन प्राप्त करती है, जिससे EMA या कोडबुक रीपैरामीट्राइजेशन जैसे जटिल ह्यूरिस्टिक्स की आवश्यकता समाप्त हो जाती है।

Idil Bilge Altun, Mert Onur Cakiroglu, Elham Buxton, Mehmet Dalkilic, Hasan Kurban2026-07-07
💬 NLP

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama2026-07-07
💰 quantitative finance

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

यह अध्ययन क्रेडिट जोखिम मॉडलों के लिए पोस्ट-हॉक व्याख्यात्मकता उपकरणों के रूप में लार्ज लैंग्वेज मॉडल्स के उपयोग का मूल्यांकन करता है और यह निष्कर्ष निकालता है कि हालांकि वे नियंत्रित प्रॉम्प्ट्स के तहत फीचर-इम्पॉर्टेंस रैंकिंग को विश्वसनीय रूप से पुनरुत्पादित कर सकते हैं, लेकिन स्वायत्त स्पष्टीकरण पीढ़ी में सीमित संरेखण के कारण उन्हें औपचारिक एट्रिब्यूशन विधियों के विकल्प के बजाय नैरेटिव इंटरफेस के रूप में तैनात किया जाना सबसे अच्छा है।

Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang2026-07-07
💬 NLP

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

यह शोध पत्र VERI-DPO को प्रस्तुत करता है, जो एक प्राथमिकता-माइनिंग (preference-mining) ढांचा है जो शोर युक्त दावे-स्तरीय सत्यापन (claim-level verification) को कवरेज-नियंत्रित सारांश-स्तरीय प्राथमिकताओं में परिवर्तित करता है ताकि साक्ष्य-आधारित नैदानिक सारांशीकरण मॉडलों को प्रशिक्षित किया जा सके जो सामग्री कवरेज से समझौता किए बिना या इन्फरेंस-टाइम पुनर्रैंकिंग की आवश्यकता के बिना असंयोजित दावों को महत्वपूर्ण रूप से कम करते हैं।

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin2026-07-07
🤖 machine learning

A Switching System Theory of Q-Learning with Linear Function Approximation

यह शोधपत्र लीनियर क्यू-लर्निंग (linear Q-learning) के विश्लेषण के लिए एक नवीन स्विचिंग लीनियर सिस्टम फ्रेमवर्क स्थापित करता है, जो जॉइंट स्पेक्ट्रल रेडियस (joint spectral radius) पर आधारित परिमित-समय त्रुटि सीमाएं (finite-time error bounds) और अभिसरण प्रमाणपत्र (convergence certificates) व्युत्पन्न करता है जो पारंपरिक एक-चरणीय नॉर्म बाउंड्स (one-step norm bounds) की तुलना में कम रूढ़िवादी गारंटी प्रदान करते हैं।

Donghwan Lee, Han-Dong Lim2026-07-07