🤖 machine learning

Geometry-Preserving Orthonormal Initialization for Low-Rank Adaptation in RLVR

यह शोध पत्र 'रिनफोर्समेंट लर्निंग विद वेरीफिएबल रिवार्ड्स' (RLVR) में 'लो-रैंक अडैप्टेशन' (LoRA) के लिए 'जियोमेट्री-प्रिजर्विंग ऑर्थोनॉर्मल इनिशियलाइजेशन' का प्रस्ताव करता है, जो सैद्धांतिक रूप से यह प्रदर्शित करता है कि यह दृष्टिकोण 'फुल फाइन-ट्यूनिंग' के अंतर को न्यूनतम करता है, प्रशिक्षण को स्थिर करता है, और गणितीय तर्क संबंधी बेंचमार्क पर PiSSA और MiLoRA जैसे मौजूदा वेरिएंट्स से बेहतर प्रदर्शन करता है।

Ruijia Zhang, Jiacheng Zhu, Hanqing Zhu, Laixi Shi2026-07-01
🤖 machine learning

Low-dimensional topology of deep neural networks

यह शोध पत्र लिंकिंग नंबरों में परिवर्तनों को ट्रैक करने के लिए उनके प्रतिनिधित्व स्थान (representation space) को R3\mathbb{R}^3 तक सीमित करके डीप न्यूरल नेटवर्क की टोपोलॉजिकल अभिव्यंजना शक्ति (topological expressivity) की जांच करता है, जो यह प्रकट करता है कि नॉनमोनोटोनिक एक्टिवेशन, ResNets और ट्रांसफॉर्मर, मोनोटोनिक फीडफॉरवर्ड या फ्लो-आधारित मॉडलों की तुलना में एक उच्च अभिव्यंजना वर्ग साझा करते हैं।

Junyu Ren, Lek-Heng Lim2026-07-01
🤖 machine learning

Review Residuals: Update-Conditioned Residual Gating for Transformers

यह शोध पत्र 'रिव्यू रेसिडुअल्स' (Review Residuals) को प्रस्तुत करता है, जो एक नवीन गेटिंग तंत्र है जो वर्तमान अवस्था और प्रस्तावित अपडेट दोनों के आधार पर ट्रांसफॉर्मर अपडेट को स्केल करता है, यह प्रदर्शित करते हुए कि यह योगात्मक, पहचान-संरक्षण वाला रूप सभी गहराइयों पर स्थिर प्रशिक्षण सक्षम बनाता है और विशेष रूप से बड़े मॉडल पैमानों पर मानक रेसिडुअल्स और हाईवे गेट्स की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्रदान करता है।

Kyle Kramer2026-07-01
📊 statistics

Signed-Permutation Coordinate Transport for RMSNorm Transformers

यह शोध पत्र पहचान करता है कि RMSNorm ट्रांसफॉर्मर्स में एक साधारण परम्यूटेशन गेज (SdS_d) के बजाय एक साइन्ड-परम्यूटेशन गेज (BdB_d) होता है, और चेकपॉइंट्स के बीच सुदृढ़ कोऑर्डिनेट ट्रांसपोर्ट को सक्षम करने के लिए एक साइन-मार्जिनलाइज्ड हंगेरियन मैचिंग पद्धति पेश करता है, जिससे व्याख्यात्मकता उपकरणों (interpretability tools), स्टीयरिंग वेक्टर्स और ऑप्टिमाइज़र स्टेट्स की हस्तांतरणीयता में महत्वपूर्ण सुधार होता है और मौजूदा अलाइनमेंट दृष्टिकोणों में समरूपता-प्रेरित विफलताओं का समाधान होता है।

John Sweeney2026-07-01
🤖 machine learning

Amplifying Membership Signal Through Chained Regeneration

यह शोध पत्र MADreMIA को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) ढांचा है जो विविध मोडैलिटीज के माध्यम से पुनरावृत्ति, श्रृंखलाबद्ध जनरेशन का लाभ उठाकर मेंबरशिप और डेटासेट इन्फरेंस हमलों को बढ़ाता है ताकि शैडो मॉडल प्रशिक्षण की आवश्यकता के बिना मेमोराइजेशन संकेतों को प्रवर्धित किया जा सके और पहचान संवेदनशीलता में सुधार किया जा सके।

Wojciech Łapacz, Stanisław Pawlak2026-07-01
🤖 AI

Self-Study Reconsidered: The Hidden Fragility of Learning from Self-Generated QA

यह शोध पत्र प्रकट करता है कि भाषा मॉडलों के लिए स्व-निर्मित प्रश्न-उत्तर पर्यवेक्षण (self-generated question-answer supervision) गैर-समान साक्ष्य चयन और निर्देश-अनुसरण पूर्वाग्रहों के कारण स्वाभाविक रूप से नाजुक है, लेकिन इन मुद्दों को निश्चित लक्ष्यों से प्रश्नों को जोड़ने और निर्देश-समान टेक्स्ट स्पैन को फ़िल्टर करके प्रभावी ढंग से कम किया जा सकता है।

Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov2026-07-01
🤖 machine learning

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

यह शोध पत्र TRIAGE का प्रस्ताव करता है, जो एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) के लिए एक रोल-टाइप्ड क्रेडिट असाइनमेंट फ्रेमवर्क है, जो एक्शन सेगमेंट को सिमेंटिक भूमिकाओं (जैसे, निर्णायक प्रगति, अन्वेषण, प्रतिगमन) में वर्गीकृत करके बाउंडेड प्रोसेस रिवॉर्ड्स लागू करता है ताकि मानक GRPO को बेहतर बनाया जा सके, जिससे परिणाम-मात्र (outcome-only) की कमियों को सुधारा जा सके और विविध बेंचमार्क पर सफलता दर और दक्षता में महत्वपूर्ण सुधार किया जा सके।

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Zhipeng Wang, Alborz Geramifard2026-07-01
🤖 machine learning

Automated Background Swapping for Robustness against Spurious Backgrounds

यह शोध पत्र ऑटोमेटेड बैकग्राउंड स्वैपिंग (AutoBackSwap) को प्रस्तुत करता है, जो एक डेटा ऑग्मेंटेशन विधि है जो फोरग्राउंड को बैकग्राउंड से अलग करती है और नए बैकग्राउंड को सिंथेसाइज करती है ताकि उन क्लासिफायरों को प्रशिक्षित किया जा सके जो स्पूरियस बैकग्राउंड सहसंबंधों के विरुद्ध सुदृढ़ हों, भले ही मूल प्रशिक्षण डेटा में कोई काउंटर-एग्जांपल मौजूद न हो।

Cesar Roder, Kajetan Schweighofer2026-07-01
🤖 machine learning

AdaJEPA: An Adaptive Latent World Model

adaJEPA एक एडेप्टिव लेटेंट वर्ल्ड मॉडल है जो मॉडल प्रेडिक्टिव कंट्रोल लूप के भीतर टेस्ट-टाइम सेल्फ-सुपरवाइज्ड अडैप्टेशन को निष्पादित करके, प्रेक्षित स्टेट ट्रांजिशन का उपयोग करते हुए अतिरिक्त एक्सपर्ट डेमोंस्ट्रेशन की आवश्यकता के बिना मॉडल को निरंतर पुन: कैलिब्रेट करके, डिस्ट्रीब्यूशन शिफ्ट के तहत प्लानिंग रोबस्टनेस को बढ़ाता है।

Ying Wang, Oumayma Bounou, Yann LeCun, Mengye Ren2026-07-01
🤖 machine learning

Freeform Preference Learning for Robotic Manipulation

यह शोध पत्र फ्रीफॉर्म प्रेफरेंस लर्निंग (FPL) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रोबोटिक मैनिपुलेशन पॉलिसियों को बाइनरी तुलनाओं के बजाय प्राकृतिक-भाषा वरीयता अक्षों (natural-language preference axes) से सीखने में सक्षम बनाती है, जिसके परिणामस्वरूप प्रदर्शन में महत्वपूर्ण सुधार, सघन प्रगति संकेत (dense progress signals), और बिना पुन: प्रशिक्षण के परीक्षण के समय व्यवहार को नियंत्रित करने की क्षमता प्राप्त होती है।

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn2026-07-01