🤖 machine learning

Staleness-Learning Rate Scaling Laws for Asynchronous RLHF

यह शोध पत्र O(Sη)O(S \cdot \eta) के क्रम के प्रति-चरण ग्रेडिएंट बायस (per-step gradient bias) को व्युत्पन्न करके और रोलआउट लैग (rollout lag) तथा संचयी लर्नर ड्रिफ्ट (cumulative learner drift) पर आधारित लर्निंग रेट के लिए एक दो-प्रतिबंध स्थिरता स्थिति (two-constraint stability condition) को परिभाषित करने वाले एक सशर्त कोलैप्स-टाइम स्केलिंग लॉ (conditional collapse-time scaling law) को स्थापित करके, एसिंक्रोनस GRPO-आधारित RLHF में स्टेल रोलआउट्स (stale rollouts) के प्रभाव का विश्लेषण करता है।

Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Z (…)2026-07-02
🤖 AI

Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

यह शोध पत्र ओपन-वर्ल्ड डिस्ट्रीब्यूशनल शिफ्ट्स के तहत एलएलएम (LLM) एजेंट्स के प्रदर्शन में गिरावट को औपचारिक रूप देने और व्यवस्थित रूप से मूल्यांकन करने के लिए ओपनएजेंट (OpenAgent) फ्रेमवर्क प्रस्तुत करता है, जो स्थिर प्रशिक्षण में उनकी नाजुकता को उजागर करता है और एक सुदृढ़ समाधान के रूप में पर्टर्बेशन-ऑगमेंटेड फाइन-ट्यूनिंग (Perturbation-Augmented Fine-Tuning) का प्रस्ताव देता है।

Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo2026-07-02
🤖 AI

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

यह शोध पत्र LongVQUBench को प्रस्तुत करता है, जो 1200 से अधिक विविध लंबी अवधि के वीडियो और 1500 प्रश्नों से बना एक व्यापक बेंचमार्क है जिसे तीन पदानुक्रमित तर्क स्तरों के माध्यम से विजन-लैंग्वेज मॉडल की दीर्घकालिक वीडियो गुणवत्ता समझ का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो टेम्पोरल इंटीग्रेशन और परसेप्चुअल एट्रिब्यूशन के संबंध में वर्तमान अत्याधुनिक मॉडलों में महत्वपूर्ण प्रदर्शन सीमाओं को प्रकट करता है।

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin2026-07-02
🤖 machine learning

Muon as a Residual Connection

यह शोध पत्र म्यूऑन (Muon) ऑप्टिमाइज़र की एक यांत्रिक व्याख्या प्रस्तावित करता है जो इसे एक अंतर्निहित अवशिष्ट जुड़ाव (implicit residual connection) के रूप में देखता है जो डाउनस्ट्रीम परतों के लिए प्रतिनिधित्व संरक्षण (representation preservation) में सुधार करने हेतु तात्कालिक ग्रेडिएंट निष्ठा (gradient fidelity) का त्याग करता है, जिससे इसकी प्रभावकारिता के लिए एक वैचारिक स्पष्टीकरण और स्थानीय अवतरण (local descent) एवं डाउनस्ट्रीम उपयोगिता के बीच संतुलन बनाने के लिए एक नया डिज़ाइन परिप्रेक्ष्य प्राप्त होता है।

Hao Huang2026-07-02
🤖 AI

Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity

यह शोध पत्र "एडवर्सरियल प्रैगमैटिक्स" (adversarial pragmatics) प्रस्तुत करता है, जो एक भाषाई रूप से आधारित बेंचमार्क और एनोटेशन प्रोटोकॉल है जिसे क्षमता की सीमाओं, नीतिगत अस्पष्टता और निर्देश संघर्षों के बीच अंतर करने के माध्यम से एआई सुरक्षा (AI safety) का कठोरता से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जिसमें मॉडल व्यवहार और मूल्यांकनकर्ता निर्णयों में विफलताओं के निदान के लिए एक नियंत्रित वर्गीकरण, विशेषज्ञ मूल्यांकन मेट्रिक्स और एक सीड डेटासेट शामिल है।

Brett Reynolds2026-07-02
🤖 machine learning

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

यह शोध पत्र एक एडवरसेरियल जनरेटर-डिस्क्रिमिनेटर फ्रेमवर्क प्रस्तावित करता है जो विविधता पतन (diversity collapse) और रिवॉर्ड हैकिंग (reward hacking) जैसे सामान्य RLVR विफलता मोड को कम करने के लिए मानव प्रदर्शनों से प्राप्त एक सीखे हुए संकेत के साथ सत्यापन योग्य पुरस्कारों को बढ़ाता है, जिससे कार्य सटीकता और शैली एवं संरचना जैसे गैर-सत्यापन योग्य मानव-समान गुणों दोनों को सफलतापूर्वक अनुकूलित किया जा सके।

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas2026-07-02
🤖 AI

World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video

"वर्ल्ड फ्रॉम मोशन" नामक शोध पत्र एक ऐसी नवीन विधि प्रस्तुत करता है जो सिंगल-व्यू वीडियो से प्रारंभिक 3D गॉसियन पुनर्निर्माणों को परिष्कृत करने के लिए सिम्युलेटेड मोनोकुलर आर्टिफैक्ट्स पर प्रशिक्षित एक वीडियो मॉडल का लाभ उठाती है, जिसके परिणामस्वरूप बेहतर मोशन कंसिस्टेंसी और नोवेल-व्यू सिंथेसिस के साथ उच्च-गुणवत्ता वाले, स्वतंत्र रूप से रेंडर करने योग्य डायनेमिक 3D दृश्य प्राप्त होते हैं।

Liyuan Zhu, Shengyu Huang, Amrita Mazumdar, Tianye Li, Zan Gojcic, Gordon Wetzstein, Iro Armeni, Shalini De Mello, Alex (…)2026-07-02
⚡ electrical engineering

GPU-Parallel Linearization Error Bounds for Real-Time Robust Optimal Control of Nonlinear and Neural Network Dynamics

यह शोध पत्र GPUSLS-LEO प्रस्तुत करता है, जो एक GPU-समानांतर फ्रेमवर्क है जो उच्च-आयामी अनिश्चित गैररेखीय प्रणालियों के लिए वास्तविक समय में, औपचारिक रूप से सत्यापित सुदृढ़ इष्टतम नियंत्रण को सक्षम करने हेतु एनालिटिक और न्यूरल नेटवर्क डायनेमिक्स दोनों के लिए सटीक, विभेदनीय लीनियराइजेशन एरर बाउंड्स की गणना करता है।

Jeffrey Fang, Keyi Shen, Anutam Srinivasan, Glen Chou2026-07-02
🤖 machine learning

Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation

यह शोध पत्र "डिस्टिल टू डिटेक्ट" (D2D) को प्रस्तुत करता है, जो एक नवीन विधि है जो वितरण संबंधी बदलावों (distributional shifts) को एक KV-कैश एडेप्टर में डिस्टिल करके बड़े भाषा मॉडलों (large language models) में छिपे हुए, गुप्त पूर्वाग्रहों को प्रवर्धित और प्रकट करती है, जिससे उस मौलिक पहचान विषमता (detection asymmetry) पर विजय प्राप्त होती है जहाँ अज्ञात पूर्वाग्रह विषय मानक निरीक्षण के लिए अदृश्य बने रहते हैं।

Shayan Talaei, Abhinav Chinta, Devvrit Khatri, Amin Karbasi, Azalia Mirhoseini, Amin Saberi2026-07-02
🤖 AI

Are Performance-Optimization Benchmarks Reliably Measuring Coding Agents?

यह शोध पत्र तीन प्रमुख रिपॉजिटरी-स्तरीय प्रदर्शन-अनुकूलन बेंचमार्क (GSO, SWE-Perf, और SWE-fficiency) का ऑडिट करता है और यह प्रकट करता है कि विभिन्न मशीनों पर महत्वपूर्ण संदर्भ पैच नाजुकता (reference patch fragility), रैंकिंग को विकृत करने वाले स्कोरिंग नियमों, और इस तथ्य के कारण कि अधिकांश कार्य पहले से ही मौजूदा सार्वजनिक सबमिशन द्वारा हल करने योग्य हैं, उनके लीडरबोर्ड स्कोर अविश्वसनीय हैं, जिससे वास्तविक प्रदर्शन अंतराल छिप जाता है।

Zhi Chen, Zhensu Sun, Yuling Shi, David Lo, Lingxiao Jiang2026-07-02