🤖 machine learning

Reassessing Muon for Matrix Factorization

यह शोध पत्र लो-रैंक मैट्रिक्स फैक्टराइजेशन पर म्यूऑन (Muon) ऑप्टिमाइज़र का पुनर्मूल्यांकन करता है ताकि इसके अपडेट नियम को भ्रमित करने वाले कारकों से अलग किया जा सके, जिससे यह प्रकट होता है कि यह लगातार एडमडब्ल्यू (AdamW) से बेहतर प्रदर्शन नहीं करता है और इसके रिपोर्ट किए गए लाभ अक्सर हाइपरपैरामीटर के चयन के प्रति संवेदनशील होते हैं।

Ali Parviz, Gal Mishne, Alex Cloninger2026-07-16
🤖 AI

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

यह शोध पत्र हार्नेस हैंडबुक (Harness Handbook) को प्रस्तुत करता है, जो एक व्यवहार-केंद्रित प्रतिनिधित्व और बिहेवियर-गाइडेड प्रोग्रेसिव डिस्क्लोजर (BGPD) विधि है जो उच्च-स्तरीय व्यवहार संबंधी आवश्यकताओं को विशिष्ट सोर्स कोड स्थानों पर स्वचालित रूप से मैप करती है, जिससे लोकलाइजेशन की बाधा दूर होती है और जटिल एआई एजेंट हार्नेस के विकास की दक्षता और गुणवत्ता में सुधार होता है।

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leowe (…)2026-07-16
🤖 AI

Faithful Autoformalization of Natural Language Assertions

यह शोध पत्र मोंटी (Monty) को प्रस्तुत करता है, जो एक ऑटोफॉर्मलाइजेशन फ्रेमवर्क है जो नवीन कन्फ़ॉर्मेंस (conformance) और वैलिडिटी (validity) स्कोर का उपयोग करके LLM-जनित आउटपुट को फ़िल्टर करके प्राकृतिक भाषा से निष्पादन योग्य एसेर्शन (assertions) के संश्लेषण की सटीकता में सुधार करता है, जिससे नेइव ट्रांसलेशन (naive translation) विधियों की तुलना में औसतन 20-पॉइंट तक की प्रिसिजन (precision) वृद्धि प्राप्त होती है।

Hongyi Liu, Madhusudan Parthasarathy, Adithya Murali2026-07-16
🤖 AI

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

यह शोध पत्र विजुअल डिपेंडेंसी गैप (VDG) को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वीडियो लार्ज लैंग्वेज मॉडल्स में उच्च बेंचमार्क सटीकता अक्सर वास्तविक दृश्य समझ के बजाय भाषाई पूर्वाग्रहों (लैंग्वेज प्रायर्स) से उत्पन्न होती है, जो यह प्रकट करता है कि टेम्पोरल ऑर्डर प्रदर्शन में न्यूनतम योगदान देता है जबकि फ्रेम विविधता अधिकांश लाभों को संचालित करती है।

Jae Joong Lee2026-07-16
🤖 AI

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains

यह शोध पत्र OptCar प्रस्तुत करता है, जो एक हिस्ट्री-कंडीशन्ड डायनेमिक्स अडैप्टेशन मॉड्यूल और सिंथेटिक रोलआउट्स के साथ सीमित वास्तविक दुनिया के डेटा का उपयोग करके, विविध भूभागों और पेलोडों में सुदृढ़, उच्च-गति क्लोज्ड-लूप नियंत्रण प्राप्त करने के माध्यम से जनरलिटिस्ट और स्पेशलिस्ट वाहन मॉडलों के बीच के अंतर को पाटता है।

Rwik Rana, Jesse Quattrociocchi, Christian Ellis, Nathan Tsoi, Garrett Warnell, Joydeep Biswas2026-07-16
⚡ electrical engineering

Efficient Text-to-Audio Generation via Pruning

यह शोध पत्र नार्म-आधारित मानदंडों (norm-based criteria) और लाइटवेट फाइन-ट्यूनिंग द्वारा निर्देशित एक फ़िल्टर-प्रूनिंग रणनीति का प्रस्ताव करता है जो ऑडियोएलडीएम (AudioLDM) मॉडल की कम्प्यूटेशनल लागत को काफी कम करते हुए इसकी टेक्स्ट-टू-ऑडियो जनरेशन गुणवत्ता को बनाए रखता है या उसमें सुधार भी करता है, जिसमें बंदूक की गोली और सायरन जैसी विशिष्ट ध्वनियों की रिकवरी भी शामिल है।

Arshdeep Singh, Yi Yuan, Yun Chen, Wenwu Wang, Mark D. Plumbley2026-07-16
💬 NLP

The Refusal Residue: When Probes Catch Alignment Faking and When They Don't

यह शोध पत्र विशिष्ट लार्ज लैंग्वेज मॉडल्स में एलाइनमेंट फेकिंग (alignment faking) के उद्भव की जांच करता है, जो यह प्रकट करता है कि जबकि हिडन स्टेट्स (hidden states) कभी-कभी ऐसे भ्रामक व्यवहार का पता लगा सकते हैं, मानक प्रोबिंग विधियाँ गंभीर अति-अनुमान और लीकेज के प्रति संवेदनशील होती हैं, जिसके लिए विश्वसनीय पहचान हेतु एक कठोर पांच-नियंत्रण ढांचे की आवश्यकता होती है।

Aman Mehta2026-07-16
🤖 AI

The Café in Amsterdam: When the Incumbent Becomes the Oracle

यह शोध पत्र "बेसलाइन कैप्चर" (baseline capture) की अवधारणा प्रस्तुत करता है, जो एक ऐसी विकृति है जहाँ एक मौजूदा प्रणाली का आउटपुट ही वास्तविक विनिर्देश (de facto specification) बन जाता है, और यह तर्क देता है कि आधुनिक एक्सेलेरेटर्स के लिए सफल कम्प्यूटेशनल पुनर्गठन हेतु वैध सत्यापन और स्वचालन को सक्षम करने के लिए एक स्वतंत्र मांग को स्पष्ट रूप से परिभाषित करना आवश्यक है।

Augusto Camargo2026-07-16
🤖 AI

Set-shifting Behavioral Test for Harnessed Agents

यह शोधपत्र एक सेट-शिफ्टिंग व्यवहारिक परीक्षण प्रस्तुत करता है जो यह मूल्यांकन करता है कि एलएलएम (LLM) एजेंट टूल विश्वसनीयता में छिपे हुए परिवर्तनों के प्रति कैसे अनुकूलित होते हैं, जिससे यह पता चलता है कि एजेंट विशिष्ट दिनचर्या पर दृढ़ता से टिके रहने की प्रवृत्ति रखते हैं जिनके विशिष्ट विफलता मोड होते हैं और जो इस बात से भी प्रभावित होते हैं कि टूलसेट को किस प्रकार फ्रेम किया गया है।

Ziwei Ye2026-07-16
📊 statistics

Price of Fairness in Bandits: A Tight Minimax Characterization

यह शोध पत्र सख्त निष्पक्षता व्यवस्थाओं (strict fairness regimes) के लिए Ω(σkmax(1,q)/T)\Omega(\sigma\sqrt{k^{\max(1,q)}/T}) का एक एल्गोरिदम-स्वतंत्र निचला स्तर (lower bound) सिद्ध करके और \textsf{UCB-HARE} एल्गोरिदम को पेश करके मल्टी-आर्म्ड बैंडिट्स में निष्पक्षता की कीमत (price of fairness) का एक सटीक मिनिमैक्स लक्षण वर्णन (minimax characterization) स्थापित करता है, जो लॉगरिदमिक कारकों तक इस इष्टतम रिग्रेट दर (optimal regret rate) को प्राप्त करता है।

Dhruv Sarkar, Soumyadeep Dutta, Sayak Ray Chowdhury2026-07-16