💬 NLP

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama2026-07-07
💰 quantitative finance

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

यह अध्ययन क्रेडिट जोखिम मॉडलों के लिए पोस्ट-हॉक व्याख्यात्मकता उपकरणों के रूप में लार्ज लैंग्वेज मॉडल्स के उपयोग का मूल्यांकन करता है और यह निष्कर्ष निकालता है कि हालांकि वे नियंत्रित प्रॉम्प्ट्स के तहत फीचर-इम्पॉर्टेंस रैंकिंग को विश्वसनीय रूप से पुनरुत्पादित कर सकते हैं, लेकिन स्वायत्त स्पष्टीकरण पीढ़ी में सीमित संरेखण के कारण उन्हें औपचारिक एट्रिब्यूशन विधियों के विकल्प के बजाय नैरेटिव इंटरफेस के रूप में तैनात किया जाना सबसे अच्छा है।

Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang2026-07-07
💬 NLP

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

यह शोध पत्र VERI-DPO को प्रस्तुत करता है, जो एक प्राथमिकता-माइनिंग (preference-mining) ढांचा है जो शोर युक्त दावे-स्तरीय सत्यापन (claim-level verification) को कवरेज-नियंत्रित सारांश-स्तरीय प्राथमिकताओं में परिवर्तित करता है ताकि साक्ष्य-आधारित नैदानिक सारांशीकरण मॉडलों को प्रशिक्षित किया जा सके जो सामग्री कवरेज से समझौता किए बिना या इन्फरेंस-टाइम पुनर्रैंकिंग की आवश्यकता के बिना असंयोजित दावों को महत्वपूर्ण रूप से कम करते हैं।

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin2026-07-07
🤖 machine learning

A Switching System Theory of Q-Learning with Linear Function Approximation

यह शोधपत्र लीनियर क्यू-लर्निंग (linear Q-learning) के विश्लेषण के लिए एक नवीन स्विचिंग लीनियर सिस्टम फ्रेमवर्क स्थापित करता है, जो जॉइंट स्पेक्ट्रल रेडियस (joint spectral radius) पर आधारित परिमित-समय त्रुटि सीमाएं (finite-time error bounds) और अभिसरण प्रमाणपत्र (convergence certificates) व्युत्पन्न करता है जो पारंपरिक एक-चरणीय नॉर्म बाउंड्स (one-step norm bounds) की तुलना में कम रूढ़िवादी गारंटी प्रदान करते हैं।

Donghwan Lee, Han-Dong Lim2026-07-07
🤖 machine learning

Tile-Level Activation Overlap for Efficient LLM Inference

यह शोध पत्र दो विशिष्ट CUTLASS-आधारित SM90 कर्नेल पेश करता है जो मध्यवर्ती टेंसर मटेरियलिज़ेशन ओवरहेड को समाप्त करने के लिए टाइल स्तर पर मैट्रिक्स गुणन के साथ SwiGLU एक्टिवेशन को फ्यूज करते हैं, जिससे NVIDIA H100 GPU पर 2.47x तक की गति वृद्धि और 79.5% पीक यूटिलाइजेशन प्राप्त होता है और यह दक्षता एवं संख्यात्मक सटीकता में PyTorch और cuBLAS दोनों से बेहतर प्रदर्शन करता है।

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta2026-07-07
🧬 biology

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features

यह अध्ययन प्रदर्शित करता है कि मोशन-करेक्टेड QSM MRI और मल्टीबैंड मल्टीइको fMRI विशेषताओं को एकीकृत करने वाले व्याख्यात्मक मशीन लर्निंग मॉडल पार्किंसंस रोग की मोटर गंभीरता की प्रभावी ढंग से भविष्यवाणी कर सकते हैं, जिसमें संयुक्त संरचनात्मक और नैदानिक चर सबसे सटीक और नैदानिक रूप से प्रासंगिक भविष्यवाणियां प्रदान करते हैं।

Aixa X. Andrade2026-07-07
🤖 machine learning

MLSYSIM: First-Principles Infrastructure Modeling for Machine Learning Systems

यह शोध पत्र MLSYSIM को प्रस्तुत करता है, जो एक प्रथम-सिद्धांतों (first-principles) वाला विश्लेषणात्मक ढांचा है जो सिस्टम भौतिकी को एक आयामी रूप से-सख्त इंजन में औपचारिक रूप देकर मशीन लर्निंग सिस्टम के लिए तीव्र, फुल-स्टैक आर्किटेक्चरल तर्क को सक्षम बनाता है, जो यूनिट अखंडता और उत्पत्ति ट्रैकिंग सुनिश्चित करते हुए कम्प्यूटेशनल मांग को हार्डवेयर आपूर्ति से अलग करता है।

Vijay Janapa Reddi2026-07-07
🤖 AI

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

यह सर्वेक्षण चार प्रमुख अक्षों के आधार पर LLM सर्विंग के लिए तीस से अधिक KV कैश प्रबंधन प्रणालियों को पांच वास्तुशिल्प प्रोटोटाइप (archetypes) में वर्गीकृत करता है, स्वामित्व को डिजाइन भिन्नता के प्राथमिक चालक के रूप में पहचानता है, और सात महत्वपूर्ण मापन अंतराल को रेखांकित करता है जो फॉल्ट टॉलरेंस, आइसोलेशन और उन्नत सर्विंग तकनीकों की प्रगति में बाधा डालते हैं।

Jie Li, Tongyang Wang, Yong Chen2026-07-07
📊 statistics

CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation

CORA एक पैरामीटर-कुशल फाइन-ट्यूनिंग विधि है जो SVD आधारों (bases) पर प्रति-स्लाइस सुसंगत ऑर्थोगोनल रोटेशन और डायगोनल स्पेक्ट्रम शिफ्ट लागू करके प्रीट्रेन्ड वेट्स को अनुकूलित करती है, जिससे कम से कम प्रशिक्षण योग्य पैरामीटर्स का उपयोग करते हुए LoRA जैसी मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्राप्त होता है।

Pengcheng Wang, Ziran Liu, Wei Wang, Wei Jiang2026-07-07
🤖 machine learning

Auditing the Audit: Five Failure Modes in Benchmark-Validity Audits

यह शोध पत्र तर्क देता है कि एआई (AI) मॉडलों के लिए विक्षोभ-आधारित (perturbation-based) रचना-वैधता ऑडिट (construct-validity audits) नाजुक हैं और मौन कार्यान्वयन विफलताओं के प्रति संवेदनशील हैं, जो गैर-पुष्टिपरक साक्ष्य को रोकने के लिए एक छह-बिंदु ड्यू-डिलिजेंस गेट का प्रस्ताव करता है और साथ ही यह प्रदर्शित करता है कि सुरक्षा बेंचमार्क और ओपन-वेट मॉडलों का एक विशिष्ट केस स्टडी ऑडिट विफलता के पांच मोड के इस नए वर्गीकरण के तहत पुष्टि मानकों को पूरा करने में विफल रहता है।

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-07-07