💬 NLP

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama2026-07-07
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA एक स्लाइडिंग-विंडो KV कैश संपीड़न (compression) विधि है जो द्विदिश अटेंशन (bidirectional attention) और एक लचीले टोकन2चंक (Token2Chunk) मॉड्यूल का उपयोग करके डिकोडिंग के दौरान सूचनात्मक संदर्भ को चुनिंदा रूप से बनाए रखती है, जिससे मौजूदा दृष्टिकोणों की कठोर सीमाओं के बिना रीजनिंग लैंग्वेज मॉडल्स के लिए मेमोरी ओवरहेड को कम करती है और थ्रूपुट में सुधार करती है।

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev2026-07-07
🤖 AI

AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation

AutoResearch एक निष्पादन-आधारित (execution-grounded) मल्टी-एजेंट फ्रेमवर्क है जो सैंडबॉक्स्ड कोड निष्पादन, पुनरावृत्ति सुधार (iterative repair), और कठोर उद्धरण एवं दावे के सत्यापन को एकीकृत करके जनरेट किए गए वैज्ञानिक आर्टिफैक्ट्स को फ़िल्टर करने और सुधारने के माध्यम से स्वचालित अनुसंधान वर्कफ़्लो की विश्वसनीयता को बढ़ाता है।

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Abdullah Aman Khan, Shaoning Zeng2026-07-07
🤖 AI

SWIFT: Spatio-temporal Wavelet Integrated Forecasting Framework for Workload Traces

SWIFT एक शुद्ध कनवोल्यूशनल फ्रेमवर्क है जो अनुकूलन योग्य फीचर निष्कर्षण के लिए एक लर्नबल कैस्केडेड वेवलेट पाथ और स्थानिक-कालिक निर्भरताओं को मॉडल करने के लिए एक मल्टीवेरिएट इंटरेक्शन मॉड्यूल को पेश करके क्लाउड वर्कलोड पूर्वानुमान की सटीकता और दक्षता को बढ़ाता है, जो रैखिक जटिलता के साथ अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zeyuan Ding, Lingfeng Zheng, Dian Ding, Guangtao Xue2026-07-07
🤖 AI

The Hidden Water Geography of U.S. Hyperscale Data Centers in the AI Era

यह अध्ययन प्रकट करता है कि अमेरिकी हाइपरस्केल डेटा सेंटर सालाना लगभग 300 GL पानी का उपभोग करते हैं, जिसमें तीन-चौथाई हिस्सा ऑन-साइट कूलिंग के बजाय बिजली उत्पादन के कारण है, जो जल-तनावग्रस्त पश्चिम और जीवाश्म-प्रधान पूर्व में विशिष्ट भौगोलिक हॉटस्पॉट बनाता है जिनके लिए अलग-अलग स्थानीय और क्षेत्रीय प्रबंधन रणनीतियों की आवश्यकता है।

Gianluca Guidi, Francesca Dominici2026-07-07
🤖 AI

Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure

यह शोध पत्र वर्कलोड-अवेयर डिलोको (WA-DiLoCo) प्रस्तुत करता है, जो एक कैलिब्रेटेड शेड्यूलिंग फ्रेमवर्क है जो यह प्रदर्शित करता है कि कैसे बर्स्ट फोरकास्टिंग और कठोर मैच-रैंडम बेसलाइन को शामिल करने से मौजूदा फोरकास्ट-फ्री नीतियों की तुलना में साझा एआई इंफ्रास्ट्रक्चर में एसएलओ (SLO) उल्लंघनों को काफी कम किया जा सकता है।

Maxwell Twelftree, David Lemphers, An-chi He, Yue Yang2026-07-07
🤖 AI

Additive Causal Construction for Transferable and Reconfigurable Cross-System Learning in Multi-Source Image Fusion

यह शोध पत्र एडिटिव कॉज़ल कंस्ट्रक्शन (ACC) फ्रेमवर्क और इसके लर्नबल इंस्टेंशिएशन, ACC-CRL को प्रस्तावित करता है ताकि अनिश्चितता परिमाणीकरण (uncertainty quantification) के माध्यम से हस्तांतरणीय कॉज़ल एंकर्स और पुनर्गठित फ्यूजन पथ स्थापित करके मल्टी-सोर्स इमेज फ्यूजन में क्रॉस-सिस्टम विसंगति और एंटैंगलमेंट को संबोधित किया जा सके, जिससे मेडिकल इमेजिंग जैसे कार्यों में आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण में महत्वपूर्ण सुधार हो सके।

Zhizhong Fu, Wei Zhou, Zhaoyang Jiang, Yulong Lin, Yifu Hou, Xiaorong Ding, Qiang Yan, Yifan Chen2026-07-07
🤖 AI

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

यह सर्वेक्षण चार प्रमुख अक्षों के आधार पर LLM सर्विंग के लिए तीस से अधिक KV कैश प्रबंधन प्रणालियों को पांच वास्तुशिल्प प्रोटोटाइप (archetypes) में वर्गीकृत करता है, स्वामित्व को डिजाइन भिन्नता के प्राथमिक चालक के रूप में पहचानता है, और सात महत्वपूर्ण मापन अंतराल को रेखांकित करता है जो फॉल्ट टॉलरेंस, आइसोलेशन और उन्नत सर्विंग तकनीकों की प्रगति में बाधा डालते हैं।

Jie Li, Tongyang Wang, Yong Chen2026-07-07
🤖 AI

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks

यह शोध पत्र डीप लर्निंग लॉस फंक्शन सीक्वेंसों का विश्लेषण करके गलत तरीके से लेबल की गई मेडिकल छवियों की पहचान करने के लिए एक स्वचालित विधि का प्रस्ताव और सत्यापन करता है, जो यह प्रदर्शित करता है कि इन त्रुटियों को सुधारने से डायबिटिक रेटिनोपैथी स्क्रीनिंग में डेटासेट की गुणवत्ता और मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu2026-07-07
🤖 AI

Fine-Grained Computation Offload for Off-the-Shelf Servers in Tens of Lines

यह शोध पत्र यह प्रदर्शित करता है कि मौजूदा कंकरेंसी प्रिमिटिव्स (concurrency primitives) का लाभ उठाकर, जो ऑफलोड निष्पादन के दौरान अनुरोधों को निलंबित करने और उनके पूरा होने पर उन्हें पुनः आरंभ करने में सक्षम हैं, मौजूदा कोड में न्यूनतम परिवर्तन (22-138 पंक्तियाँ) करके ऑफ-द-शेल्फ सर्वरों पर फाइन-ग्रेन्ड कंप्यूटेशन ऑफलोडिंग प्राप्त की जा सकती है, जिससे जटिल रनटाइम पुनलेखन (runtime rewrites) की आवश्यकता के बिना 1.2-5.4 गुना प्रदर्शन रिकवर किया जा सकता है।

Bojie Li2026-07-07