💬 NLP

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

यह शोध पत्र FlashBlock का प्रस्ताव करता है, जो एक नवीन तंत्र है जो वर्तमान ब्लॉक के बाहर के टोकन से स्थिर क्रॉस-स्टेप अटेंशन आउटपुट को कैश और पुन: उपयोग करके लॉन्ग-कॉन्टेक्स्ट ब्लॉक डिफ्यूजन को त्वरित करता है, जिससे जनरेशन की गुणवत्ता बनाए रखते हुए कम्प्यूटेशनल ओवरहेड और KV कैश एक्सेस को महत्वपूर्ण रूप से कम किया जा सकता है।

Zhuokun Chen, Jianfei Cai, Bohan Zhuang2026-07-07
🤖 AI

Multi-Way Representation Alignment

यह शोध पत्र ज्योमेट्री-करेक्टेड प्रोक्रस्टेस अलाइनमेंट (GCPA) का प्रस्ताव देकर पेयरवाइज़ मॉडल अलाइनमेंट की सीमाओं को संबोधित करता है, जो एक मल्टी-वे विधि है जो जनरल पाइज्ड प्रोक्रस्टेस एनालिसिस के माध्यम से एक साझा ऑर्थोगोनल रेफरेंस स्पेस का निर्माण करती है और मॉडल स्टिचिंग के लिए ज्योमेट्रिक प्रिजर्वेशन तथा रिट्रीवल कार्यों के लिए डायरेक्शनल एग्रीमेंट दोनों को अनुकूलित करने के लिए पोस्ट-हॉक सुधार लागू करती है।

Akshit Achara, Tatiana Gaintseva, Mateo Mahaut, Pritish Chakraborty, Viktor Stenby Johansson, Melih Barsbey, Emanuele Ro (…)2026-07-07
📊 statistics

Deriving Neural Scaling Laws from the statistics of natural language

यह शोध पत्र पहला ऐसा सिद्धांत प्रस्तुत करता है जो प्राकृतिक भाषा में युग्मवार टोकन सहसंबंधों (pairwise token correlations) के क्षय और अगले-टोकन की सशर्त एंट्रॉपी (next-token conditional entropy) के क्षय पर आधारित एक पैरामीटर-मुक्त सूत्र को व्युत्पन्न करके, प्रथम सिद्धांतों से बड़े भाषा मॉडलों के डेटा-सीमित न्यूरल स्केलिंग घातांकों (data-limited neural scaling exponents) की मात्रात्मक रूप से भविष्यवाणी करता है।

Francesco Cagnetta, Allan Raventós, Surya Ganguli, Matthieu Wyart2026-07-07✓ Author reviewed
🤖 AI

rePIRL: Learn PRM with Inverse RL for LLM Reasoning

यह शोध पत्र rePIRL को प्रस्तुत करता है, जो एक इनवर्स रिइन्फोर्समेंट लर्निंग से प्रेरित ढांचा है जो विशेषज्ञ नीतियों के बारे में न्यूनतम धारणाओं के साथ LLM रीजनिंग के लिए प्रभावी प्रोसेस रिवॉर्ड मॉडल को प्रशिक्षित करने के लिए एक दोहरी शिक्षण प्रक्रिया का उपयोग करता है, जो मौजूदा विधियों की तुलना में गणित और कोडिंग कार्यों में बेहतर प्रदर्शन और सामान्यीकरण प्रदर्शित करता है।

Xian Wu, Kaijie Zhu, Ying Zhang, Lun Wang, Wenbo Guo2026-07-07
🔢 mathematics

Learning to Discover Iterative Spectral Algorithms

यह शोध पत्र AutoSpec को पेश करता है, जो एक स्व-पर्यवेक्षित (self-supervised) न्यूरल नेटवर्क फ्रेमवर्क है जो बड़े पैमाने के संख्यात्मक रैखिक बीजगणित (numerical linear algebra) और अनुकूलन (optimization) के लिए पुनरावृत्ति स्पेक्ट्रल एल्गोरिदम (iterative spectral algorithms) की खोज करना सीखता है, जो विशिष्ट इनपुट ऑपरेटरों और कार्यों के अनुरूप पुनरावृत्ति गुणांकों (recurrence coefficients) की भविष्यवाणी करके पारंपरिक स्पेक्ट्रम-अज्ञेय (spectrum-agnostic) बेसलाइन की तुलना में सटीकता और दक्षता में महत्वपूर्ण सुधार प्राप्त करता है।

Zihang Liu, Oleg Balabanov, Yaoqing Yang, Michael W. Mahoney2026-07-07
🤖 AI

Framework of Thoughts: A Foundation Framework for Dynamic and Optimized Reasoning based on Chains, Trees, and Graphs

यह शोधपत्र फ्रेमवर्क ऑफ थॉट्स (FoT) को प्रस्तुत करता है, जो एक सामान्य-उद्देश्य वाला फाउंडेशन फ्रेमवर्क है जो हाइपरपैरामीटर ट्यूनिंग, समानांतर प्रसंस्करण (पैरेलल प्रोसेसिंग) और इंटेलिजेंट कैशिंग जैसी अंतर्निहित विशेषताओं के माध्यम से गतिशील, अनुकूलन योग्य और लागत-कुशल निष्पादन सक्षम करके मौजूदा तर्क योजनाओं की स्थिर और गैर-अनुकूलित सीमाओं को दूर करता है।

Felix Fricke, Simon Malberg, Georg Groh2026-07-07
💬 NLP

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

यह शोध पत्र RLHF और RLVR में रिवॉर्ड हैकिंग को कम करने के लिए KL पेनल्टी के एक बेहतर विकल्प के रूप में ग्रेडिएंट रेगुलराइजेशन (GR) का प्रस्ताव करता है, जो रिवॉर्ड सटीकता को इष्टतम सपाटता (optimum flatness) से सैद्धांतिक रूप से जोड़कर और अनुभवजन्य रूप से यह प्रदर्शित करके कि GR प्रभावी रूप से पॉलिसी अपडेट को अधिक सपाट, अधिक सटीक रिवॉर्ड क्षेत्रों की ओर पक्षपाती बनाता है।

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama2026-07-07
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA एक स्लाइडिंग-विंडो KV कैश संपीड़न (compression) विधि है जो द्विदिश अटेंशन (bidirectional attention) और एक लचीले टोकन2चंक (Token2Chunk) मॉड्यूल का उपयोग करके डिकोडिंग के दौरान सूचनात्मक संदर्भ को चुनिंदा रूप से बनाए रखती है, जिससे मौजूदा दृष्टिकोणों की कठोर सीमाओं के बिना रीजनिंग लैंग्वेज मॉडल्स के लिए मेमोरी ओवरहेड को कम करती है और थ्रूपुट में सुधार करती है।

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev2026-07-07
🤖 AI

AutoResearch: An Execution-Grounded Multi-Agent Framework for Reliable Research Workflow Automation

AutoResearch एक निष्पादन-आधारित (execution-grounded) मल्टी-एजेंट फ्रेमवर्क है जो सैंडबॉक्स्ड कोड निष्पादन, पुनरावृत्ति सुधार (iterative repair), और कठोर उद्धरण एवं दावे के सत्यापन को एकीकृत करके जनरेट किए गए वैज्ञानिक आर्टिफैक्ट्स को फ़िल्टर करने और सुधारने के माध्यम से स्वचालित अनुसंधान वर्कफ़्लो की विश्वसनीयता को बढ़ाता है।

Rajesh Kumar, Waqar Ali, Junaid Ahmed, Abdullah Aman Khan, Shaoning Zeng2026-07-07
🤖 AI

SWIFT: Spatio-temporal Wavelet Integrated Forecasting Framework for Workload Traces

SWIFT एक शुद्ध कनवोल्यूशनल फ्रेमवर्क है जो अनुकूलन योग्य फीचर निष्कर्षण के लिए एक लर्नबल कैस्केडेड वेवलेट पाथ और स्थानिक-कालिक निर्भरताओं को मॉडल करने के लिए एक मल्टीवेरिएट इंटरेक्शन मॉड्यूल को पेश करके क्लाउड वर्कलोड पूर्वानुमान की सटीकता और दक्षता को बढ़ाता है, जो रैखिक जटिलता के साथ अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zeyuan Ding, Lingfeng Zheng, Dian Ding, Guangtao Xue2026-07-07