🤖 AI

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

यह शोध पत्र 'वेब्लिका' (Weblica) का परिचय देता है, जो एक ऐसा फ्रेमवर्क है जो स्केलेबल और पुनरुत्पादक (reproducible) वेब वातावरण बनाने के लिए HTTP-स्तरीय कैशिंग और LLM-आधारित संश्लेषण (synthesis) का लाभ उठाता है, जिससे वेब्लिका-8B मॉडल को प्रशिक्षित करना सक्षम होता है जो विजुअल वेब नेविगेशन कार्यों में मौजूदा ओपन-वेट बेसलाइनों से बेहतर प्रदर्शन करता है।

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan2026-05-11
🤖 machine learning

Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache

यह शोधपत्र Louver को प्रस्तुत करता है, जो एक नवीन, हार्डवेयर-अनुकूलित इंडेक्स है जो स्पार्स अटेंशन (sparse attention) को हाफस्पेस रेंज सर्चिंग समस्या के रूप में पुनर्गठित करता है ताकि KV कैश रिट्रीवल में शून्य फॉल्स नेगेटिव (false negatives) की गारंटी दी जा सके, जिससे मौजूदा स्पार्स और डेंस अटेंशन विधियों की तुलना में बेहतर सटीकता और रनटाइम दक्षता प्राप्त की जा सके।

Mohsen Dehghankar, Abolfazl Asudeh2026-05-11
🤖 machine learning

MIND: Monge Inception Distance for Generative Models Evaluation

यह शोध पत्र मोंगे इनसेप्शन डिस्टेंस (MIND) का प्रस्ताव करता है, जो एक जनरेटिव मॉडल मूल्यांकन मीट्रिक है जो मानक फ्रैच इनसेप्शन डिस्टेंस (FID) की तुलना में बेहतर सैंपल दक्षता, गणनात्मक गति और एडवरसेरियल हमलों के विरुद्ध मजबूती प्राप्त करने के लिए स्लाइसड वासरस्टीन डिस्टेंस का लाभ उठाता है।

Quentin Berthet, Yu-Han Wu, Clement Crepy, Romuald Elie, Klaus Greff, Michael Eli Sander2026-05-11
🤖 machine learning

LookWhen? Fast Video Recognition by Learning When, Where, and What to Compute

LookWhen एक कुशल वीडियो रिकग्निशन फ्रेमवर्क है जो केवल सबसे सूचनात्मक टोकन की पहचान करने और उन्हें प्रोसेस करने के लिए एक शैलो सेलेक्टर (shallow selector) का उपयोग करता है, जिससे यह कब, कहाँ और क्या कंप्यूट करना है, यह सीखकर मौजूदा मॉडलों की तुलना में बेहतर सटीकता-कंप्यूटेशन ट्रेड-ऑफ प्राप्त करता है।

Ali Salamatian, Anthony Fuller, Pritam Sarkar, James R. Green, Leonid Sigal, Evan Shelhamer2026-05-11
🤖 machine learning

From Model to Data (M2D): Shifting Complexity from GNNs to Graphs for Transparent Graph Learning

यह शोध पत्र मॉडल-टू-डेटा (M2D) डिस्टिलेशन पेश करता है, जो एक ऐसा ढांचा है जो मॉडल की जटिलता को डेटा स्पेस में स्थानांतरित करके ग्राफ न्यूरल नेटवर्क की पारदर्शिता को बढ़ाता है, जिससे सरल स्टूडेंट मॉडल शिक्षक के प्रदर्शन से मेल खा सकते हैं और साथ ही वास्तुशिल्प लाभों और अंतर्निहित तंत्रों को सीधे निरीक्षण योग्य बनाते हैं।

Debolina Halder Lina, Arlei Silva2026-05-11
🤖 machine learning

A Unified Measure-Theoretic View of Diffusion, Score-Based, and Flow Matching Generative Models

यह शोधपत्र एक एकीकृत माप-सैद्धांतिक (measure-theoretic) ढांचा प्रस्तुत करता है जो यह प्रकट करता है कि डिफ्यूजन मॉडल, स्कोर-आधारित जनरेटिव मॉडल और फ्लो मैचिंग, एक संदर्भ वितरण को डेटा वितरण तक ले जाने के लिए समय-निर्भर वेक्टर क्षेत्रों को सीखने के उदाहरण हैं, जिससे उनकी साझा गणितीय संरचना, व्यावहारिक ट्रेडऑफ़ और सैद्धांतिक संबंधों को स्पष्ट किया जा सके।

Aditya Ranganath, Mukesh Singhal2026-05-11
🤖 machine learning

ProtSent: Protein Sentence Transformers

यह शोध पत्र ProtSent को पेश करता है, जो एक कंट्रास्टिव फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रोटीन लैंग्वेज मॉडल्स को सामान्य-उद्देश्य वाले एम्बेडिंग मॉडल्स में अनुकूलित करता है, जिससे कार्य-विशिष्ट पर्यवेक्षण की आवश्यकता के बिना प्रोटीन कार्य, संरचना और विकास से संबंधित 23 डाउनस्ट्रीम कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dan Ofer, Oriel Perets, Michal Linial, Nadav Rappoport2026-05-11
🤖 machine learning

Why DDIM Hallucinates More than DDPM: A Theoretical Analysis of Reverse Dynamics

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि DDIM की नियत प्रकृति (deterministic nature) इसे गॉसियन मिश्रण लक्ष्यों (Gaussian mixture targets) के बीच फंसने और मतिभ्रम (hallucinate) करने के लिए मजबूर करती है, जबकि DDPM की स्टोकेस्टिसिटी (stochasticity) इसे इन क्षेत्रों से बाहर निकलने में सक्षम बनाती है, एक ऐसा निष्कर्ष जो यह सुझाव देता है कि DDIM की नमूना गुणवत्ता (sampling quality) में सुधार करने के लिए स्टोकेस्टिक चरणों को शामिल किया जा सकता है।

Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos2026-05-11
🤖 machine learning

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

यह शोध पत्र शैडो मास्क डिस्टिलेशन (Shadow Mask Distillation) प्रस्तुत करता है, जो एक नवीन विधि है जिसे सुदृढीकरण अधिगम (Reinforcement Learning) पोस्ट-ट्रेनिंग के दौरान रोलआउट चरण में KV कैश संपीड़न (KV cache compression) लागू करने से होने वाले गंभीर ऑफ-पॉलिसी बायस (off-policy bias) और ग्रेडिएंट वेरिएंस को कम करने के लिए डिज़ाइन किया गया है, जिससे लंबी-संदर्भ तर्क (long-context reasoning) कार्यों के लिए मेमोरी-कुशल संरेखण सक्षम होता है।

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu2026-05-11
🤖 machine learning

Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility

यह शोध पत्र यह तर्क देता है कि जनरेटिव एआई के मजबूत बेंचमार्क प्रदर्शन और इसकी सीमित वास्तविक दुनिया की उपयोगिता के बीच का अंतर त्रुटिपूर्ण मूल्यांकन प्रथाओं से उत्पन्न होता है, और विशिष्ट परिनियोजन संदर्भों के भीतर मानव परिणामों में निरंतर सुधार को मापने की ओर मूल्यांकन को स्थानांतरित करने के लिए SCU-GenEval ढांचे का प्रस्ताव करता है।

Ishani Mondal, Shweta Bhardwaj2026-05-11