🤖 machine learning

Generative Modeling with Flux Matching

यह शोध पत्र फ्लक्स मैचिंग (Flux Matching) का परिचय देता है, जो एक नवीन जनरेटिव मॉडलिंग प्रतिमान है जो कंजर्वेटिव वेक्टर फील्ड्स की आवश्यकता को शिथिल करके स्कोर-आधारित मॉडलों का सामान्यीकरण करता है, जिससे इंडक्टिव बायस (inductive biases) को शामिल करने में अधिक लचीलापन और तेज़ सैंपलिंग एवं व्याख्या योग्य डायनेमिक्स जैसे अनुप्रयोगों को सक्षम बनाया जा सके।

Peter Pao-Huang, Xiaojie Qiu, Stefano Ermon2026-05-11
🤖 machine learning

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

यह शोध पत्र "Mage" को पेश करता है, जो एक बहु-अक्षीय मूल्यांकन प्रोटोकॉल है जो यह प्रकट करता है कि LLM-जनित गेम दृश्यों के लिए कंपाइल-पास दरें भ्रामक हैं, यह प्रदर्शित करते हुए कि जबकि प्रत्यक्ष प्राकृतिक भाषा-से-कोड पीढ़ी उच्च रनटाइम सफलता प्रदान करती है, कार्यात्मक रूप से निष्ठावान और डोमेन-अनुपालन योग्य निष्पादन योग्य आर्टिफैक्ट्स उत्पन्न करने के लिए इनपुट को मध्यवर्ती निरूपणों पर संरचनात्मक रूप से अनुकूलित करना आवश्यक है।

Hugh Xuechen Liu, Kıvanç Tatar2026-05-11
🤖 AI

Confidence-Aware Alignment Makes Reasoning LLMs More Reliable

यह शोध पत्र CASPO को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन के माध्यम से टोकन-स्तरीय आत्मविश्वास को तार्किक शुद्धता के साथ संरेखित करके और कॉन्फिडेंस-अवेयर थॉट (CaT) तंत्र के माध्यम से अनिश्चित रीजनिंग शाखाओं की गतिशील छंटाई को सक्षम करके बड़े रीजनिंग मॉडलों की विश्वसनीयता और दक्षता को बढ़ाता है।

Kejia Chen, Jiawen Zhang, Yihong Wu, Kewei Gao, Jian Lou, Zunlei Feng, Mingli Song, Ruoxi Jia2026-05-11
🤖 machine learning

MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference

यह शोध पत्र MISA का प्रस्ताव करता है, जो एक मिक्सचर-ऑफ-एक्सपर्ट्स दृष्टिकोण है जो DeepSeek Sparse Attention में गणनात्मक रूप से महंगे मल्टी-हेड इंडेक्सर को एक हल्के राउटर से बदल देता है ताकि प्रति क्वेरी केवल कुछ ही हेड्स को सक्रिय किया जा सके, जिससे लंबी-संदर्भ (long-context) वाली कार्यों पर मूल पद्धति के तुलनीय सटीकता प्राप्त करते हुए इन्फरेंस लेटेंसी और मेमोरी लागत को काफी कम किया जा सके।

Ruijie Zhou, Fanxu Meng, Yufei Xu, Tongxuan Liu, Guangming Lu, Muhan Zhang, Wenjie Pei2026-05-11
🤖 AI

RELO: Reinforcement Learning to Localize for Visual Object Tracking

यह शोध पत्र RELO को प्रस्तुत करता है, जो एक विज़ुअल ऑब्जेक्ट ट्रैकिंग विधि है जो हस्तनिर्मित स्थानिक पूर्वग्रहों (handcrafted spatial priors) को IoU और AUC जैसे प्रत्यक्ष मेट्रिक्स के लिए अनुकूलित एक सुदृढीकरण लर्निंग-आधारित स्थानीयकरण नीति से बदल देती है, जबकि अत्याधुनिक प्रदर्शन प्राप्त करने के लिए लेयर-अलाइन्ड टेम्पोरल टोकन प्रोपेगेशन को शामिल करती है।

Xin Chen, Chuanyu Sun, Jiao Xu, Houwen Peng, Dong Wang, Huchuan Lu, Kede Ma2026-05-11
🤖 AI

Escaping the Diversity Trap in Robotic Manipulation via Anchor-Centric Adaptation

यह शोध पत्र सख्त डेटा बजट के तहत विजन-लैंग्वेज-एक्शन मॉडल्स को अनुकूलित करने में एक "विविधता जाल" (diversity trap) की पहचान करता है, एक "कवरेज-डेंसिटी ट्रेड-ऑफ" (Coverage-Density Trade-off) ढांचे का प्रस्ताव करता है, और एंकर-सेंट्रिक अडैप्टेशन (ACA) पेश करता है—जो एक दो-चरणीय विधि है जो सीमाओं तक विस्तार करने से पहले मुख्य एंकर्स पर बार-बार होने वाले प्रदर्शनों को प्राथमिकता देती है—ताकि मानक विविध सैंपलिंग रणनीतियों की तुलना में रोबोटिक कार्य विश्वसनीयता में उल्लेखनीय सुधार किया जा सके।

Yanzhe Chen, Kevin Yuchen Ma, Qi Lv, Yiqi Lin, Zechen Bai, Chen Gao, Mike Zheng Shou2026-05-11
🤖 AI

Offline Policy Optimization with Posterior Sampling

यह शोध पत्र पोस्टीरियर सैंपलिंग-आधारित पॉलिसी ऑप्टिमाइज़ेशन (PSPO) को प्रस्तुत करता है, जो एक मॉडल-आधारित ऑफलाइन रीइन्फोर्समेंट लर्निंग पद्धति है जो आउट-ऑफ-डिस्ट्रीब्यूशन डायनेमिक्स का प्रभावी ढंग से उपयोग करते हुए मॉडल एक्सप्लॉइटेशन को रोकने और सामान्यीकरण एवं मजबूती के बीच संतुलन बनाने के लिए बायेसियन इन्फरेंस और कंस्ट्रेंड ऑप्टिमाइज़ेशन का लाभ उठाता है।

Hongqiang Lin, Dongxu Zhang, Yiding Sun, Mingzhe Li, Ning Yang, Haijun Zhang2026-05-11
💬 NLP

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

यह अनुभवजन्य अध्ययन प्रकट करता है कि मल्टी-एलएलएम (multi-LLM) रूटिंग में रिपोर्ट की गई "असमाधान सीमाएं" (unsolvability ceilings) काफी हद तक जज पूर्वाग्रह और ट्रंकेशन (truncation) जैसे मूल्यांकन आर्टिफैक्ट्स द्वारा बढ़ा दी गई हैं, जो राउटर प्रशिक्षण संकेतों को विकृत करते हैं और महत्वपूर्ण अवसर लागतों (opportunity costs) की ओर ले जाते हैं, जिससे लागत-गुणवत्ता व्यापार-ऑफ (cost-quality tradeoffs) का सटीक आकलन करने के लिए अधिक विश्वसनीय मूल्यांकन प्रोटोकॉल आवश्यक हो जाते हैं।

Saloni Garg, Amit Sagtani2026-05-11
🤖 AI

Exposing and Mitigating Temporal Attack in Deepfake Video Detection

यह शोध पत्र SpInShield प्रस्तुत करता है, जो एक ऐसा रक्षा ढांचा (defense framework) है जो एक सीखने योग्य स्पेक्ट्रल एडवर्सरी (learnable spectral adversary) और शॉर्टकट सप्रेशन ऑप्टिमाइज़ेशन (shortcut suppression optimization) के माध्यम से सिमेंटिक मोशन को स्पेक्ट्रल आर्टिफैक्ट्स से अलग करके डीपफेक डिटेक्टरों में टेम्पोरल अटैक कमजोरियों को कम करता है, जिससे स्पेक्ट्रल विरूपण (spectral deformations) के विरुद्ध मजबूती में महत्वपूर्ण सुधार होता है।

Zheyuan Gu, Minghao Shao, Zhen Wang, Yusong Wang, Mingkun Xu, Shijie Zhang, Hao Jiang2026-05-11
🤖 AI

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

यह शोध पत्र OrchJail को प्रस्तुत करता है, जो एक ऑर्केस्ट्रेशन-निर्देशित फज़िंग फ्रेमवर्क है जो पारंपरिक प्रॉम्प्ट-ओनली गड़बड़ी पर निर्भर रहने के बजाय उच्च-जोखिम वाले मल्टी-स्टेप टूल ऑर्केस्ट्रेशन पैटर्न का फायदा उठाकर टूल-कॉलिंग टेक्स्ट-टू-इमेज एजेंटों को प्रभावी ढंग से जेलब्रेक करता है।

Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu2026-05-11