🤖 machine learning

Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

यह शोध पत्र युग्मवार प्राथमिकताओं (pairwise preferences) वाले सुदृढीकरण अधिगम (reinforcement learning) के लिए एक नए ढांचे के रूप में मार्कोव निर्णय प्रतियोगिता (Markov decision contest) को प्रस्तुत करता है, जो यह सिद्ध करता है कि स्थिर मार्कोव नीतियां (stationary Markov policies) इष्टतम हैं और यह प्रदर्शित करता है कि एक सरल पुनरावृत्ति एल्गोरिदम पूर्व विधियों की तुलना में दीर्घ-क्षितिज (long-horizon), उच्च-आयामी समस्याओं में बेहतर शिक्षण दक्षता प्राप्त करता है।

Jonathan Colaço Carr, Prakash Panangaden, Doina Precup, Benjamin Van Roy2026-06-02
🤖 AI

Agentic Authoring of Interactive Multiview Visualizations in Genomics

यह शोध पत्र इंटरैक्टिव मल्टीव्यू जीनोमिक्स विज़ुअलाइज़ेशन तैयार करने के लिए एजेंटिक एलएलएम (LLM) दृष्टिकोणों की जांच करता है, जिसमें यह पाया गया कि इटरेटिव एजेंट-आधारित स्कीमें डायरेक्ट जनरेशन और फिक्स्ड पाइपलाइनों की तुलना में आउटपुट की गुणवत्ता में महत्वपूर्ण सुधार करती हैं, जबकि अधिक जटिल मल्टी-एजेंट आर्किटेक्चर कोई अतिरिक्त लाभ प्रदान नहीं करते हैं।

Astrid van den Brandt, Kiroong Choe, Sehi L'Yi, Devin Lange, Nils Gehlenborg2026-06-02
🤖 AI

The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary

यह शोध पत्र प्रदर्शित करता है कि डिकोडर-ओनली (decoder-only) LLMs एक आर्किटेक्चरल "डिटरमिनिस्टिक होराइजन" (लगभग 19-31 चरण) का सामना करते हैं जहाँ सूचना-सैद्धांतिक अटेंशन बॉटलनैक्स (information-theoretic attention bottlenecks) के कारण विस्तारित चेन-ऑफ-थॉट (chain-of-thought) तर्क विफल हो जाता है, जिससे डिटरमिनिस्टिक स्टेट-ट्रैकिंग कार्यों पर उच्च सटीकता प्राप्त करने के लिए टूल-डेलीगेटेड हाइब्रिड दृष्टिकोणों की ओर बदलाव आवश्यक हो जाता है।

Dongxin Guo, Jikun Wu, Siu Ming Yiu2026-06-02
🤖 AI

SUPREME: A Multi-GPU Framework for Reproducible Image Unlearning Method Evaluation

यह शोध पत्र SUPREME को प्रस्तुत करता है, जो एक ओपन-सोर्स, मल्टी-जीपीयू फ्रेमवर्क है जिसे कई एक्सीलरेटरों के बीच गणनात्मक रूप से महंगे प्रशिक्षण और परीक्षण चरणों को वितरित करके इमेज अनलर्निंग विधियों के पुनरुत्पादक मूल्यांकन को त्वरित और मानकीकृत करने के लिए डिज़ाइन किया गया है।

Petros Andreou, Jamie Lanyon, Axel Finke, Georgina Cosma2026-06-02
🤖 AI

VESTA: Visual Exploration with Statistical Tool Agents

यह शोध पत्र VESTA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विजन-लैंग्वेज मॉडल्स को डेटा ट्रांसफॉर्मेशन और डायग्नोस्टिक विज़ुअलाइज़ेशन के गतिशील रूप से बढ़ते टूलकिट से सुसज्जित करके सांख्यिकीय मॉडलिंग को बढ़ाता है, जो नए DAWN बेंचमार्क में पाए जाने वाले जटिल कार्यों पर मौजूदा एजेंट-आधारित प्रणालियों से काफी बेहतर प्रदर्शन करता है।

William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Gre (…)2026-06-02
🤖 AI

Zamba2-VL Technical Report

Zamba2-VL एक हाइब्रिड Zamba2 आर्किटेक्चर पर निर्मित कुशल विजन-लैंग्वेज मॉडल्स का एक सुइट है जो अग्रणी ओपन-वेट VLMs के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए Mamba2 स्टेट-स्पेस लेयर्स को ट्रांसफार्मर ब्लॉक्स के साथ जोड़ता है, जबकि विशेष रूप से एज डिप्लॉयमेंट के अनुकूल छोटे स्तरों पर काफी तेज़ टाइम-टू-फर्स्ट-टोकन प्रदान करता है।

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge2026-06-02
📊 statistics

A Distribution-Free Framework for Rewrite-Based Human-text Detection via Knockoff Filtering

यह शोध पत्र एक वितरण-मुक्त (distribution-free) ढांचे को प्रस्तुत करता है जो 'नॉकऑफ फ़िल्टरिंग' का लाभ उठाकर किसी भी रीराइट-आधारित डिटेक्टरों को बिना मॉडल पुन: प्रशिक्षित किए, LLM-जनित टेक्स्ट की पहचान करने के लिए परिमित-नमूना फॉल्स डिस्कवरी रेट (finite-sample false discovery rate) गारंटी वाले उपकरणों में परिवर्तित करता है।

Yi Liu2026-06-02
🤖 AI

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

यह शोध पत्र "वीक-क्रिटिक स्ट्रॉन्ग ओवरसाइट" (weak-critic strong oversight) प्रस्तुत करता है, जो एक ऐसा ढांचा है जहाँ एक कमजोर मॉडल अंतिम निर्णय देने के बजाय गैर-भ्रामक संशोधन दिशाएँ प्रदान करके एक मजबूत मॉडल को निर्देशित करने के लिए एक आलोचक (critic) के रूप में कार्य करता है, और स्केलेबल ओवरसाइट के लिए इन आलोचनाओं को प्रभावी ढंग से मजबूत मॉडल में डिस्टिल करने के लिए प्रोग्रेसिव ऑन-पॉलिसी क्रिटीक डिस्टिलेशन (OPCD) का प्रस्ताव करता है।

Can Jin, Jiakang Li, Rui Wu, Eddy Zhang, Dimitris N. Metaxas2026-06-02
🤖 machine learning

Finer Parameter Steps for Low-Rank PEFT: A Controlled Study with CP Tensor Adapters

यह शोध पत्र इस बात की जांच करता है कि क्या CP टेंसर एडेप्टर, जो पारंपरिक LoRA की तुलना में काफी सूक्ष्म पैरामीटर बजट वृद्धि प्रदान करते हैं, लो-रैंक PEFT में सटीकता-बजट ट्रेड-ऑफ में सुधार करते हैं, यह पाते हुए कि हालांकि वे स्थिर प्रशिक्षण और बेहतर बजट संवेदनशीलता निदान को सक्षम करते हैं, उनके प्रदर्शन लाभ कार्य-निर्भर हैं और वे सार्वभौमिक रूप से LoRA से बेहतर नहीं होते हैं।

Xinjue Wang, Xiuheng Wang, Yejun Zhang, Sergiy A. Vorobyov, Esa Ollila, Zhi-Yong Wang2026-06-02
🤖 AI

Detect Before You Leap: Mirage Detection in Vision-Language Models

यह शोध पत्र TC-LIA को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) एन्सेम्बल विधि है जो नेटवर्क परतों के माध्यम से इमेज पैच टोकन और टेक्स्ट क्वेरी के बीच संरेखण का विश्लेषण करके विजन-लैंग्वेज मॉडल्स में "मिराज" (mirage) मतिभ्रम (hallucinations) का पता लगाता है, जिससे उच्च पहचान सटीकता प्राप्त होती है और विविध डोमेन एवं मॉडल बैकबोन में अनग्राउंडेड प्रतिक्रियाओं को काफी कम किया जाता है।

Sayeed Shafayet Chowdhury, Md. Shaown Miah2026-06-02