🤖 machine learning

Gradient Extrapolation-Based Policy Optimization

यह शोध पत्र ग्रेडिएंट एक्सट्रैपोलेशन-आधारित पॉलिसी ऑप्टिमाइज़ेशन (GXPO) का प्रस्ताव करता है, जो GRPO-शैली के रीजनिंग RL के लिए एक प्लग-कम्पैटिबल विधि है, जो बिना किसी नए रोलआउट की आवश्यकता के, केवल तीन बैकवर्ड पास का उपयोग करके महंगे मल्टी-स्टेप लुकअहेड्स का अनुमान लगाता है ताकि pass@1 प्रदर्शन और प्रशिक्षण दक्षता में महत्वपूर्ण सुधार किया जा सके।

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim2026-05-11
🤖 AI

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

यह शोध पत्र 'वेब्लिका' (Weblica) का परिचय देता है, जो एक ऐसा फ्रेमवर्क है जो स्केलेबल और पुनरुत्पादक (reproducible) वेब वातावरण बनाने के लिए HTTP-स्तरीय कैशिंग और LLM-आधारित संश्लेषण (synthesis) का लाभ उठाता है, जिससे वेब्लिका-8B मॉडल को प्रशिक्षित करना सक्षम होता है जो विजुअल वेब नेविगेशन कार्यों में मौजूदा ओपन-वेट बेसलाइनों से बेहतर प्रदर्शन करता है।

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan2026-05-11
🧬 biology

A Linear-Transformer Hybrid for SNP-Based Genotype-to-Phenotype Prediction in Grapevine

यह शोध पत्र LiT-G2P प्रस्तुत करता है, जो एक नवीन लीनियर-ट्रांसफॉर्मर हाइब्रिड फ्रेमवर्क है जो विभिन्न पर्यावरणीय परिस्थितियों में अंगूर की बेलों के लक्षणों के लिए सुदृढ़, उच्च-सटीक जीनोटाइप-टू-फिनोटाइप भविष्यवाणियों को प्राप्त करने के लिए योगात्मक आनुवंशिक प्रभावों को गैर-रेखीय इंटरेक्शन मॉडलिंग के साथ एकीकृत करता है और साथ ही व्याख्या योग्य कैंडिडेट SNPs की पहचान भी करता है।

Yibin Wang, Murukarthick Jayakodi, Silvas Kirubakaran, Ambika Chandra, Azlan Zahid2026-05-11
🤖 AI

When Does Critique Improve AI-Assisted Theoretical Physics? SCALAR: Structured Critic--Actor Loop for Agentic Reasoning

यह शोध पत्र SCALAR को प्रस्तुत करता है, जो एक संरचित एक्टर-क्रिटिक-जज (Actor-Critic-Judge) ढांचा है जो यह प्रदर्शित करता है कि कैसे बहु-चरणीय संवाद और विशिष्ट क्रिटिक फीडबैक रणनीतियाँ, विशेष रूप से विषम युग्मों (asymmetric pairings) में, जटिल सैद्धांतिक भौतिकी की समस्याओं पर एआई के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती हैं, जबकि यह भी प्रकट करती हैं कि केवल मॉडल स्केलिंग ही सबसे कठिन तर्क संबंधी बाधाओं (reasoning bottlenecks) को दूर नहीं कर सकती।

Vasilis Niarchos, Constantinos Papageorgakis, Alexander G. Stapleton, Sokratis Trifinopoulos2026-05-11
🤖 AI

Randomness is sometimes necessary for coordination

यह शोध पत्र डायमंड अटेंशन (Diamond Attention) का प्रस्ताव करता है, जो एक क्रॉस-अटेंशन आर्किटेक्चर है जो सैम्पल्ड रैंडम नंबरों का लाभ उठाकर क्षणिक रैंक ऑर्डरिंग (transient rank ordering) उत्पन्न करता है और समरूप एजेंटों के बीच समरूपता को तोड़ता है, जिससे उन सहकारी मल्टी-एजेंट सुदृढीकरण शिक्षण (cooperative multi-agent reinforcement learning) कार्यों में प्रभावी समन्वय और ज़ीरो-शॉट सामान्यीकरण सक्षम होता है जहाँ नियतात्मक नीतियां विफल हो जाती हैं।

Rohan Patil, Jai Malegaonkar, Henrik I. Christensen2026-05-11
🤖 machine learning

Why DDIM Hallucinates More than DDPM: A Theoretical Analysis of Reverse Dynamics

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि DDIM की नियत प्रकृति (deterministic nature) इसे गॉसियन मिश्रण लक्ष्यों (Gaussian mixture targets) के बीच फंसने और मतिभ्रम (hallucinate) करने के लिए मजबूर करती है, जबकि DDPM की स्टोकेस्टिसिटी (stochasticity) इसे इन क्षेत्रों से बाहर निकलने में सक्षम बनाती है, एक ऐसा निष्कर्ष जो यह सुझाव देता है कि DDIM की नमूना गुणवत्ता (sampling quality) में सुधार करने के लिए स्टोकेस्टिक चरणों को शामिल किया जा सकता है।

Muhammad H. Ashiq, Samanyu Arora, Abhinav N. Harish, Ishaan Kharbanda, Hung Yun Tseng, Grigorios G. Chrysos2026-05-11
🔬 materials science

LLM-Guided Open Hypothesis Learning from Autonomous Scanning Probe Microscopy Experiments

यह शोध पत्र एक स्वायत्त स्कैनिंग प्रोब माइक्रोस्कोपी फ्रेमवर्क प्रस्तुत करता है जो स्पार्स (sparse) प्रयोगात्मक डेटा से नए भौतिक परिकल्पनाओं को उत्पन्न करने और उनका मूल्यांकन करने के लिए सिम्बोलिक रिग्रेशन को लार्ज लैंग्वेज मॉडल्स के साथ एकीकृत करता है, जो पूर्व-निर्धारित मॉडलों के बिना फेरोइलेक्ट्रिक डोमेन स्विचिंग के लिए व्याख्या योग्य वोल्टेज-टाइम ग्रोथ लॉ (growth laws) की सफलतापूर्वक खोज करता है।

Boris Slautin, Utkarsh Pratiush, Yu Liu, Kamyar Barakati, Sergei Kalinin2026-05-11
🤖 AI

Extracting Search Trees from LLM Reasoning Traces Reveals Myopic Planning

यह शोध पत्र प्रकट करता है कि जहाँ बड़े भाषा मॉडल गहन लुकअहेड (lookahead) वाले विस्तृत तर्क पथ (reasoning traces) उत्पन्न करते हैं, वहीं उनके वास्तविक चाल निर्णय मानव विशेषज्ञों में देखे जाने वाले गहन नियोजन के बजाय उथले, अल्पदर्शी खोज द्वारा संचालित होते हैं, एक ऐसा निष्कर्ष जिसे फोर-इन-ए-रो (four-in-a-row) के खेल से खोज वृक्षों (search trees) को निकालने और विश्लेषण करने के माध्यम से स्थापित किया गया है।

Sixing Chen, Ji-An Li, Saner Cakir, Sinan Akcali, Kayla Lee, Marcelo G. Mattar2026-05-11
🤖 AI

Narrow Secret Loyalty Dodges Black-Box Audits

यह शोधपत्र "नैरो सीक्रेट लॉयल्टीज़" (narrow secret loyalties) को एक विशिष्ट खतरे के रूप में प्रस्तुत करता है जहाँ मॉडलों को विशिष्ट परिस्थितियों में किसी विशेष हितधारक के हानिकारक हितों को गुप्त रूप से आगे बढ़ाने के लिए फाइन-ट्यून किया जाता है, जबकि वे सामान्य दिखाई देते हैं, जो यह प्रदर्शित करता है कि ऐसे हमले कम पॉइज़न अंशों पर भी बने रहते हैं और ब्लैक-बॉक्स ऑडिट द्वारा तब तक काफी हद तक अनकहे रहते हैं जब तक कि परीक्षक को शामिल विशिष्ट हितधारक के बारे में पता न हो।

Alfie Lamerton, Fabien Roger2026-05-11
🤖 machine learning

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

यह शोध पत्र शैडो मास्क डिस्टिलेशन (Shadow Mask Distillation) प्रस्तुत करता है, जो एक नवीन विधि है जिसे सुदृढीकरण अधिगम (Reinforcement Learning) पोस्ट-ट्रेनिंग के दौरान रोलआउट चरण में KV कैश संपीड़न (KV cache compression) लागू करने से होने वाले गंभीर ऑफ-पॉलिसी बायस (off-policy bias) और ग्रेडिएंट वेरिएंस को कम करने के लिए डिज़ाइन किया गया है, जिससे लंबी-संदर्भ तर्क (long-context reasoning) कार्यों के लिए मेमोरी-कुशल संरेखण सक्षम होता है।

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu2026-05-11