🤖 machine learning

Turning Stale Gradients into Stable Gradients: Coherent Coordinate Descent with Implicit Landscape Smoothing for Lightweight Zeroth-Order Optimization

यह शोध पत्र कोहेरेंट कोऑर्डिनेट डिसेंट (CoCD) को प्रस्तुत करता है, जो एक नियतात्मक ज़ीरो-ऑर्डर ऑप्टिमाइज़र है जो वॉर्म-स्टार्टेड ब्लॉक साइक्लिक कोऑर्डिनेट डिसेंट और इमप्लिसिट लैंडस्केप स्मूथिंग के माध्यम से पुराने (stale) ग्रेडिएंट्स को स्थिर अपडेट दिशाओं में परिवर्तित करता है, जिससे मौजूदा रैंडमाइज्ड विधियों की तुलना में बेहतर सैंपल दक्षता और अभिसरण स्थिरता (convergence stability) प्राप्त होती है।

Chen Liang, Xiatao Sun, Qian Wang, Daniel Rakita2026-05-15
🤖 machine learning

Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games

यह शोध पत्र डेटा-ऑगमेंटेड गेम स्टार्ट्स (DAGS) को प्रस्तुत करता है, जो एक ऐसी विधि है जो ऑफलाइन मानव प्रदर्शनों (human demonstrations) से सुदृढीकरण शिक्षण (reinforcement learning) को आरंभ करके बड़े पैमाने के अपूर्ण-सूचना वाले खेलों (imperfect-information games) में अन्वेषण (exploration) को त्वरित करती है, जिससे निश्चित कम्प्यूटेशनल बजट के तहत कम एक्सप्लोइटेबिलिटी (exploitability) प्राप्त होती है और संभावित इक्विलिब्रियम पूर्वाग्रहों (equilibrium biases) का समाधान प्रदान किया जाता है।

JB Lanier, Nathan Monette, Pierre Baldi, Roy Fox2026-05-15
💻 computer science

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

डार्विन फैमिली फ्रेमवर्क एक प्रशिक्षण-मुक्त विकासवादी विलय दृष्टिकोण पेश करता है जो बिना किसी अतिरिक्त ग्रेडिएंट-आधारित प्रशिक्षण के बड़े भाषा मॉडलों की तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाने के लिए ग्रेडिएंट-मुक्त वेट-स्पेस पुनर्संयोजन, अनुकूली ट्रस्ट-आधारित संलयन और क्रॉस-आर्किटेक्चर ब्रीडिंग का उपयोग करता है।

Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim2026-05-15
💬 NLP

Nexus : An Agentic Framework for Time Series Forecasting

यह शोध पत्र नेक्सस (Nexus) का परिचय देता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो समय श्रृंखला पूर्वानुमान (time series forecasting) को विशिष्ट चरणों में विभाजित करता है ताकि असंरचित प्रासंगिक डेटा (unstructured contextual data) को संख्यात्मक पैटर्न के साथ प्रभावी ढंग से एकीकृत किया जा सके, जिससे वर्तमान एलएलएम (LLMs) पारदर्शी तर्क संबंधी निशान (reasoning traces) प्रदान करते हुए अत्याधुनिक मॉडलों के बराबर या उनसे बेहतर प्रदर्शन करने में सक्षम होते हैं।

Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar, Nanyun Peng, Vishy Tirumalashetty, Chun-Liang Li, Rui Zhang, Jin (…)2026-05-15
💻 computer science

Coding Agent Is Good As World Simulator

यह शोध पत्र एक एजेंटिक फ्रेमवर्क प्रस्तुत करता है जो समन्वित योजना, कोडिंग, दृश्य समीक्षा और भौतिक विश्लेषण के माध्यम से निष्पादन योग्य सिमुलेशन कोड को पुनरावृत्ति रूप से उत्पन्न और परिष्कृत करके भौतिक रूप से प्रशंसनीय विश्व मॉडल (world models) का निर्माण करता है, जो भौतिक सटीकता, निर्देश निष्ठा और दृश्य गुणवत्ता में वीडियो-आधारित दृष्टिकोणों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Hongyu Wang, Jingquan Wang, Bocheng Zou, Radu Serban, Dan Negrut2026-05-15
💻 computer science

Metis AI: The Overlooked Middle Zone Between AI-Native and World-Movers

यह शोध पत्र तर्क देता है कि एआई क्षमता में सबसे महत्वपूर्ण सीमा डिजिटल और भौतिक कार्यों के बीच नहीं, बल्कि डिजिटल कार्यों के भीतर स्वयं निहित है, जो "मेटिस एआई" (Metis AI) चुनौतियों की एक श्रेणी की पहचान करती है जो सामाजिक और मानदण्डिक जटिलताओं द्वारा परिभाषित होती हैं जो स्वचालन का विरोध करती हैं और विशुद्ध रूप से एल्गोरिद्मिक समाधानों के बजाय मानव-नेतृत्व वाले "सेंटॉर" (centaur) आर्किटेक्चर की आवश्यकता को अनिवार्य बनाती हैं।

Xiang Li2026-05-15
🤖 machine learning

MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse

यह शोध पत्र MahaVar को प्रस्तुत करता है, जो एक पोस्ट-हॉक आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन विधि है जो इस सैद्धांतिक रूप से पुष्ट अवलोकन का लाभ उठाती है कि न्यूरल कोलैप्स ज्योमेट्री के कारण इन-डिस्ट्रीब्यूशन नमूनों में उच्च क्लास-वाइज महलानोबिस डिस्टेंस वेरिएंस होता है, जिससे यह मानक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Donghwan Kim, Hyunsoo Yoon2026-05-15
💻 computer science

A Unified Knowledge Embedded Reinforcement Learning-based Framework for Generalized Capacitated Vehicle Routing Problems

यह शोध पत्र एक एकीकृत ज्ञान-अंतर्निहित सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो एक रचनात्मक सॉल्वर (constructive solver) को निर्देशित करने के लिए 'रूट-फर्स्ट क्लस्टर-सेकंड' ह्यूरिस्टिक्स और डायनेमिक प्रोग्रामिंग को एकीकृत करता है, जिससे अत्याधुनिक शिक्षण-आधारित विधियों की तुलना में विविध क्षमतायुक्त वाहन मार्ग निर्धारण समस्या (Capacitated Vehicle Routing Problem) वेरिएंट्स में बेहतर समाधान गुणवत्ता और सामान्यीकरण प्राप्त होता है।

Wen Wang, Xiangchen Wu, Liang Wang, Hao Hu, Xianping Tao2026-05-15
💻 computer science

The Great Pretender: A Stochasticity Problem in LLM Jailbreak

यह शोध पत्र प्रकट करता है कि LLM जेलब्रेक्स में अटैक सक्सेस रेट (ASR) की अस्थिरता मूल्यांकन और जनरेशन दोनों के दौरान स्टोकेस्टिसिटी (stochasticity) से उत्पन्न होती है, जिससे मेट्रिक्स व्यवस्थित रूप से बढ़ जाते हैं, और इस विचलन को सटीक रूप से मापने तथा प्रदर्शन हानि को पुनः प्राप्त करने के लिए CAS-eval और CAS-gen फ्रेमवर्क प्रस्तावित करता है।

Jean-Philippe Monteuuis, Cong Chen, Jonathan Petit2026-05-15
💻 computer science

MemLineage: Lineage-Guided Enforcement for LLM Agent Memory

MemLineage एक क्रिप्टोग्राफिक रक्षा प्रणाली है जो LLM एजेंटों के लिए बनाई गई है जो मेमोरी प्रविष्टि (memory entry) के उद्भव और व्युत्पन्न वंश (provenance and derivation lineage) को ट्रैक करके मेमोरी पॉइजनिंग हमलों को रोकती है, यह सुनिश्चित करती है कि संवेदनशील कार्यों को केवल तभी अधिकृत किया जाए जब उनका औचित्य किसी अविश्वसनीय स्रोतों से न निकला हो।

Ciyan Ouyang, Rui Hou2026-05-15