🤖 AI

Coordination Graphs for Constrained Multi-Agent Reinforcement Learning

यह शोध पत्र CG-CMARL प्रस्तुत करता है, जो एक ऐसा ढांचा है जो समन्वय ग्राफ (coordination graphs) और लैग्रेंजियन द्वैतता (Lagrangian duality) का लाभ उठाकर बाधाओं वाले मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) समस्याओं को कुशलतापूर्वक हल करने के लिए संयुक्त क्रिया स्थान (joint action space) को युग्मवार अंतःक्रियाओं (pairwise interactions) में विभाजित करता है, जिससे स्केलेबल प्रशिक्षण, व्याख्या योग्य त्रुटि सीमाएं और बिना पुन: प्रशिक्षण के पारेटो-इष्टतम (Pareto-optimal) नीतियों का सृजन सक्षम होता है।

Santiago Amaya-Corredor, Miguel Calvo-Fullana, Anders Jonsson2026-06-02
🤖 machine learning

FOAM: Frequency and Operator Error-Based Adaptive Damping Method for Reducing Staleness-Oriented Error for Shampoo

यह शोध पत्र FOAM प्रस्तुत करता है, जो एक अनुकूली डैम्पिंग विधि (adaptive damping method) है जो शैम्पू ऑप्टिमाइज़र (Shampoo optimizer) में पुराने प्रीकंडीशनर अपडेट (stale preconditioner updates) के कारण होने वाली संख्यात्मक अस्थिरता और प्रदर्शन गिरावट को कम करने के लिए स्टेलनेस-ओरिएंटेड एरर (staleness-oriented error) के आधार पर डैम्पिंग फैक्टर और आइजनडिकंपोजिशन फ्रीक्वेंसी (eigendecomposition frequency) को गतिशील रूप से समायोजित करता है, जिससे मजबूत अभिसरण (robust convergence) बनाए रखते हुए वॉल-क्लॉक ट्रेनिंग समय को कम किया जा सके।

Kyunghun Nam, Sumyeong Ahn2026-06-02
🤖 AI

Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses

हार्नेस-1 (Harness-1) एक 20B सुदृढीकरण लर्निंग-आधारित (reinforcement learning-based) खोज एजेंट है जो मौजूदा ओपन और फ्रंटियर मॉडलों की तुलना में बेहतर रिट्रीवल प्रदर्शन और विविध बेंचमार्क में मजबूत सामान्यीकरण प्राप्त करने के लिए, अर्थपूर्ण निर्णय लेने की क्षमता को बरकरार रखते हुए नियमित स्टेट मैनेजमेंट को एक बाहरी स्टेटफुल हार्नेस पर ऑफलोड करता है।

Pengcheng Jiang, Zhiyi Shi, Kelly Hong, Xueqiang Xu, Jiashuo Sun, Jimeng Sun, Hammad Bashir, Jiawei Han2026-06-02
🤖 AI

Spatial Representation Learning Beyond Pixels: Unifying Raster Data and Vector Semantics for Human-Centric Geospatial Foundation Models

यह परिप्रेक्ष्य पत्र पृथ्वी अवलोकन फाउंडेशन मॉडल्स (Earth Observation Foundation Models) के लिए पृथक रास्टर प्रसंस्करण (isolated raster processing) से एक एकीकृत स्थानिक प्रतिनिधित्व शिक्षण (unified Spatial Representation Learning) ढांचे की ओर एक प्रतिमान परिवर्तन (paradigm shift) का समर्थन करता है, जो अधिक सटीक, व्याख्या योग्य और मानव-केंद्रित भू-स्थानिक समझ प्राप्त करने के लिए निरंतर छवि डेटा को संरचित वेक्टर अर्थशास्त्र (structured vector semantics) के साथ संयुक्त रूप से एकीकृत करता है।

Steffen Knoblauch, Hao Li, Gengchen Mai, Konstantin Klemmer, Song Gao, WenWen Li2026-06-02
🤖 machine learning

When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures

यह शोध पत्र तीन 1B-श्रेणी के भाषा मॉडलों में अटेंशन सर्किट के विकासात्मक प्रक्षेपवक्रों (developmental trajectories) का पता लगाता है, जो यह प्रकट करता है कि इंडक्शन सर्किट और अटेंशन सिंक का निर्माण एक एकल घटना के बजाय अलग-अलग, समयबद्ध रूप से पृथक संक्रमण हैं, और विशिष्ट सर्किट क्षमताओं को अंतिम मॉडल की आवश्यकता के बिना प्रशिक्षण के शुरुआती चरणों में ही पहचाना जा सकता है।

Yongzhong Xu2026-06-02
🧬 biology

AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design

AgentPLM एक एजेंटिक प्रोटीन लैंग्वेज मॉडल पेश करता है जो ऑनलाइन त्रुटि सुधार सक्षम करने और विविध प्रोटीन अनुक्रम डिजाइन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए बाहरी बायोफिजिकल टूल्स और कॉन्ट्रास्टिव एजेंट पॉलिसी ऑप्टिमाइजेशन के साथ रीजनिंग-ऑगमेंटेड डिकोडिंग को जोड़ता है।

Sahil Rahman, Maxx Richard Rahman2026-06-02
⚛️ quantum physics

Evolutionary Discovery of Bivariate Bicycle Codes with LLM-Guided Search

यह शोध पत्र एक LLM-निर्देशित विकासवादी वर्कफ़्लो प्रस्तुत करता है जो पायथन प्रोग्रामों को उत्परिवर्तित करके और एक बहु-चरणीय पाइपलाइन के माध्यम से उम्मीदवारों को कड़ाई से मान्य करके नए उच्च-प्रदर्शन वाले द्विवari-बाइसाइकल क्वांटम LDPC कोडों की सफलतापूर्वक खोज करता है, जिससे 465 विशिष्ट कोड प्राप्त होते हैं जिनमें अपघटनीय (indecomposable) और उच्च-दूरी वाले वेरिएंट शामिल हैं।

Juan Cruz-Benito, Andrew W. Cross, David Kremer, Ismael Faro2026-06-02
💬 NLP

ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning

यह शोध पत्र ODTQA-FoRe को प्रस्तुत करता है, जो रियल एस्टेट डेटा का उपयोग करके भविष्य के डेटा पूर्वानुमान और तर्क पर केंद्रित पहला ओपन-डोमेन टेबुलर क्वेश्चन अनस्वर्सिंग डेटासेट है, साथ ही इसमें TimeFore भी शामिल है, जो एक LLM एजेंट फ्रेमवर्क है जो भविष्य-उन्मुख संख्यात्मक भविष्यवाणियों को संभालने में वर्तमान मॉडलों की सीमाओं को दूर करने के लिए डेटा रिट्रीवल, बाहरी टाइम-सीरीज फोरकास्टिंग और विश्लेषणात्मक संश्लेषण को एकीकृत करता है।

Zhensheng Wang, Xiaole Liu, Wenmian Yang, Kun Zhou, Yiquan Zhang, Weijia Jia2026-06-02
🤖 AI

Bridging the Sim-to-Real Gap in Semiconductor Visual Program Synthesis via Input Binarization

यह शोध पत्र एक विजुअल प्रोग्राम सिंथेसिस फ्रेमवर्क प्रस्तावित करता है जो बाइनराइज्ड SEM छवियों को संपादन योग्य DSL कोड में बदलने के लिए एक विजन-लैंग्वेज मॉडल का उपयोग करके सेमीकंडक्टर निरीक्षण में सिम-टू-रियल गैप को पाटता है, जिससे प्रशिक्षण डेटा पीढ़ी के लिए सटीक ज्यामितीय नियंत्रण सक्षम होता है और वास्तविक दुनिया के डेटासेट पर सेगमेंटेशन सटीकता में महत्वपूर्ण सुधार होता है।

Yusuke Ohtsubo, Kota Dohi, Koichiro Yawata, Koki Takeshita, Tatsuya Sasaki2026-06-02
💬 NLP

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

यह शोध पत्र PaSBench-Video प्रस्तुत करता है, जो एक स्ट्रीमिंग वीडियो बेंचमार्क है और यह दर्शाता है कि वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स समय पर और सटीक प्रोएक्टिव सुरक्षा चेतावनियाँ प्रदान करने में विफल रहते हैं, क्योंकि उन्हें अत्यधिक फॉल्स पॉजिटिव्स को ट्रिगर किए बिना उभरते जोखिमों को सुरक्षित दृश्यों से अलग करने में कठिनाई होती है।

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He2026-06-02