🤖 machine learning

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

यह शोधपत्र MTG-Causal-RL प्रस्तुत करता है, जो मैजिक: द गैदरिंग (Magic: The Gathering) पर आधारित एक नया जिमनीम (Gymnasium) बेंचमार्क है जो बड़े मास्क किए गए एक्शन स्पेस वाले जटिल, आंशिक रूप से दृश्यमान वातावरणों में कॉज़ल क्रेडिट असाइनमेंट (causal credit assignment), स्ट्रक्चरल ट्रांसफर (structural transfer) और पॉलिसी ऑडिटेबिलिटी (policy auditability) के कठोर मूल्यांकन को सक्षम करने के लिए एक हस्त-निर्दिष्ट स्ट्रक्चरल कॉज़ल मॉडल को एकीकृत करता है।

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu2026-05-08
🤖 machine learning

Normalized Architectures are Natively 4-Bit

यह शोध पत्र प्रदर्शित करता है कि nGPT, एक ऐसा आर्किटेक्चर जो भार (weights) और हिडन स्टेट्स को एक यूनिट हाइपरस्फीयर तक सीमित करता है, रचनात्मक सिग्नल संचय (constructive signal accumulation) के माध्यम से सिग्नल-टू-नॉइज़ अनुपात को स्वाभाविक रूप से बढ़ाकर, जटिल प्रिसिजन-संरक्षण हस्तक्षेपों की आवश्यकता को समाप्त करते हुए, स्थिर और कुशल एंड-टू-एंड 4-बिट प्रशिक्षण को सक्षम बनाता है।

Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg2026-05-08
🤖 AI

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe एक मल्टी-एजेंट फ्रेमवर्क पेश करता है जो विशिष्ट परिदृश्यों के लिए अनुकूलित विशेष LLM सर्विंग सिस्टम को स्वचालित रूप से संश्लेषित करता है, जो vLLM जैसे स्थापित स्टैक के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और जनरेशन-टाइम स्पेशलाइजेशन के माध्यम से गैर-मानक उपयोग के मामलों में उन्हें महत्वपूर्ण रूप से पीछे छोड़ देता है।

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci2026-05-08
💬 NLP

Milestone-Guided Policy Learning for Long-Horizon Language Agents

यह शोध पत्र BEACON को प्रस्तुत करता है, जो एक मील का पत्थर-निर्देशित (milestone-guided) नीति शिक्षण ढांचा है जो मील के पत्थर की सीमाओं पर प्रक्षेपवक्रों (trajectories) को विभाजित करके और द्वि-स्तरीय लाभ अनुमान (dual-scale advantage estimation) लागू करके लॉन्ग-होरिज़न लैंग्वेज एजेंटों में क्रेडिट मिसअट्रिब्यूशन और सैंपल अक्षमता को संबोधित करता है, और ALFWorld जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongli (…)2026-05-08
💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

यह शोध पत्र मोंटे कार्लो पोर्टफोलियो प्लानिंग (MCPP) को प्रस्तुत करता है, जो एक हल्का क्लोज्ड-लूप प्लानर है जो सिम्युलेटेड परिणामों के आधार पर मॉडल्स और समानांतर सैंपल्स को गतिशील रूप से आवंटित करके स्पष्ट बजट और समय सीमा की बाधाओं के भीतर एजेंटिक वर्कफ्लो को पूरा करने की संभावना को अनुकूलित करता है।

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan (…)2026-05-08
🤖 AI

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

ASTOR एक यूटिलिटी-ड्रिवन मल्टी-टास्क रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो कोड LLMs के लिए है, जो टास्क लर्निंग को गतिशील रूप से समन्वित करने के लिए पदानुक्रमित डेटा शेड्यूलिंग और एडेप्टिव पॉलिसी ऑप्टिमाइज़ेशन का उपयोग करता है, जो टास्क-विशिष्ट विशेषज्ञों और मौजूदा मल्टी-टास्क बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।

Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao2026-05-08
🤖 AI

P-Guide: Parameter-Efficient Prior Steering for Single-Pass CFG Inference

यह शोध पत्र P-Guide प्रस्तुत करता है, जो एक पैरामीटर-कुशल फ्रेमवर्क है जो फ्लो मैचिंग में प्रारंभिक लेटेंट स्टेट (initial latent state) को मॉड्युलेट करके क्लासिफायर-फ्री गाइडेंस (Classifier-Free Guidance) के करीब पहुँचकर सिंगल इन्फरेंस पास के माध्यम से उच्च-सटीकता वाली कंडीशनल जनरेशन प्राप्त करता है, जिससे प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए विलंबता (latency) को लगभग 50% कम किया जा सकता है।

Xin Peng, Ang Gao2026-05-08
🤖 AI

BUILD-AND-FIND: An Effort-Aware Protocol for Evaluating Agent-Managed Codebases

यह शोध पत्र BUILD-AND-FIND को प्रस्तुत करता है, जो एक प्रयास-जागरूक (effort-aware) मूल्यांकन प्रोटोकॉल है जो न केवल कोडबेस की व्यवहारिक शुद्धता का आकलन करता है, बल्कि यह भी मापता है कि डाउनस्ट्रीम एजेंटों के लिए मूल डिज़ाइन इरादे और विशिष्टताओं को पुनः प्राप्त करने हेतु कितनी सटीकता और निरीक्षण प्रयास की आवश्यकता होती है।

Jhen-Ke Lin2026-05-08
🤖 machine learning

Autoregressive Visual Generation Needs a Prologue

यह शोध पत्र "प्रोलॉग" (Prologue) का प्रस्ताव करता है, जो विशेष रूप से जनरेशन (generation) के लिए प्रशिक्षित टोकन के एक अलग सेट को पेश करके ऑटोरेग्रेसिव इमेज मॉडल्स में रिकंस्ट्रक्शन-जनरेशन अंतराल को पाटता है, जिससे पुनर्निर्माण की सटीकता (reconstruction fidelity) से समझौता किए बिना छवि की गुणवत्ता में उल्लेखनीय सुधार होता है (ImageNet पर gFID को 21.01 से घटाकर 10.75 करना)।

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu2026-05-08
🤖 machine learning

SymDrift: One-Shot Generative Modeling under Symmetries

SymDrift एक नवीन वन-शॉट जनरेटिव मॉडलिंग फ्रेमवर्क है जो इष्टतम संरेखण (optimal alignment) और अपरिवर्तनीय एम्बेडिंग (invariant embeddings) के माध्यम से एक सममिति-जागरूक ड्रिफ्टिंग फील्ड (symmetry-aware drifting field) को पेश करके भौतिक प्रणालियों में सममिति चुनौतियों का समाधान करता है, जिससे मल्टी-स्टेप बेसलाइन्स की तुलना में कंप्यूटेशनल ओवरहेड को 40 गुना तक कम करते हुए आणविक पीढ़ी (molecular generation) में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Samir Darouich, Vinh Tong, Lluís Pastor-Pérez, Tanja Bien, Loay Mualem, Mathias Niepert2026-05-08