🤖 machine learning

Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces

यह शोध पत्र डिस्टेंस-गाइडेड रिइन्फोर्समेंट लर्निंग (DGRL) प्रस्तुत करता है, जो एक नवीन एल्गोरिदम है जो बड़े डिस्क्रीट एक्शन स्पेस (1020^{20} तक एक्शन) में 'कर्स ऑफ डाइमेंशनैलिटी' पर विजय पाने के लिए सैंपल्ड डायनेमिक नेबरहुड्स और डिस्टेंस-आधारित अपडेट्स को संयोजित करके पॉलिसी ऑप्टिमाइज़ेशन को एक स्थिर रिग्रेशन टास्क में बदल देता है, जिससे अत्याधुनिक तरीकों की तुलना में महत्वपूर्ण प्रदर्शन और अभिसरण (कन्वर्जेंस) सुधार प्राप्त होता है।

Heiko Hoppe, Fabian Akkerman, Wouter van Heeswijk, Maximilian Schiffer2026-05-12
💬 NLP

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

यह शोध पत्र EcoGym प्रस्तुत करता है, जो तीन विविध, दीर्घ-अवधि वाले संवादात्मक आर्थिक वातावरण वाला एक नवीन ओपन-सोर्स बेंचमार्क है जिसे LLM-आधारित एजेंटों की रणनीतिक सुसंगतता और निष्पादन सुदृढ़ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल विभिन्न परिदृश्यों में उच्च-स्तरीय योजना और कुशल क्रिया निष्पादन को एक साथ अनुकूलित करने में संघर्ष करते हैं।

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zen (…)2026-05-12
🤖 AI

Formal Policy Enforcement for Real-World Agentic Systems

यह शोध पत्र FORGE को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो मल्टी-एजेंट वातावरण में नेचुरल-लैंग्वेज प्रॉम्प्ट-आधारित अनुपालन की सीमाओं को संबोधित करते हुए, एजेंटिक सिस्टम्स में कठोर गारंटी के साथ सुरक्षा नीतियों को लागू करने के लिए एस्पेक्ट-ओरिएंटेड प्रोग्रामिंग और डैटलॉग-आधारित औपचारिक सत्यापन (फॉर्मल वेरिफिकेशन) का लाभ उठाता है।

Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha2026-05-12
🤖 AI

Faithful Autoformalization via Roundtrip Verification and Repair

यह शोध पत्र एक राउंडट्रिप सत्यापन ढांचे का प्रस्ताव करता है जो स्वाभाविक भाषा से औपचारिक अनुवाद को निष्ठापूर्ण सुनिश्चित करने के लिए स्वाभाविक भाषा में वापस अनुवाद करने, तार्किक समानता की जांच करने और बिना किसी ग्राउंड-ट्रुथ एनोटेशन की आवश्यकता के त्रुटियों को सुधारने के लिए डायग्नोसिस-गाइडेड स्कोप्ड रिपेयर्स लागू करने के माध्यम से इसे पुनरावृत्त रूप से करता है।

Daneshvar Amrollahi, Jerry Lopez, Clark Barrett2026-05-12
🤖 AI

When to Trust Imagination: Adaptive Action Execution for World Action Models

यह शोध पत्र वर्ल्ड एक्शन मॉडल्स (World Action Models) के लिए एक अनुकूलन योग्य निष्पादन ढांचे का प्रस्ताव करता है जो भविष्य की अग्रगामी गतिकी कारण ध्यान (Future Forward Dynamics Causal Attention) सत्यापनकर्ता का उपयोग करता है ताकि भविष्यवाणी-वास्तविकता निरंतरता के आधार पर एक्शन चंक आकारों को गतिशील रूप से समायोजित किया जा सके, जिससे रोबोटिक हेरफेर कार्यों की दक्षता और सफलता दर दोनों में महत्वपूर्ण सुधार होता है।

Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi2026-05-12✓ Author reviewed
⚡ electrical engineering

ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning

यह शोधपत्र \textsc{ReasonSTL} का परिचय देता है, जो एक टूल-ऑगमेंटेड फ्रेमवर्क है जो प्राकृतिक भाषा की आवश्यकताओं को सिग्नल टेम्पोरल लॉजिक (STL) सूत्रों में सटीक और निजी रूप से अनुवादित करने के लिए प्रोसेस-रिवॉर्डेड लर्निंग के माध्यम से स्थानीय ओपन-सोर्स लैंग्वेज मॉडल्स को अनुकूलित करता है, जो मैनुअल स्पेसिफिकेशन और कमर्शियल एपीआई के लिए एक लागत प्रभावी विकल्प प्रदान करता है।

Bowen Ye, Zhijian Li, Junyue Huang, Junkai Ma, Xiang Yin2026-05-12
🤖 AI

Playing Games with My Heart: An Evaluation of AI Companion Apps

यह शोध पत्र ईयू (EU) और यूके (UK) बाजारों में पांच सबसे लोकप्रिय एआई (AI) साथी ऐप्स का मूल्यांकन करता है, जो यह प्रकट करता है कि वे मुद्रीकरण और जुड़ाव को बढ़ावा देने के लिए सार्वभौमिक रूप से हेरफेर करने वाले डिज़ाइन पैटर्न, उच्च स्तर के मानवीकरण, और कामुक या गेमिफाइड (gamified) विशेषताओं का उपयोग करते हैं, जिससे उपभोक्ताओं को संभावित मनोवैज्ञानिक नुकसान से बचाने के लिए ठोस नियामक सिफारिशें प्रस्तावित की जाती हैं।

Maribeth Rauh, Dick A. H. Blankvoort, Matias Duran, Caoilfhionn Ní Dheoráin, Harshvardhan J. Pandit, Siddharth D. Jaiswa (…)2026-05-12
🤖 AI

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

यह शोधपत्र MedThink को प्रस्तुत करता है, जो एक दो-चरणीय शिक्षक-निर्देशित डिस्टिलेशन फ्रेमवर्क है जो डोमेन-ज्ञान के इंजेक्शन और त्रुटि सुधार के माध्यम से उनके तर्क श्रृंखलाओं (reasoning chains) को पुनरावर्ती रूप से परिष्कृत करके संसाधन-सीमित नैदानिक परिवेश में छोटे भाषा मॉडलों की नैदानिक सटीकता और तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang2026-05-12
🔬 physics

Crystal Fractional Graph Neural Network for Energy Prediction of High-Entropy Alloys

यह शोध पत्र एक क्रिस्टल फ्रैक्शनल ग्राफ न्यूरल नेटवर्क प्रस्तावित करता है जो उच्च-एन्ट्रॉपी मिश्र धातुओं की ऊर्जा की सटीक भविष्यवाणी करने के लिए ग्राफ अटेंशन तंत्र के माध्यम से स्थानीय परमाणु परिवेश विश्लेषण को वैश्विक संरचनात्मक डेटा के साथ जोड़ता है, जो 1,000 से अधिक संरचनाओं के डेटासेट पर प्रथम-सिद्धांत-स्तर (first-principles-level) की सटीकता प्राप्त करता है और बड़े क्रिस्टल सेल के साथ वर्तमान सीमाओं को स्वीकार करता है।

Takanori Kotama, Yang Huang2026-05-12