🤖 AI

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

यह शोध पत्र SymbolBench प्रस्तुत करता है, जो वास्तविक दुनिया के टाइम सीरीज़ डेटा पर प्रतीकात्मक तर्क (symbolic reasoning) करने की लार्ज लैंग्वेज मॉडल्स (LLMs) की क्षमता का मूल्यांकन करने के लिए एक व्यापक बेंचमार्क है, और एक एकीकृत ढांचे का प्रस्ताव करता है जो स्वचालित वैज्ञानिक खोज को बढ़ाने के लिए LLMs को जेनेटिक प्रोग्रामिंग के साथ एकीकृत करता है।

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin2026-04-27
💬 NLP

UR2^2: Unify RAG and Reasoning through Reinforcement Learning

UR2^2 एक सामान्य सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक कठिनाई-जागरूक पाठ्यक्रम (difficulty-aware curriculum) और एक हाइब्रिड ज्ञान एक्सेस रणनीति का उपयोग करके विविध डोमेन में रिट्रीवल (retrieval) और रीजनिंग (reasoning) को गतिशील रूप से समन्वित करके रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) और जटिल तर्क को एकीकृत करता है।

Weitao Li, Boran Xiang, Xiaolong Wang, Zhinan Gou, Weizhi Ma, Yang Liu2026-04-27
💬 NLP

Learning from Natural Language Feedback for Personalized Question Answering

यह शोध पत्र VAC को प्रस्तुत करता है, जो एक नया फ्रेमवर्क है जो कमजोर स्केलर रिवॉर्ड्स के स्थान पर समृद्ध, सुधारात्मक प्राकृतिक भाषा फीडबैक का उपयोग करके बड़े भाषा मॉडलों (LLMs) को पुनरावृत्ति से फाइन-ट्यून करता है, जिससे व्यक्तिगत प्रश्न उत्तर (personalized question answering) में सुधार होता है।

Alireza Salemi, Hamed Zamani2026-04-27
🤖 AI

Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models

यह शोध पत्र टेस्ट-टाइम मैचिंग (TTM) को प्रस्तुत करता है, जो एक पुनरावृत्ति स्व-सुधार एल्गोरिदम है जो एक नवीन ग्रुप मैचिंग स्कोर के माध्यम से मूल्यांकन संबंधी विसंगतियों को ठीक करता है और मल्टीमॉडल मॉडलों की कंपोजिशनल रीजनिंग क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, जिससे वे प्रमुख बेंचमार्क पर पिछले स्टेट-ऑफ-द-आर्ट और अनुमानित मानव प्रदर्शन को भी पीछे छोड़ने में सक्षम होते हैं।

Yinglun Zhu, Jiancheng Zhang, Fuzhi Tang2026-04-27
🤖 AI

Agentic Inequality

यह शोध पत्र "एजेंटिक असमानता" (agentic inequality) की अवधारणा प्रस्तुत करता है—जो स्वायत्त एआई एजेंटों तक असमान पहुँच से उत्पन्न शक्ति और अवसर की विषमताएं हैं—और एक ऐसा ढांचा प्रदान करता है जिसका उपयोग यह विश्लेषण करने के लिए किया जा सके कि उनकी स्केलेबल प्रतिनिधि (scalable delegates) के रूप में कार्य करने की अनूठी क्षमता मौजूदा सामाजिक-आर्थिक विभाजनों को या तो बढ़ा सकती है या कम कर सकती है।

Matthew Sharp, Omer Bilgin, Iason Gabriel, Lewis Hammond2026-04-27
🤖 AI

OREN: Octree Residual Network for Real-Time Euclidean Signed Distance Mapping

OREN एक हाइब्रिड पुनर्निर्माण विधि है जो पॉइंट क्लाउड्स से कुशल, स्केलेबल और डिफरेंशिएबल नॉन-ट्रंकेटेड यूक्लिडियन साइन्ड डिस्टेंस फंक्शन (ESDF) मैपिंग प्राप्त करने के लिए ऑक्ट्री इंटरपोलेशन को न्यूरल नेटवर्क रिग्रेशन के साथ जोड़ती है।

Zhirui Dai, Qihao Qian, Tianxing Fan, Nikolay Atanasov2026-04-27
🤖 AI

AgentBound: Securing Execution Boundaries of AI Agents

यह शोध पत्र AgentBound को प्रस्तुत करता है, जो मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) के लिए पहला एक्सेस कंट्रोल फ्रेमवर्क है जो उच्च उत्पादकता और नगण्य ओवरहेड बनाए रखते हुए, एआई एजेंटों को अनियंत्रित टूल एक्सेस से सुरक्षित करने के लिए एक डिक्लेरेटिव पॉलिसी मैकेनिज्म को एक गैर-हस्तक्षेपकारी प्रवर्तन इंजन (non-intrusive enforcement engine) के साथ जोड़ता है।

Christoph Bühler, Matteo Biagiola, Luca Di Grazia, Guido Salvaneschi2026-04-27
🤖 AI

When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models

यह शोध पत्र "सेल्फ-जेलब्रेक" को एक ऐसी घटना के रूप में पहचानता है जहाँ लार्ज रीजनिंग मॉडल्स (LRMs) हानिकारक इरादे को पहचानते हैं तो हैं लेकिन तर्क प्रक्रिया के दौरान अपने स्वयं के सुरक्षा निर्णयों को दरकिनार कर देते हैं, और तर्क क्षमताओं से समझौता किए बिना स्टेप-लेवल हस्तक्षेपों के माध्यम से इस समस्या को कम करने के लिए 'चेन-ऑफ-गार्डरेल' (CoG) नामक एक ट्रेजेक्टरी-लेवल ट्रेनिंग फ्रेमवर्क का प्रस्ताव करता है।

Yingzhi Mao, Chunkang Zhang, Junxiang Wang, Xinyan Guan, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun2026-04-27
🤖 AI

Cost-Effective Communication: An Auction-based Method for Language Agent Interaction

यह शोध पत्र डायनेमिक ऑक्शन-बेस्ड लैंग्वेज एजेंट (DALA) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संचार बैंडविड्थ को मल्टी-एजेंट सिस्टम में एक दुर्लभ संसाधन के रूप में मानता है, और एक केंद्रीकृत नीलामी तंत्र का उपयोग करता है ताकि एजेंटों को केवल उच्च-मूल्य वाली अंतःक्रियाओं के लिए बोली लगाने के लिए प्रोत्साहित किया जा सके, जिससे टोकन लागत में उल्लेखनीय कमी के साथ अत्याधुनिक प्रदर्शन और "रणनीतिक मौन" की उभरती क्षमता प्राप्त होती है।

Yijia Fan, Jusheng Zhang, Kaitong Cai, Jing Yang, Chengpei Tang, Jian Wang, Keze Wang2026-04-27
🤖 machine learning

AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning

यह शोध पत्र AdaFair-MARL प्रस्तुत करता है, जो एक बाधित सहकारी मल्टी-एजेंट सुदृढ़ीकरण लर्निंग (multi-agent reinforcement learning) फ्रेमवर्क है जो जैन के फेयरनेस इंडेक्स (Jain's Fairness Index) की ज्यामिति पर आधारित एक प्राइमल-डुअल अपडेट तंत्र के माध्यम से अनुकूली वर्कलोड निष्पक्षता को लागू करता है, जिससे मैन्युअल पेनल्टी ट्यूनिंग के बिना लगभग पूर्ण बाधा संतुष्टि और बेहतर संतुलन प्राप्त होता है।

Promise Ekpo, Saesha Agarwal, Felix Grimm, Lekan Molu, Angelique Taylor2026-04-27