💬 NLP

Retrieved In-Context Principles from Previous Mistakes

यह शोधपत्र रिट्रीव्ड इन-कॉन्टेक्स्ट प्रिंसिपल्स (RICP) का प्रस्ताव करता है, जो एक टीचर-स्टूडेंट फ्रेमवर्क है जो विभिन्न रीजनिंग बेंचमार्क पर लार्ज लैंग्वेज मॉडल के प्रदर्शन में सुधार के लिए अनुकूलित, टास्क-लेवल प्रिंसिपल्स उत्पन्न करने हेतु स्टूडेंट मॉडल की गलतियों का विश्लेषण और क्लस्टरिंग करता है।

Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang2026-05-26
💬 NLP

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

यह शोध पत्र SURGE को प्रस्तुत करता है, जो आठ विविध डोमेन में 1,160 समस्याओं वाला एक व्यापक बेंचमार्क है, ताकि कोड निष्पादन परिणामों (code execution outcomes) की भविष्यवाणी करने के लिए कुशल सरोगेट मॉडल के रूप में बड़े भाषा मॉडलों (large language models) के उपयोग की व्यवहार्यता का व्यवस्थित रूप से मूल्यांकन किया जा सके।

Bohan Lyu, Siqiao Huang, Zichen Liang2026-05-26
💬 NLP

Scaling Natural-Language Graph-Based Test Time Compute for Automated Theorem Proving

यह शोधपत्र KG-prover को प्रस्तुत करता है, जो एक नवीन ढांचा है जो स्वचालित प्रमेय सिद्ध करने (ऑटोमेटेड थ्योरम प्रूविंग) को बढ़ाने के लिए गणितीय ग्रंथों से खोजी गई नॉलेज ग्राफ्स के साथ सामान्य प्रयोजन वाले लार्ज लैंग्वेज मॉडल्स को संवर्धित करता है, और बिना किसी अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता के कई डेटासेट्स पर महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित करता है।

Vincent Li, Tim Knappe, Yule Fu, Kevin Han, Kevin Zhu2026-05-26
💬 NLP

Lean Formalization of Generalization Error Bound by Rademacher Complexity and Dudley's Entropy Integral

यह शोध पत्र रेडेमेकर कॉम्प्लेक्सिटी (Rademacher complexity) और डडली के एंट्रॉपी इंटीग्रल (Dudley's entropy integral) पर आधारित जनरलाइजेशन एरर बाउंड्स (generalization error bounds) का लीन 4 (Lean 4) में एक औपचारिक प्रस्तुतीकरण प्रस्तुत करता है, जिसमें माप-सिद्धांतिक आधारों (measure-theoretic foundations) से लेकर उच्च-संभाव्यता वाले यूनिफॉर्म डेविएशन बाउंड्स (high-probability uniform deviation bounds) और लीनियर प्रेडिक्टर्स (linear predictors) पर उनके अनुप्रयोग तक एक यांत्रिक रूप से सत्यापित पाइपलाइन शामिल है।

Sho Sonoda, Kazumi Kasaura, Yuma Mizuno, Kei Tsukamoto, Naoto Onda2026-05-26
💬 NLP

Ineffectiveness for Search and Undecidability of PCSP Meta-Problems

यह शोध पत्र प्रदर्शित करता है कि सर्च सर्टिफिकेट खोजने के लिए मानक PCSP रिलैक्सेशन एल्गोरिदम (BLP, AIP, और BLP+AIP) से समाधानों को राउंड करना किसी भी TFNP समस्या के समान कठिन है, और यह सिद्ध करता है कि यह निर्धारित करना कि क्या परिमित PCSP टेम्पलेट्स इन एल्गोरिदम या विशिष्ट बीजगणितीय सुग्राह्यता (algebraic tractability) की शर्तों को संतुष्ट करते हैं, अनिर्णायक (undecidable) है।

Alberto Larrauri2026-05-26
💬 NLP

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

यह शोधपत्र MMSI-Bench प्रस्तुत करता है, जो 1,000 मल्टी-इमेज स्थानिक तर्क संबंधी प्रश्नों वाला एक चुनौतीपूर्ण बेंचमार्क है जो वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स और मनुष्यों के बीच प्रदर्शन के एक महत्वपूर्ण अंतर को प्रकट करता है, साथ ही विशिष्ट विफलता मोड का निदान करने और भविष्य के अनुसंधान को मार्गदर्शन देने के लिए एक स्वचालित त्रुटि विश्लेषण पाइपलाइन भी प्रदान करता है।

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue (…)2026-05-26
💬 NLP

Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks

यह शोध पत्र Agent-X को प्रस्तुत करता है, जो छह विविध वातावरणों में 828 वास्तविक-विश्व, बहुआयामी कार्यों वाला एक बड़े पैमाने का बेंचमार्क है और विज़न-केंद्रित एजेंटों में गहन तर्क (deep reasoning) का आकलन करने के लिए एक सूक्ष्म चरण-स्तरीय मूल्यांकन ढांचा प्रदान करता है, जिससे यह पता चलता है कि वर्तमान अग्रणी मॉडल जटिल, बहु-चरणीय परिदृश्यों में पूर्ण-श्रृंखला सफलता प्राप्त करने में संघर्ष करते हैं।

Tajamul Ashraf, Amal Saqib, Hanan Ghani, Muhra AlMahri, Yuhao Li, Noor Ahsan, Umair Nawaz, Jean Lahoud, Hisham Cholakkal (…)2026-05-26
💬 NLP

From Multi-Agent Systems and the Semantic Web to Agentic AI: A Unified Narrative of the Web of Agents

यह शोध पत्र 1990 से 2026 तक "एजेंट्स के जाल" (Web of Agents) के विकास का एक एकीकृत वृत्तांत प्रस्तुत करता है, जिसमें यह तर्क दिया गया है कि प्लेटफॉर्म समन्वय से डेटा एनोटेशन और अंततः मॉडल व्याख्या की ओर एक "सिमेंटिक-प्रयास प्रवासन" (semantic-effort migration) तीन विशिष्ट पीढ़ियों को परिभाषित करता है, साथ ही एक तुलनात्मक ढांचे, प्रणाली वर्गीकरण और एजेंटिक एआई (Agentic AI) के लिए निरंतर चुनौतियों और भविष्य की दिशाओं की पहचान करने हेतु हालिया संस्थागत अभिसरण का विश्लेषण भी प्रदान करता है।

Tatiana Petrova (SEDAN SnT, University of Luxembourg, Luxembourg, Luxembourg), Boris Bliznioukov (SEDAN SnT, University (…)2026-05-26
💬 NLP

How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework

यह शोध पत्र ArxivRoll प्रस्तुत करता है, जो वन-टाइम पैड एन्क्रिप्शन से प्रेरित एक गतिशील मूल्यांकन ढांचा है, जो डेटा संदूषण (data contamination) और प्रशिक्षण पूर्वाग्रह के कारण होने वाले LLM अति-आकलन को मापने और कम करने के लिए हाल के ArXiv लेखों से उत्पन्न एक अर्ध-वार्षिक, स्वचालित बेंचमार्क का उपयोग करता है।

Zi Liang, Liantong Yu, Shiyu Zhang, Qingqing Ye, Haibo Hu2026-05-26
💬 NLP

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

यह शोध पत्र LiveMCP-101 प्रस्तुत करता है, जो 101 वास्तविक दुनिया के प्रश्नों का एक बेंचमार्क है जिसे एक समानांतर मूल्यांकन ढांचे के माध्यम से MCP-सक्षम एजेंटों का स्ट्रेस-टेस्ट करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि उन्नत (फ्रंटियर) LLMs भी जटिल बहु-चरणीय टूल ऑर्केस्ट्रेशन में संघर्ष करते हैं और भविष्य के सुधारों के मार्गदर्शन के लिए सात विशिष्ट विफलता मोड की पहचान करता है।

Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sa (…)2026-05-26