💬 NLP

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

यह शोध पत्र प्रकट करता है कि LLMs द्वारा निर्मित और मूल्यांकित स्वचालित बेंचमार्क एक मौलिक आत्म-पक्षपात (self-bias) से ग्रस्त होते हैं जहाँ मॉडल परीक्षण सेट निर्माण और मूल्यांकन दोनों में योगात्मक शैलीगत प्रवृत्तियों के कारण व्यवस्थित रूप से अपने स्वयं के आउटपुट का पक्ष लेते हैं, जिससे अक्सर वे स्वयं को साथियों की तुलना में श्रेष्ठ के रूप में गलत तरीके से रैंक करते हैं।

Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch2026-05-27
💬 NLP

HiSpec: Hierarchical Speculative Decoding for LLMs

HiSpec एक हाई-थ्रूपुट स्पेकुलेटिव डिकोडिंग फ्रेमवर्क है जो कम-ओवरहेड इंटरमीडिएट वेरिफिकेशन के लिए अर्ली-एग्जिट मॉडल्स का लाभ उठाता है और सटीकता से समझौता किए बिना LLM इन्फरेंस को महत्वपूर्ण रूप से तेज करने के लिए ड्राफ्ट, वेरिफायर और टारगेट मॉडल्स के बीच कम्प्यूटेशनल स्टेट्स को पुनः उपयोग करता है।

Avinash Kumar, Sujay Sanghavi, Poulami Das2026-05-27
💬 NLP

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

यह शोध पत्र PTA-GRPO का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो उच्च-स्तरीय योजना मार्गदर्शन के लिए सुपरवाइज्ड फाइन-ट्यूनिंग को गाइडेंस-अवेयर रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है ताकि विविध गणितीय और वैज्ञानिक बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स की वैश्विक तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके।

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang (…)2026-05-27
🤖 AI

Inference-Time Search Using Side Information for Diffusion-Based Image Reconstruction

यह शोध पत्र एक नवीन, प्रशिक्षण-मुक्त ढांचे का प्रस्ताव करता है जो इन्फ्रेंस-टाइम सर्च के माध्यम से विविध साइड इंफॉर्मेशन को शामिल करके विभिन्न इनवर्स समस्याओं के लिए डिफ्यूजन-आधारित इमेज रिकंस्ट्रक्शन को बढ़ाता है, जिससे कई सॉल्वर और कार्यों में प्रदर्शन में निरंतर सुधार होता है।

Mahdi Farahbakhsh, Vishnu Teja Kunde, Dileep Kalathil, Krishna Narayanan, Jean-Francois Chamberland2026-05-27
🤖 machine learning

Monte Carlo Permutation Search

यह शोध पत्र मोंटे कार्लो परम्यूटेशन सर्च (MCPS) को प्रस्तुत करता है, जो एक सामान्य-उद्देश्य वाला MCTS एल्गोरिदम है जो पाथ-वाइड प्लेआउट सांख्यिकी को एक्सप्लोरेशन टर्म में शामिल करके और एक नया वेटिंग फॉर्मूला व्युत्पन्न करके हेक्स (Hex) और गो (Go) जैसे खेलों में GRAVE एल्गोरिदम से बेहतर प्रदर्शन करता है, जिससे GRAVE के बायस हाइपरपैरामीटर की आवश्यकता समाप्त हो जाती है।

Tristan Cazenave2026-05-27
💬 NLP

EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models

यह शोध पत्र EconCausal को प्रस्तुत करता है, जो शीर्ष स्तर के आर्थिक अध्ययनों से प्राप्त 10,000 से अधिक संदर्भ-एनोटेटेड (context-annotated) कारण त्रिकों (causal triplets) का एक बड़े पैमाने का बेंचमार्क है, जो यह प्रकट करता है कि जबकि लार्ज लैंग्वेज मॉडल्स स्थिर संदर्भों को संभाल सकते हैं, वे तब अपने कारण संबंधी निर्णयों को संशोधित करने में काफी संघर्ष करते हैं जब पर्यावरणीय स्थितियाँ बदल जाती हैं या जब उनका सामना भ्रामक साक्ष्यों से होता है।

Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim2026-05-27
🤖 machine learning

ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis

यह शोध पत्र ParsVoice को प्रस्तुत करता है, जो ऑडियोबुक्स से एक स्केलेबल पाइपलाइन के माध्यम से निर्मित 2,200-घंटे का एक सार्वजनिक रूप से उपलब्ध बहु-वक्ता फारसी भाषण संग्रह (corpus) है, जो खुले फारसी TTS संसाधनों का महत्वपूर्ण विस्तार करता है और XTTS मॉडल को फाइन-ट्यून करने के लिए उपयोग किए जाने पर उच्च-गुणवत्ता वाले संश्लेषण प्रदर्शन को प्रदर्शित करता है।

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery2026-05-27
🔢 mathematics

Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation

यह शोध पत्र 'नोड कॉन्ट्रिब्यूशन बैकप्रोपैगेशन' नामक एक गतिशील रक्षा प्रतिमान प्रस्तावित करता है जो बहु-एजेंट प्रणाली संचार को एक हस्ताक्षरित निर्देशित अचक्रीय ग्राफ (signed directed acyclic graph) के रूप में मॉडल करता है ताकि बैकवर्ड प्रोपेगेशन के माध्यम से व्यक्तिगत एजेंट योगदान की गणना की जा सके, जिससे सहयोगी कार्यों को प्रतिकूल भ्रष्टाचार से सुरक्षित करने के लिए दुर्भावनापूर्ण एजेंटों की सटीक पहचान और अलगाव सक्षम हो सके।

Chengcan Wu, Zhixin Zhang, Mingqian Xu, Zeming Wei, Meng Sun2026-05-27
🤖 AI

PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts

यह शोध पत्र PoCo को प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो प्राकृतिक भाषा में दी गई भेद्यता (vulnerability) विवरणों से स्वायत्त रूप से निष्पादन योग्य (executable) Foundry-संगत प्रूफ-ऑफ-कॉन्सेप्ट एक्सप्लॉइट्स उत्पन्न करता है, जिससे स्मार्ट कॉन्ट्रैक्ट सुरक्षा ऑडिट के लिए आवश्यक समय और प्रयास में काफी कमी आती है।

Vivi Andersson, Sofia Bobadilla, Harald Hobbelhagen, Martin Monperrus2026-05-27
🤖 machine learning

Explainable Cross-Disease Reasoning for Cardiovascular Risk Assessment from Low-Dose Computed Tomography

यह शोधपत्र एक व्याख्यात्मक ढांचे का प्रस्ताव करता है जो नेशनल लंग स्क्रीनिंग ट्रायल कोहोर्ट पर मौजूदा बेसलाइनों की तुलना में बेहतर प्रदर्शन करते हुए, चिकित्सा ज्ञान के साथ पल्मोनरी निष्कर्षों को एकीकृत करके प्राकृतिक भाषा के तर्क उत्पन्न करने के लिए एक नियंत्रित नैदानिक-सूचना पथ का लाभ उठाता है, ताकि लो-डोज चेस्ट सीटी स्कैन से हृदय रोग के जोखिम का आकलन किया जा सके।

Yifei Zhang, Jiashuo Zhang, Mojtaba Safari, Xiaofeng Yang, Liang Zhao2026-05-27