💻 computer science

Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models

यह शोध पत्र DAVinCI को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो दावों के आंतरिक और बाहरी स्रोतों के दोहरे एट्रिब्यूशन को एंटेलमेंट-आधारित सत्यापन के साथ जोड़कर लार्ज लैंग्वेज मॉडल्स की तथ्यात्मक विश्वसनीयता और व्याख्यात्मकता को बढ़ाता है, जिसके परिणामस्वरूप उच्च-जोखिम वाले डोमेन में सटीकता और जवाबदेही में महत्वपूर्ण सुधार होता है।

Vipula Rawte, Ryan Rossi, Franck Dernoncourt, Nedim Lipka2026-04-24
💻 computer science

SQLyzr: A Comprehensive Benchmark and Evaluation Platform for Text-to-SQL

यह शोध पत्र SQLyzr को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क और मूल्यांकन मंच है जो विविध मेट्रिक्स, यथार्थवादी वर्कलोड संरेखण और सूक्ष्म नैदानिक उपकरण प्रदान करके मौजूदा टेक्स्ट-टू-SQL मूल्यांकनों की सीमाओं को संबोधित करता है ताकि लार्ज लैंग्वेज मॉडल-आधारित टेक्स्ट-टू-SQL सिस्टम के क्रमिक सुधार को सुगम बनाया जा सके।

Sepideh Abedini, M. Tamer Özsu2026-04-24
📈 economics

Post-AGI Economies: Autonomy and the First Fundamental Theorem of Welfare Economics

यह शोध पत्र तर्क देता है कि कल्याणकारी अर्थशास्त्र के प्रथम मौलिक प्रमेय को उत्तर-AGI अर्थव्यवस्थाओं में वैध बने रहने के लिए स्वायत्तता संबंधी योग्यता की आवश्यकता है, जो एक सामान्यीकृत मॉडल का प्रस्ताव करता है जहाँ प्रतिस्पर्धी संतुलन केवल कृत्रिम प्रणालियों द्वारा प्रदर्शित स्वायत्तता के विभिन्न स्तरों को ध्यान में रखने पर ही पारेटो दक्षता प्राप्त करता है।

Elija Perrier2026-04-24
💬 NLP

Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model

यह शोध पत्र IRM को प्रस्तुत करता है, जो LLM-जनित टेक्स्ट का पता लगाने के लिए एक नवीन ज़ीरो-शॉट दृष्टिकोण है, जो बिना किसी प्राथमिकता संग्रह या अतिरिक्त प्रशिक्षण के बेहतर प्रदर्शन प्राप्त करने के लिए मौजूदा मॉडलों से प्राप्त निहित रिवॉर्ड मॉडल्स का लाभ उठाता है।

Runheng Liu, Heyan Huang, Xingchen Xiao, Zhijing Wu2026-04-24
💬 NLP

EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval

यह शोध पत्र दीर्घकालिक संवादात्मक स्मृति के मूल्यांकन के लिए एक बेंचमार्क, EngramaBench प्रस्तुत करता है, और यह प्रदर्शित करता है कि जबकि फुल-कॉन्टेक्स्ट प्रॉम्प्टिंग उच्चतम समग्र प्रदर्शन प्राप्त करती है, प्रस्तावित ग्राफ-स्ट्रक्चर्ड मेमोरी सिस्टम (Engrama) क्रॉस-स्पेस रीजनिंग में विशिष्ट रूप से इससे बेहतर प्रदर्शन करता है, जो विशेष संरचनात्मक लाभों और समग्र अनुकूलन के बीच एक मौलिक ट्रेड-ऑफ को प्रकट करता है।

Julian Acuna2026-04-24
💻 computer science

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA एक पदानुक्रमित ढांचा (hierarchical framework) है जो कार्यों, उप-लक्ष्यों (subgoals) और प्रक्षेप पथों (trajectories) के बीच भविष्य कहनेवाला संरेखण (predictive alignment) और सुधार का उपयोग करके विजन-लैंग्वेज-एक्शन सिस्टम में कैस्केडिंग विफलताओं को कम करता है ताकि लंबी अवधि के कार्यों के दौरान स्थानीय त्रुटियों को फैलने से रोका जा सके।

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang2026-04-24
💬 NLP

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

यह शोध पत्र PLOTTER का परिचय देता है, जो एक ऐसा ढांचा है जो सीधे टेक्स्ट के बजाय संरचनात्मक घटना और चरित्र ग्राफ पर 'इवैल्यूएट-प्लान-रिवाइज' (मूल्यांकन-योजना-संशोधन) चक्र को निष्पादित करके जटिल कथा निर्माण को उन्नत करता है, जिससे वैश्विक सुसंगतता, तार्किक निरंतरता और चरित्र विकास में महत्वपूर्ण सुधार होता है।

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv2026-04-24
📈 economics

Calibeating Prediction-Powered Inference

यह शोध पत्र कैलिब्रेटेड प्रेडिक्शन-पावर्ड इन्फरेंस (Calibrated Prediction-Powered Inference) को प्रस्तुत करता है, जो एक अर्ध-पर्यवेक्षित (semisupervised) माध्य अनुमान पद्धति है जो पुनरप्रशिक्षण के बिना एस्टिमेटर की दक्षता और भविष्य कहने वाली सटीकता में सुधार करने के लिए एक छोटे लेबल वाले नमूने पर ब्लैक-बॉक्स प्रेडिक्शन स्कोर को पोस्ट-हॉक कैलिब्रेट करती है, जो आइसोटोनिक कैलिब्रेशन (isotonic calibration) के लिए प्रथम-क्रम अनुकूलता गारंटी और AIPW एवं PPI++ जैसे मौजूदा दृष्टिकोणों के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्रदान करती है।

Lars van der Laan, Mark Van Der Laan2026-04-24
🧬 biology

Trustworthy Clinical Decision Support Using Meta-Predicates and Domain-Specific Languages

यह शोधपत्र नैदानिक निर्णय नियमों पर ज्ञानमीमांसीय बाधाओं को लागू करने के लिए मेटा-प्रिडिकेट्स और एक डोमेन-विशिष्ट भाषा का उपयोग करने वाले एक ढांचे का प्रस्ताव करता है, जिससे यह सुनिश्चित होता है कि एआई-संचालित स्वास्थ्य सेवा निर्णय न केवल सटीक हों, बल्कि तैनाती से पहले ऑडिट योग्य और उपयुक्त साक्ष्यों पर आधारित भी हों।

Michael Bouzinier, Sergey Trifonov, Michael Chumack, Eugenia Lvova, Dmitry Etin2026-04-24
💬 NLP

Do LLM Decoders Listen Fairly? Benchmarking How Language Model Priors Shape Bias in Speech Recognition

यह शोध पत्र पांच जनसांख्यिकीय अक्षों और विभिन्न ध्वनिक स्थितियों में नौ स्पीच रिकग्निशन मॉडलों का बेंचमार्किंग करता है, जिससे यह पता चलता है कि ऑडियो एनकोडर डिज़ाइन और संपीड़न स्तर—न कि एलएलएम (LLM) का पैमाना—निष्पक्षता और मजबूती के प्राथमिक निर्धारक हैं, जिसमें विशिष्ट निष्कर्ष यह हैं कि एलएलएम डिकोडर स्वाभाविक रूप से नस्लीय पूर्वाग्रह को नहीं बढ़ाते हैं, लेकिन सन्नाटा इंजेक्शन या मास्किंग के तहत गंभीर, जनसांख्यिकीय-चयनात्मक मतिभ्रम (hallucinations) प्रदर्शित कर सकते हैं।

Srishti Ginjala, Eric Fosler-Lussier, Christopher W. Myers, Srinivasan Parthasarathy2026-04-24