💬 NLP

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

यह शोध पत्र काउंटरलॉजिक (CounterLogic) बेंचमार्क प्रस्तुत करता है ताकि यह उजागर किया जा सके कि पैरामीट्रिक ज्ञान के साथ संघर्षों के कारण लार्ज लैंग्वेज मॉडल्स (Large Language Models) काउंटरफैक्चुअल रीजनिंग (counterfactual reasoning) में संघर्ष करते हैं, और यह इस प्रदर्शन अंतराल को महत्वपूर्ण रूप से कम करने के लिए "फ्लैग एंड रीजन" (Flag & Reason - FaR) मेटाकॉग्निटिव हस्तक्षेप का प्रस्ताव करता है।

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kuma (…)2026-03-25
💬 NLP

DualEdit: Mitigating Safety Fallback in LLM Backdoor Editing via Affirmation-Refusal Regulation

यह शोधपत्र DualEdit का प्रस्ताव करता है, जो एक दोहरे-उद्देश्य वाला मॉडल एडिटिंग फ्रेमवर्क है जो डायनेमिक लॉस वेटिंग और वैल्यू एंकरिंग के माध्यम से सकारात्मक टोकन को बढ़ावा देकर और इनकार करने वाले टोकन को दबाकर सुरक्षा-संरेखित (safety-aligned) LLMs पर बैकडोर हमलों में होने वाली "सेफ्टी फॉलबैक" घटना को कम करता है।

Houcheng Jiang, Zetong Zhao, Junfeng Fang, Haokai Ma, Ruipeng Wang, Xiang Wang, Xiangnan He, Yang Deng2026-03-25
💬 NLP

MARS: toward more efficient multi-agent collaboration for LLM reasoning

यह शोध पत्र MARS का प्रस्ताव करता है, जो एक भूमिका-आधारित मल्टी-एजेंट सहयोग ढांचा है जो तर्क की सटीकता प्राप्त करने के लिए एक समीक्षा प्रक्रिया की नकल करता है जो मल्टी-एजेंट डिबेट के समान है, जबकि समीक्षक-से-समीक्षक के बीच प्रत्यक्ष बातचीत को समाप्त करके कम्प्यूटेशनल लागत को काफी कम कर देता है।

Xiao Wang, Jia Wang, Yijie Wang, Pengtao Dang, Sha Cao, Chi Zhang2026-03-25
💬 NLP

In Generative AI We (Dis)Trust? Computational Analysis of Trust and Distrust in Reddit Discussions

यह शोध पत्र जनरेटिव एआई (generative AI) में विश्वास और अविश्वास का पहला बड़े पैमाने पर, अनुदैर्ध्य (longitudinal) कम्प्यूटेशनल अध्ययन प्रस्तुत करता है, जो 2022 से 2025 तक के 230,000 से अधिक रेडिट (Reddit) पोस्ट का विश्लेषण करके मुख्य रूप से तकनीकी प्रदर्शन और व्यक्तिगत अनुभव द्वारा संचालित संतुलित सार्वजनिक भावना को प्रकट करता है, साथ ही भविष्य के बड़े पैमाने के विश्वास विश्लेषण के लिए एक पद्धतिगत ढांचा भी प्रदान करता है।

Aria Pessianzadeh, Naima Sultana, Hildegarde Van den Bulck, David Gefen, Shahin Jabbari, Rezvaneh Rezapour2026-03-25
💬 NLP

Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs

यह शोध पत्र Xmera को प्रस्तुत करता है, जो एक नवीन प्रतिकूल ढांचा (adversarial framework) है जो यह प्रदर्शित करता है कि मामूली प्रॉम्प्ट इंजेक्शन हमले उच्च सफलता दर के साथ LLM की तथ्यात्मक रिकॉल (factual recall) को गंभीर रूप से कमजोर कर सकते हैं, जबकि एक रैंडम फॉरेस्ट-आधारित रक्षा का प्रस्ताव करता है जो जनरेशन अनिश्चितता (generation uncertainty) का उपयोग करके समझौता किए गए उत्तरों को वैध उत्तरों से प्रभावी ढंग से अलग करता है।

Alina Fastowski, Bardh Prenkaj, Yuxiao Li, Gjergji Kasneci2026-03-25
💬 NLP

Principled Context Engineering for RAG: Statistical Guarantees via Conformal Prediction

यह शोध पत्र रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) के लिए एक सिद्धांत-आधारित कॉन्टेक्स्ट इंजीनियरिंग फ्रेमवर्क प्रस्तावित करता है जो प्रासंगिक साक्ष्य को बनाए रखने की सांख्यिकीय गारंटी देने के लिए कन्फॉर्मल प्रेडिक्शन का उपयोग करता है और साथ ही कॉन्टेक्स्ट की लंबाई को काफी कम करता है, जिससे तथ्यात्मक सटीकता में सुधार होता है और फ़िल्टरिंग पर मॉडल-अज्ञेय नियंत्रण (model-agnostic control) प्राप्त होता है।

Debashish Chakraborty, Eugene Yang, Daniel Khashabi, Dawn Lawrie, Kevin Duh2026-03-25
💬 NLP

PaperBanana: Automating Academic Illustration for AI Scientists

PaperBanana एक एजेंटिक फ्रेमवर्क है जो संदर्भ पुनर्प्राप्ति (reference retrieval), योजना (planning), रेंडरिंग (rendering) और आत्म-आलोचना (self-critique) के लिए विशिष्ट एजेंटों को ऑर्केस्ट्रेट करके प्रकाशन-योग्य शैक्षणिक चित्रणों और सांख्यिकीय प्लॉट्स के निर्माण को स्वचालित करता है, जो NeurIPS 2025 प्रकाशनों से प्राप्त एक नए बेंचमार्क पर निष्ठा (faithfulness), पठनीयता (readability) और सौंदर्यशास्त्र (aesthetics) में उत्कृष्ट प्रदर्शन प्राप्त करता है।

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon2026-03-25
💬 NLP

Efficient and High-Fidelity Omni Modality Retrieval

यह शोध पत्र OmniRet को प्रस्तुत करता है, जो टेक्स्ट, विज़न और ऑडियो मोडैलिटीज़ के माध्यम से जटिल प्रश्नों को संभालने में सक्षम पहला रिट्रीवल मॉडल है, जो नवीन अटेंशन-आधारित रीसैंपलिंग और अटेंशन स्लाइसड वासरस्टीन पूलिंग तंत्रों के माध्यम से कुशल और उच्च-सटीकता वाला प्रदर्शन प्राप्त करता है, साथ ही ओम्नी-मोडल क्षमताओं का मूल्यांकन करने के लिए एक नया ऑडियो-सेंट्रिक मल्टीमॉडल बेंचमार्क भी स्थापित करता है।

Chuong Huynh, Manh Luong, Abhinav Shrivastava2026-03-25
💻 computer science

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

यह शोध पत्र 1.8 मिलियन से अधिक मॉडलों का विश्लेषण करता है यह प्रकट करने के लिए कि ओपन एलएलएम (LLM) परिवारों में मल्टीमोडैलिटी क्रमिक क्रॉस-मोडल ट्रांसफर के बजाय दुर्लभ "फाउंडर इवेंट्स" (संस्थापक घटनाओं) के माध्यम से उभरती है, और तत्पश्चात विशिष्ट वंशानुगत वंशों के भीतर तेजी से विस्तारित होकर इमेज-टेक्स्ट कार्यों द्वारा नियंत्रित एक पंक्टुएटेड अडॉप्शन पैटर्न (विरामयुक्त अंगीकरण पैटर्न) बनाती है।

Manuel Cebrian2026-03-25
💬 NLP

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

यह शोध पत्र 14,000 नेपाली यौन और प्रजनन स्वास्थ्य संबंधी प्रश्नों के प्रति लार्ज लैंग्वेज मॉडल्स की प्रतिक्रियाओं का आकलन करने के लिए एलएलएम इवैल्यूएशन फ्रेमवर्क (LEAF) प्रस्तुत करता है, जो यह प्रकट करता है कि सटीकता, सांस्कृतिक उपयुक्तता और सुरक्षा में महत्वपूर्ण अंतराल के कारण केवल 35.1% प्रतिक्रियाएं ही "उचित" थीं, जिससे कम संसाधन वाले, संवेदनशील डोमेन में बेहतर मूल्यांकन मानदंडों की तत्काल आवश्यकता पर प्रकाश पड़ता है।

Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pu (…)2026-03-25