💬 NLP

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

यह शोध पत्र ToolFlood को प्रस्तुत करता है, जो एक नवीन रिट्रीवल-लेयर हमला है जो प्रतिकूल रूप से तैयार किए गए उपकरणों के एक छोटे सेट को इंजेक्ट करके टूल-ऑगमेंटेड LLM एजेंटों से समझौता करता है, जो विविध उपयोगकर्ता प्रश्नों को अर्थपूर्ण रूप से कवर करते हैं ताकि शीर्ष-k रिट्रीवल परिणामों पर प्रभुत्व जमाया जा सके और सभी सौहार्दपूर्ण (benign) उपकरणों को विस्थापित किया जा सके, जिससे न्यूनतम इंजेक्शन दरों के साथ 95% तक हमले की सफलता प्राप्त होती है।

Hussein Jawad, Nicolas J-B Brunel2026-03-17
🤖 AI

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

यह शोध पत्र सुपरवाइज्ड फाइन-ट्यूनिंग (Supervised Fine-Tuning) और रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) की विशिष्ट किंतु परस्पर जुड़ी भूमिकाओं का व्यापक विश्लेषण करते हुए, उनके हाइब्रिड एकीकरण की खोज करते हुए, और हालिया अनुभवजन्य साक्ष्यों के आधार पर प्रभावी अनुप्रयोग के लिए प्रमुख रुझानों और सर्वोत्तम प्रथाओं की पहचान करते हुए, लार्ज लैंग्वेज मॉडल (Large Language Model) पोस्ट-ट्रेनिंग के लिए एक एकीकृत ढांचे को प्रस्तुत करता है।

Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song2026-03-17
💬 NLP

Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs

यह शोध पत्र INSES को प्रस्तुत करता है, जो एक हाइब्रिड फ्रेमवर्क है जो शोर वाले और विरल (sparse) नॉलेज ग्राफ पर मजबूत मल्टी-हॉप रीजनिंग सक्षम करने के लिए LLM-निर्देशित नेविगेशन, एम्बेडिंग-आधारित समानता विस्तार और एक लाइटवेट राउटर को जोड़ता है, जो मौजूदा GraphRAG और RAG बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

Hang Gao, Dimitris N. Metaxas2026-03-17
💬 NLP

The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QA

यह शोध पत्र पहचानता है कि ग्राफ-RAG सिस्टम मुख्य रूप से रिट्रीवल (retrieval) समस्याओं के बजाय रीजनिंग बॉटलनेक्स (reasoning bottlenecks) के कारण विफल होते हैं, और मल्टी-हॉप QA सटीकता को महत्वपूर्ण रूप से बढ़ाने के लिए SPARQL चेन-ऑफ-थॉट प्रॉम्प्टिंग को ग्राफ-वॉक कॉन्टेक्स्ट कंप्रेशन के साथ संयोजित करने का प्रस्ताव देता है, जिससे छोटे, लागत प्रभावी मॉडल बड़े बेसलाइन को पछाड़ने में सक्षम होते हैं।

Yasaman Zarinkia, Venkatesh Srinivasan, Alex Thomo2026-03-17
🤖 machine learning

Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors

यह शोध पत्र ट्रांसफॉर्मर मॉडलों में स्पष्ट रूप से अनावश्यक दिखने वाले अमूर्त (abstract) फीचर्स के उद्भव को नेक्स्ट-टोकन प्रेडिक्शन ग्रेडिएंट के विशिष्ट घटकों तक ट्रैक करने की एक विधि प्रस्तावित करता है, जिससे यह प्रकट होता है कि ऐसे फीचर्स अक्सर वर्ल्ड मॉडलिंग, सिंटैक्स और औपचारिक तर्क (formal reasoning) जैसी जटिल क्षमताओं का आधार बनते हैं।

Mark Rofin, Jalal Naghiyev, Michael Hahn2026-03-17
💬 NLP

OasisSimp: An Open-source Asian-English Sentence Simplification Dataset

यह शोधपत्र OasisSimp को प्रस्तुत करता है, जो पाँच एशियाई भाषाओं (जिनमें तीन ऐसी भाषाएँ शामिल हैं जिनके लिए पहले कोई डेटासेट उपलब्ध नहीं था) को कवर करने वाला एक नया ओपन-सोर्स बहुभाषी वाक्य सरलीकरण डेटासेट है, जो एक मूल्यवान संसाधन और एक चुनौतीपूर्ण बेंचमार्क दोनों के रूप में कार्य करता है ताकि कम-संसाधन वाली स्थितियों में वर्तमान बड़े भाषा मॉडलों के प्रदर्शन की असमानताओं और सीमाओं को प्रकट किया जा सके।

Hannah Liu, Muxin Tian, Iqra Ali, Haonan Gao, Qiaoyiwen Wu, Blair Yang, Uthayasanker Thayasivam, En-Shiun Annie Lee, Pak (…)2026-03-17
💬 NLP

The GELATO Dataset for Legislative NER

यह शोध पत्र GELATO प्रस्तुत करता है, जो 118वीं कांग्रेस के अमेरिकी विधायी विधेयकों का एक नवीन डेटासेट है जिसे टू-लेवल ऑन्टोलॉजी के साथ एनोटेट किया गया है, और यह प्रदर्शित करता है कि फाइन-ट्यून्ड RoBERTa मॉडल LLMs के संयोजन के साथ विधायी नामित इकाई पहचान (नेमड एंटिटी रिकग्निशन) प्रभावी ढंग से करते हैं।

Matthew Flynn, Timothy Obiso, Sam Newman2026-03-17
💬 NLP

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

यह शोध पत्र MMOU को प्रस्तुत करता है, जो सर्व-मोडल (दृश्य, श्रव्य और पाठ्य) तर्क क्षमता का मूल्यांकन करने के लिए 9038 विविध दीर्घ-रूप वीडियो में 15,000 प्रश्नों वाला एक व्यापक बेंचमार्क है, जो वर्तमान अत्याधुनिक मल्टीमॉडल मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल और व्यवस्थित विफलता मोड को प्रकट करता है।

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, J (…)2026-03-17
💬 NLP

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

यह शोध पत्र एक मल्टीमॉडल, साइटेशन-अनिवार्य रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) फ्रेमवर्क प्रस्तुत करता है जिसे टैक्स अनुपालन में व्याख्यात्मकता और ऑडिटेबिलिटी को बढ़ाने के लिए डिज़ाइन किया गया है, जो वित्तीय दस्तावेज़ विश्लेषण में मतिभ्रम (hallucinations) को कम करने के लिए स्रोत निष्ठा, पृष्ठ-स्तरीय प्रोवेनेंस और साक्ष्य-आधारित परहेज को प्राथमिकता देता है।

Akhil Chandra Shanivendra2026-03-17
💬 NLP

Selective Fine-Tuning of GPT Architectures for Parameter-Efficient Clinical Text Classification

यह अध्ययन एक पैरामीटर-कुशल चयनात्मक फाइन-ट्यूनिंग फ्रेमवर्क का प्रस्ताव करता है जो केवल GPT-2 के अंतिम ट्रांसफॉर्मर ब्लॉक, लेयर नॉर्मलाइजेशन और क्लासिफिकेशन हेड को अपडेट करता है, जिससे मॉडल के 6% से भी कम पैरामीटर्स को प्रशिक्षित करते हुए रेडियोलॉजी रिपोर्ट वर्गीकरण पर लगभग 91% सटीकता प्राप्त होती है।

Fariba Afrin Irany, Sampson Akwafuo2026-03-17