💬 NLP

TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

यह शोध पत्र TukaBench प्रस्तुत करता है, जो सात अफ्रीकी भाषाओं के लिए एक सांस्कृतिक रूप से आधारित जेलब्रेक बेंचमार्क है, जो यह प्रकट करता है कि कैसे सांस्कृतिक रूप से अनुकूलित और कोड-स्विच्ड प्रॉम्प्ट्स, अंग्रेजी की तुलना में मॉडल रिफ्यूज़ल दरों को काफी कम कर देते हैं, और साथ ही मॉडल समझ में महत्वपूर्ण सीमाओं और कम-संसाधन वाली भाषाओं के लिए LLM-as-a-judge मूल्यांकन की विश्वसनीयता को भी उजागर करता है।

Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani2026-06-02
💬 NLP

DiffuSent: Towards a Unified Diffusion Framework for Aspect-Based Sentiment Analysis

DiffuSent एक एकीकृत, गैर-ऑटो-रिग्रेसिव डिफ्यूजन फ्रेमवर्क है जो एस्पेक्ट-बेस्ड सेंटीमेंट एनालिसिस के लिए सभी उप-कार्यों को बाउंड्री डिनोइजिंग प्रक्रियाओं के रूप में पुनर्गठित करता है और मल्टी-वर्ड टर्म्स पर बेहतर सटीकता प्राप्त करने के लिए एक कंट्रास्टिव ट्रेनिंग स्ट्रैटेजी का उपयोग करता है तथा मौजूदा जनरेटिव और स्पैन-बेस्ड सिस्टम की तुलना में काफी तेज़ इन्फरेंस प्रदान करता है।

Shu Long, Yanglei Gan, Xuchuan Zhou2026-06-02
💬 NLP

LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning

LongAttnComp एक दो-चरणीय फाइन-ट्यून्ड, ट्रेनिंग-मुक्त संदर्भ संपीड़न (context compression) फ्रेमवर्क है जो एक हल्के क्रॉस-अटेंशन स्कोरर और विशिष्ट टोकन-स्तरीय रणनीतियों का लाभ उठाता है ताकि विविध मॉडल परिवारों में, विशेष रूप से कोड डिबगिंग और बहु-दस्तावेज़ कार्यों में, लंबी-संदर्भ तर्क सटीकता और दक्षता में महत्वपूर्ण सुधार किया जा सके।

Mengmeng Ji, Ravi Shanker Raju, Jonathan Lingjie Li, Chen Wu2026-06-02
💬 NLP

Benchmarking Local LLMs for Natural-Language-to-SQL Querying in Biopharmaceutical Manufacturing: An Empirical Benchmark on Consumer-Grade Hardware

यह अध्ययन प्रदर्शित करता है कि स्थानीय रूप से तैनात, कोड-ट्यून्ड सामान्य-उद्देश्य वाले LLMs (विशेष रूप से Qwen 2.5 Coder 7B और Llama 3.1 8B), उपभोक्ता-ग्रेड हार्डवेयर पर बायोफार्मास्युटिकल मैन्युफैक्चरिंग के लिए अनुपालन योग्य SQL क्वेरी उत्पन्न करने में डोमेन-विशिष्ट बायोमेडिकल मॉडलों से बेहतर प्रदर्शन करते हैं, हालांकि विनियमित अनुप्रयोगों के लिए मानवीय निरीक्षण आवश्यक बना हुआ है।

Sagar Bhetwal, Rajan Bastakoti, Nirajan Acharya, Gaurav Kumar Gupta2026-06-02
🤖 AI

GuidaPA: Privacy-Preserving Chatbot for Public Administration via Federated Learning

यह शोध पत्र GuidaPA प्रस्तुत करता है, जो इतालवी सार्वजनिक प्रशासन के लिए एक गोपनीयता-संरक्षित चैटबॉट है, जो संवेदनशील आंतरिक दस्तावेज़ों पर उच्च गुणवत्ता वाला संवादात्मक प्रदर्शन प्राप्त करने के लिए सेंट्रलाइज्ड डेटा शेयरिंग की आवश्यकता के बिना फेडरेटेड लर्निंग और QLoRA फाइन-ट्यूनिंग का उपयोग करता है।

Daniel M. Jimenez-Gutierrez, Albenzio Cirillo, Raffaele Nicolussi, Alessio Beltrame, Andrea Vitaletti2026-06-02
💬 NLP

Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs

यह शोध पत्र LLM बेंचमार्क से विविध, गैर-अतिरेकी प्रॉम्प्ट उपसमुच्चयों (subsets) का चयन करने के लिए मैक्सिमम इंडिपेंडेंट सेट एल्गोरिदम का उपयोग करने वाले एक ग्राफ-आधारित ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि ऐसे कम किए गए सेट मॉडल रैंकिंग को अत्यधिक सुसंगत बनाए रखते हुए मूल्यांकन लागत को काफी कम कर देते हैं।

Denica Kjorvezir, Marko Djukanović, Ana Gjorgjevikj, Gjorgjina Cenikj, Tome Eftimov2026-06-02
💬 NLP

DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering

यह शोध पत्र DrugClaw को प्रस्तुत करता है, जो एक मल्टी-एजेंट रिट्रीवल-ऑगमेंटेड सिस्टम है जो प्राथमिक नियामक या सहकर्मी-समीक्षित स्रोतों पर आधारित दवा संबंधी सूचनात्मक उत्तर उत्पन्न करता है, और नए अथॉरिटी-अवेयर DrugAudit बेंचमार्क का उपयोग करके मौजूदा मॉडलों के विरुद्ध सटीकता, स्रोत निष्ठा और साक्ष्य गुणवत्ता में अपने बेहतर प्रदर्शन को प्रमाणित करता है।

Qing Wang, Bo Li, Jialu Liang, Daling Shi, Bob Zhang, Qianqian Song2026-06-02
🤖 AI

Don't Ask the LLM to Track Freshness: A Deterministic Recipe for Memory Conflict Resolution

यह शोध पत्र तर्क देता है कि विरोधाभासी तथ्यों को हल करने के लिए एलएलएम-आधारित मेमोरी सिस्टम में प्राथमिक बाधा स्टोरेज नहीं बल्कि पोस्ट-रिट्रीवल असेंबली चरण है, यह प्रदर्शित करते हुए कि एलएलएम-मध्यस्थ निर्णय को एक नियतात्मक, संस्करण-जागरूक एकत्रीकरण पद्धति (जैसे, उच्चतम सीरियल नंबर वाले तथ्य का चयन करना) से बदलने से संघर्ष समाधान कार्यों पर मौजूदा अत्याधुनिक प्रणालियों की तुलना में काफी बेहतर प्रदर्शन होता है।

Vikas Reddy, Sumanth Challaram2026-06-02
💬 NLP

Learning from Saturated Data: Signals Beyond Correctness for LLM Training

यह शोध पत्र यह प्रदर्शित करता है कि जहाँ बाइनरी शुद्धता (binary correctness) को पेयरवाइज़ सेल्फ-जजमेंट (pairwise self-judgments) और टोकन-लेवल एंट्रॉपी (token-level entropy) जैसे सूक्ष्म गुणवत्ता संकेतों से बदलना संतृप्त डेटा (saturated data) का उपयोग करके सरल अंकगणितीय कार्यों पर LLM के प्रदर्शन में महत्वपूर्ण सुधार कर सकता है, वहीं इन संकेतों को GSM8K जैसे जटिल कार्यों के लिए सावधानीपूर्वक कैलिब्रेशन की आवश्यकता होती है ताकि प्रदर्शन में गिरावट से बचा जा सके।

Hanno Hiss, Jasper Dekoninck, Martin Vechev2026-06-02
💬 NLP

Before and After Temperature: A Distributional View of Creative LLM Generation

यह शोधपत्र यह प्रदर्शित करता है कि एक नवीन संदर्भ-मुक्त (reference-free) मीट्रिक, जो यह मात्रा निर्धारित करता है कि जनरेशन से पूर्व सैंपलिंग टेम्परेचर (sampling temperature) एक LLM के टोकन वितरण को कैसे नया रूप देता है, LLM जजों के विरुद्ध 0.918 और मानव रैंकिंग के विरुद्ध 0.870 का स्पीयरमैन सहसंबंध (Spearman correlation) प्राप्त करके रचनात्मक गुणवत्ता की भविष्यवाणी करने में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करता है।

V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal, S. Shria Parupudi, Saiteja Dasari, Sahiti Bulusu2026-06-02