💬 NLP

FMI_SU_Yotkova_Kastreva at SemEval-2026 Task 13: Lightweight Detection of LLM-Generated Code via Stylometric Signals

यह शोध पत्र SemEval-2026 टास्क 13 सबटास्क A में LLM-जनरेटेड कोड का पता लगाने के लिए एक कम्प्यूटेशनल रूप से कुशल, CPU-आधारित दृष्टिकोण प्रस्तुत करता है, जो बड़े प्रीट्रेंड मॉडल्स पर निर्भर रहे बिना लगभग तात्कालिक इन्फरेंस प्राप्त करने के लिए लेंथ-रोबस्ट रेशियो-बेस्ड फीचर्स, पार्सिंग टूल्स और एक शैलो डिसीजन ट्री एवं ह्यूरिस्टिक रूल्स वाले कोड-बनाम-टेक्स्ट क्लासिफायर को जोड़ता है।

Elitsa Yotkova, Violeta Kastreva, Dimitar Dimitrov, Ivan Koychev, Preslav Nakov2026-05-07
💬 NLP

Are LLMs Ready for Conflict Monitoring? Empirical Evidence from West Africa

यह शोध पत्र अनुभवजन्य रूप से यह प्रदर्शित करता है कि जबकि डोमेन-अनुकूलित मॉडल पश्चिम अफ्रीकी संघर्ष निगरानी में मानकीय पूर्वाग्रह (normative bias) को कम करते हैं, वर्तमान एलएलएम (LLMs) निरंतर अभिनेता-आधारित चयन पूर्वाग्रहों, लेक्सिकल फ्रेमिंग के प्रति भौगोलिक भंगुरता और अविश्वसनीय तर्क संबंधी कल्पित सूचनाओं (unfaithful rationale confabulations) के कारण अनसुपरवाइज्ड परिनियोजन के लिए अनुपयुक्त बने हुए हैं।

Hoffmann Muki, Olukunle Owolabi2026-05-07
💬 NLP

MedFabric and EtHER: A Data-Centric Framework for Word-Level Fabrication Generation and Detection in Medical LLMs

यह शोध पत्र MedFabric को प्रस्तुत करता है, जो यथार्थवादी शब्द-स्तरीय चिकित्सा फैब्रिकेशन्स (fabrications) उत्पन्न करने के लिए एक डेटा-केंद्रित पाइपलाइन है, और ETHER को, जो इस डेटासेट का लाभ उठाकर मेडिकल LLM आउटपुट्स के भीतर सूक्ष्म तथ्यात्मक विचलन की पहचान करने में मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Si (…)2026-05-07
💬 NLP

Nsanku: Evaluating Zero-Shot Translation Performance of LLMs for Ghanaian Languages

यह शोधपत्र नसांकु (Nsanku) प्रस्तुत करता है, जो 43 घाना भाषाओं में 19 बड़े भाषा मॉडलों के ज़ीरो-शॉट अनुवाद प्रदर्शन का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि जेमिनी-2.5-फ्लैश (Gemini-2.5-flash) जैसे शीर्ष मॉडल मध्यम स्कोर प्राप्त करते हैं, लेकिन कोई भी वर्तमान मॉडल इन भाषाओं के लिए उच्च प्रदर्शन और निरंतरता को एक साथ प्रदर्शित नहीं करता है, जो यह संकेत देता है कि वे अभी तक इन भाषाओं में बड़े पैमाने पर अनुवाद के लिए विश्वसनीय रूप से उपयोग करने योग्य नहीं हैं।

Stephen E. Moore, Mich-Seth Owusu, Akwasi Asare, Lawrence Adu Gyamfi, Paul Azunre, Joel Budu, Jonathan Asiamah, Elias Dz (…)2026-05-07
🤖 machine learning

Jordan-RoPE: Non-Semisimple Relative Positional Encoding via Complex Jordan Blocks

यह शोध पत्र जॉर्डन-RoPE (Jordan-RoPE) को प्रस्तुत करता है, जो एक गैर-अर्द्ध-सरल (non-semisimple) सापेक्ष स्थिति संबंधी एन्कोडिंग है जो दूरी-मॉड्यूलेटेड चरण अंतःक्रियाओं (distance-modulated phase interactions) को मॉडल करने के लिए ऑसिलेटरी-पॉलीनोमियल (oscillatory-polynomial) विशेषताओं को उत्पन्न करने हेतु जटिल जॉर्डन ब्लॉकों का लाभ उठाता है, जो कुछ संदर्भों में मानक RoPE और ALiBi बेसलाइनों की तुलना में संरचनात्मक लाभ और विशिष्ट प्रदर्शन लाभ प्रदर्शित करता है।

Yaobo Zhang2026-05-07✓ Author reviewed
💬 NLP

Material Database Agent: A Multimodal Agentic Framework for Scientific Literature Mining

यह शोध पत्र मटेरियल डेटाबेस एजेंट (MDA) को प्रस्तुत करता है, जो एक मॉड्यूलर मल्टीमॉडल मल्टी-एजेंट फ्रेमवर्क है जो उत्पादन-स्तर के सामग्री डेटाबेस को कुशलतापूर्वक निर्मित करने के लिए वैज्ञानिक साहित्य की पीडीएफ से संरचित डेटा निकालने की प्रक्रिया को स्वचालित करता है।

Achuth Chandrasekhar, Omid Barati Farimani, Radheesh Sharma Meda, Amir Barati Farimani2026-05-07
💬 NLP

NoisyCausal: A Benchmark for Evaluating Causal Reasoning Under Structured Noise

यह शोध पत्र संरचित शोर (structured noise) के तहत कारण संबंधी तर्क (causal reasoning) के मूल्यांकन के लिए एक बेंचमार्क, NoisyCausal पेश करता है, और एक मॉड्यूलर ढांचे का प्रस्ताव करता है जो मजबूत और व्याख्या योग्य अनुमान प्राप्त करने के लिए प्राकृतिक भाषा प्रसंस्करण को स्पष्ट प्रतीकात्मक कारण ग्राफ संरचनाओं (explicit symbolic causal graph structures) के साथ जोड़कर LLM के प्रदर्शन को बढ़ाता है।

Zhi Xu, Yun Fu2026-05-07
🤖 machine learning

Budgeted LoRA: Distillation as Structured Compute Allocation for Efficient Inference

यह योगदान बजटेड लोरा (Budgeted LoRA) को प्रस्तुत करता है, जो एक डिस्टिलेशन फ्रेमवर्क है जो मॉडल संपीड़न को कम्प्यूटेशनल संसाधन आवंटन की एक संरचित समस्या के रूप में मानता है ताकि एक वैश्विक कम्प्यूटेशनल बजट के तहत डेंस और लो-रैंक पाथ्स के बीच क्षमता को गतिशील रूप से पुनर्वितरित करके स्पष्ट अनुमान दक्षता वाले स्टूडेंट मॉडल्स का उत्पादन किया जा सके।

Mohammed Sabry, Anya Belz2026-05-07
🤖 AI

Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs

कोरल (Coral) एक अनुकूलनशील, विषमता-जागरूक (heterogeneity-aware) मल्टी-एलएलएम (multi-LLM) सर्विंग सिस्टम है जो विविध क्लाउड जीपीयू (cloud GPUs) में संसाधन आवंटन और सर्विंग रणनीतियों को संयुक्त रूप से अनुकूलित करता है, जिससे तेज़, निकट-इष्टतम निर्णय लेने में सक्षम बनाने के लिए एक हानिरहित दो-चरणीय अपघटन (lossless two-stage decomposition) का उपयोग करके 2.79×\times लागत कमी और 2.39×\times उच्च गुडथ्रूप (goodput) प्राप्त होता है।

Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi2026-05-07
💬 NLP

Telegraph English: Semantic Prompt Compression via Structured Symbolic Rewriting

टेलीग्राफ इंग्लिश (TE) एक नवीन प्रॉम्प्ट-कंप्रेशन प्रोटोकॉल है जो प्राकृतिक भाषा को परमाणु तथ्य पंक्तियों के एक प्रतीक-समृद्ध, संरचित बोली में पुनर्गठित करता है, जो LLMLingua-2 जैसे मौजूदा टोकन-डिलीशन तरीकों की तुलना में विभिन्न मॉडलों में बेहतर सटीकता और सिमेंटिक इंडेक्सिंग क्षमताओं को प्राप्त करता है।

Mikhail L. Arbuzov, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey A. Shvets2026-05-07