💬 NLP

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

यह शोध पत्र प्रकट करता है कि LLM जेलब्रेक सफलता दर को मापने के लिए उपयोग किए जाने वाले स्वचालित जज अत्यधिक अविश्वसनीय हैं, जिसमें समर्पित क्लासिफायर ओवर-फ्लैगिंग के प्रति प्रवृत्त होते हैं और LLM-एज़-जज अस्थिर रिकॉल तथा प्रतिकूल फ्रेमिंग (adversarial framing) के प्रति अत्यधिक संवेदनशील होते हैं, जिससे जज प्रदर्शन मेट्रिक्स और प्रतिकूल मजबूती (adversarial robustness) जांच के मानकीकृत रिपोर्टिंग की आवश्यकता उत्पन्न होती है।

Yang Gao (Veyon Solutions)2026-06-25
💬 NLP

Spam and Sentiment Detection in Arabic Tweets Using MARBERT Model

यह अध्ययन सऊदी टेलीकॉम कंपनी (STC) के संबंध में 24,513 अरबी ट्वीट्स में स्पैम का पता लगाने और भावना (sentiment) का विश्लेषण करने के लिए MARBERT मॉडल का उपयोग करते हुए एक डीप लर्निंग दृष्टिकोण प्रस्तावित करता है, जिसका उद्देश्य बेहतर सेंटिमेंट क्लासिफिकेशन मेट्रिक्स के माध्यम से ग्राहक सेवा को बढ़ाना है।

Abrar Alotaibi, Atta-ur Rahman, Raheel Alhaza, Wala Alkhalifa, Narjes Alhajjaj, Atheer Alharthi, Dhai Abushoumi, Maryam (…)2026-06-25
💬 NLP

Fault of Our Stars: Behavioral Drivers of Rating-Sentiment Incongruence

यह अध्ययन श्रीलंकाई पर्यटन समीक्षाओं का विश्लेषण करता है जिससे यह स्पष्ट होता है कि विशिष्ट व्यवहारिक पैटर्न और प्रासंगिक कारकों के कारण स्टार रेटिंग अक्सर पाठ्य भावना (टेक्स्टुअल सेंटीमेंट) से भिन्न होती है, जो यह दर्शाता है कि रेटिंग को भावना विश्लेषण के लिए स्वचालित रूप से ग्राउंड-ट्रुथ लेबल के रूप में नहीं माना जाना चाहिए।

Ramanaish Abaiyan, Ruththiragayan Sutharsan, Kusal Amantha, Anusan Krishnathas, Asma Rauff, Kovindarajah Sriyathurshan (…)2026-06-25
🤖 AI

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

यह शोध पत्र एलएलएम (LLM) गणितीय तर्क में विफलता के सटीक सिंगल-टोकन ट्रिगर्स के रूप में "क्लिफ टोकन्स" (cliff tokens) को प्रस्तुत करता है, इन टोकन्स का एक वर्गीकरण प्रस्तावित करता है और यह प्रदर्शित करता है कि क्लिफ-डीपीओ (Cliff-DPO) के माध्यम से उन्हें अनुकूलित करने से विभिन्न बेंचमार्क पर मॉडल की सटीकता में महत्वपूर्ण सुधार होता है।

Jaeyong Ko, Pilsung Kang, Yukyung Lee2026-06-25
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

यह शोध पत्र SWE-Pro को प्रस्तुत करता है, जो 102 विशेषज्ञ अनुकूलनों (optimizations) से व्युत्पन्न एक कठोर रिपॉजिटरी-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स वास्तविक दुनिया के सॉफ्टवेयर अनुकूलन में मानव-स्तर के प्रदर्शन के साथ मेल खाने में काफी विफल रहते हैं, और विशेषज्ञ इंजीनियरों द्वारा प्रदान की गई पर्याप्त गति वृद्धि (speedups) और मेमोरी कटौती की तुलना में नगण्य लाभ प्राप्त करते हैं।

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen2026-06-25
💬 NLP

SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding

यह शोध पत्र SFL-MTSC का प्रस्ताव करता है, जो एक नवीन ढांचा है जो LLM भविष्यवाणियों को सिमेंटिक फ्रेम्स में विघटित करके, डोमेन-इंटेंट ग्रुपिंग और पाथ सपोर्ट स्कोरिंग के साथ स्लॉट-स्तरीय क्लस्टरिंग लागू करके, और डिकोडिंग स्टोकेस्टिसिटी (stochasticity) को हल करने और MAC-SLU बेंचमार्क पर प्रदर्शन में सुधार करने के लिए विश्वसनीय फ्रेम्स को पुन: एकीकृत करके मल्टी-इंटेंट स्पोकन लैंग्वेज अंडरस्टैंडिंग में मजबूती को बढ़ाता है।

Po-Yen Chen, Berlin Chen2026-06-25
💬 NLP

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao2026-06-25
💬 NLP

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

यह शोध पत्र MedGuards को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो विशिष्ट एजेंटों और एक कॉन्फिडेंस-गाइडेड आर्बिट्रेशन मैकेनिज्म के माध्यम से चिकित्सा त्रुटियों का पता लगाने, उन्हें स्थानीयकृत करने और सुधारने के द्वारा स्वास्थ्य सेवा में लार्ज लैंग्वेज मॉडल्स की सुरक्षा को बढ़ाता है, साथ ही महत्वपूर्ण कीवर्ड सटीकता का बेहतर मूल्यांकन करने के लिए एक नया कीवर्ड-प्रायोरिटाइज्ड करेक्शन स्कोर (KPCS) मेट्रिक भी प्रस्तावित करता है।

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout2026-06-25
💬 NLP

BitNet Text Embeddings

BITEMBED एक अत्यंत लो-बिट फ्रेमवर्क है जो प्रीट्रेनड LLM बैकबोन्स को टर्नरी-वेट, क्वांटाइज़्ड-एक्टिवेशन एम्बेडिंग एनकोडर्स में परिवर्तित करता है और उन्हें डिस्टिलेशन तकनीकों के साथ प्रशिक्षित करता है ताकि लचीले मल्टी-प्रिसिजन आउटपुट एम्बेडिंग्स के माध्यम से स्टोरेज और बैंडविड्थ लागतों को काफी कम करते हुए फुल-प्रिसिजन-लेवल प्रदर्शन प्राप्त किया जा सके।

Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Z (…)2026-06-25
💬 NLP

Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution

यह शोध पत्र TRACE को प्रस्तुत करता है, जो एक हल्का ढांचा (lightweight framework) है जो सहायक क्लासिफायर या महत्वपूर्ण कम्प्यूटेशनल ओवरहेड की आवश्यकता के बिना, टोकन प्रभाव (token influence) को एट्रिब्यूट करके दुर्भावनापूर्ण दस्तावेजों की पहचान करने और लक्षित उत्तरों का पता लगाने द्वारा रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम में कॉर्पस पॉइजनिंग हमलों का पता लगाता है।

Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee2026-06-25