💬 NLP

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

यह शोध पत्र लक्ष्य (target), हमलावर (attacker) और निर्णायक (jury) मॉडलों का उपयोग करते हुए एक नवीन बहु-भूमिका वाले रेड टीमिंग ढांचे को प्रस्तुत करता है जो बड़े भाषा मॉडलों (LLMs) में कमजोरियों का व्यवस्थित रूप से मूल्यांकन करने और उन्हें उजागर करने के लिए है, जो यह प्रदर्शित करता है कि आर्किटेक्चरल डिज़ाइन विकल्प विविध कार्यों और भाषाओं में सुरक्षा और निष्ठा (faithfulness) को महत्वपूर्ण रूप से प्रभावित करते हैं, साथ ही सूक्ष्म अननिष्ठता (unfaithfulness) का पता लगाने और क्रॉस-लिंग्विस्टिक प्रतिकूल जनरेशन (cross-linguistic adversarial generation) को पूरी तरह से स्वचालित करने में वर्तमान सीमाओं को भी रेखांकित करता है।

Abrar Alotaibi, Raed Mughus, Moataz Ahmed2026-06-25
💬 NLP

Spam and Sentiment Detection in Arabic Tweets Using MARBERT Model

यह अध्ययन सऊदी टेलीकॉम कंपनी (STC) के संबंध में 24,513 अरबी ट्वीट्स में स्पैम का पता लगाने और भावना (sentiment) का विश्लेषण करने के लिए MARBERT मॉडल का उपयोग करते हुए एक डीप लर्निंग दृष्टिकोण प्रस्तावित करता है, जिसका उद्देश्य बेहतर सेंटिमेंट क्लासिफिकेशन मेट्रिक्स के माध्यम से ग्राहक सेवा को बढ़ाना है।

Abrar Alotaibi, Atta-ur Rahman, Raheel Alhaza, Wala Alkhalifa, Narjes Alhajjaj, Atheer Alharthi, Dhai Abushoumi, Maryam (…)2026-06-25
🤖 AI

Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models

यह शोध पत्र प्रकट करता है कि रीजनिंग मॉडल्स का लो-बिट क्वांटाइजेशन, सटीकता को बनाए रखते हुए भी, अक्सर मध्यवर्ती चरणों और पुनरावृत्ति के माध्यम से चेन्स ऑफ थॉट (chains of thought) की लंबाई बढ़ाकर एक छिपी हुई लागत उत्पन्न करता है, जिससे अपेक्षित इन्फरेंस स्पीडअप (inference speedup) निष्प्रभावी हो जाता है और सटीकता मेट्रिक्स के साथ टोकन उपयोग की रिपोर्ट करना आवश्यक हो जाता है।

Xinyu Lian, Walid Krichene, Beichen Huang, Masahiro Tanaka, Olatunji Ruwase, Li Zhang, Minjia Zhang2026-06-25
🤖 AI

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

यह शोध पत्र एलएलएम (LLM) गणितीय तर्क में विफलता के सटीक सिंगल-टोकन ट्रिगर्स के रूप में "क्लिफ टोकन्स" (cliff tokens) को प्रस्तुत करता है, इन टोकन्स का एक वर्गीकरण प्रस्तावित करता है और यह प्रदर्शित करता है कि क्लिफ-डीपीओ (Cliff-DPO) के माध्यम से उन्हें अनुकूलित करने से विभिन्न बेंचमार्क पर मॉडल की सटीकता में महत्वपूर्ण सुधार होता है।

Jaeyong Ko, Pilsung Kang, Yukyung Lee2026-06-25
🤖 AI

The impact of artificial intelligence on enterprise software user roles

SAP के बिजनेस टेक्नोलॉजी प्लेटफॉर्म का यह गुणात्मक अध्ययन यह प्रकट करता है कि आर्टिफिशियल इंटेलिजेंस, कार्य स्वचालन (टास्क ऑटोमेशन) और एजेंटिक सहयोग के माध्यम से एंटरप्राइज सॉफ्टवेयर उपयोगकर्ता भूमिकाओं को मौलिक रूप से रूपांतरित कर रहा है, जिससे संशोधित भूमिका वर्गीकरण (रोल टैक्सोनॉमी), नए गवर्नेंस फ्रेमवर्क और AI-नेटिव सिस्टम के लिए अपडेटेड डिजाइन दृष्टिकोणों की आवश्यकता हो रही है।

Isabel Unger, Elizangela Valarini, Martin Schrepp, Nina Hollender, Gabriela Rocha, Erik Bertram2026-06-25
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

यह शोध पत्र SWE-Pro को प्रस्तुत करता है, जो 102 विशेषज्ञ अनुकूलनों (optimizations) से व्युत्पन्न एक कठोर रिपॉजिटरी-स्तरीय बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स वास्तविक दुनिया के सॉफ्टवेयर अनुकूलन में मानव-स्तर के प्रदर्शन के साथ मेल खाने में काफी विफल रहते हैं, और विशेषज्ञ इंजीनियरों द्वारा प्रदान की गई पर्याप्त गति वृद्धि (speedups) और मेमोरी कटौती की तुलना में नगण्य लाभ प्राप्त करते हैं।

Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen2026-06-25
💬 NLP

SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding

यह शोध पत्र SFL-MTSC का प्रस्ताव करता है, जो एक नवीन ढांचा है जो LLM भविष्यवाणियों को सिमेंटिक फ्रेम्स में विघटित करके, डोमेन-इंटेंट ग्रुपिंग और पाथ सपोर्ट स्कोरिंग के साथ स्लॉट-स्तरीय क्लस्टरिंग लागू करके, और डिकोडिंग स्टोकेस्टिसिटी (stochasticity) को हल करने और MAC-SLU बेंचमार्क पर प्रदर्शन में सुधार करने के लिए विश्वसनीय फ्रेम्स को पुन: एकीकृत करके मल्टी-इंटेंट स्पोकन लैंग्वेज अंडरस्टैंडिंग में मजबूती को बढ़ाता है।

Po-Yen Chen, Berlin Chen2026-06-25
💬 NLP

BiPACE: Bisimulation-Guided Policy Optimization with Action Counterfactual Estimation for LLM Agents

BiPACE एक ड्रॉप-इन एडवांटेज एस्टिमेटर पेश करता है जो लॉन्ग-होरिज़न LLM एजेंटों को प्रशिक्षित करने के लिए पॉलिसी-इंड्यूस्ड बिसिमिल्यूशन (policy-induced bisimulation) के माध्यम से स्टेप्स को क्लस्टर करके और एक्शन-कंडीशन्ड काउंटरफैक्चुअल बेसलाइन (action-conditioned counterfactual baselines) लागू करके ग्रुप-आधारित सुदृढीकरण शिक्षण (reinforcement learning) में स्टेट-एक्शन क्रेडिट मिसमैच को हल करता है, जिससे बिना किसी सीखे गए क्रिटिक या अतिरिक्त रोलआउट्स के GiGPO जैसी मौजूदा विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Hanyang Wang, Weijieying Ren, Yuxiang Zhang, Ding Cao, Zhizhao Zeng, Ke Zeng, Tianxiang Zhao2026-06-25
🤖 machine learning

TL++: Accuracy and Privacy Preserving Traversal Learning for Distributed Intelligent Systems

TL++ एक नवीन टू-मोड ट्रैवर्सल-लर्निंग फ्रेमवर्क है जो वितरित इंटेलिजेंट सिस्टम्स के लिए है, जो कट-लेयर एक्टिवेशन्स और ग्रेडिएंट्स की सीक्रेट-शेयरिंग के माध्यम से कम्युनिकेशन एफिशिएंसी और प्राइवेसी को संतुलित करते हुए वर्चुअल बैच कंस्ट्रक्शन के जरिए सेंट्रलाइज्ड मिनी-बैच ग्रेडिएंट व्यवहार को रिकवर करता है।

Erdenebileg Batbaatar, Young Yoon2026-06-25
🤖 AI

GUI agent: Guided Exploration of User-Sensitive Screens

यह शोध पत्र एक GUI एक्सप्लोरर एजेंट प्रस्तुत करता है जिसे उपयोगकर्ता-संवेदनशील स्क्रीन अवस्थाओं और प्रश्नों को व्यवस्थित रूप से पहचानने के लिए डिज़ाइन किया गया है, जो एजेंटों को महत्वपूर्ण परिदृश्यों को पहचानने और मानव उपयोगकर्ताओं को हैंडओवर (हस्तांतरण) का अनुरोध करने में सक्षम बनाकर वर्तमान LLM-संचालित एजेंटों की सुरक्षा सीमाओं को संबोधित करता है।

Aradhana Nayak, Mussadiq Nazeer, Wang Peng, Feng Liu2026-06-25