🤖 AI

Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone

यह शोध पत्र तर्क देता है कि परिनियोजन-प्रासंगिक संरेखण (deployment-relevant alignment) को केवल मॉडल-स्तरीय मूल्यांकनों से निष्कर्षित नहीं किया जा सकता है, जो ऑडिट और स्ट्रेस टेस्ट के माध्यम से यह प्रदर्शित करता है कि वर्तमान बेंचमार्क में उपयोगकर्ता-केंद्रित सत्यापन और प्रक्रियात्मक नियंत्रण (process steerability) का अभाव है, जिससे अंततः उन सिस्टम-स्तरीय मूल्यांकन ढांचों की ओर बढ़ने की आवश्यकता उत्पन्न होती है जो स्पष्ट रूप से संवादात्मक संदर्भों और स्कैफोल्ड निर्भरताओं (scaffold dependencies) को ध्यान में रखते हैं।

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-07
🤖 machine learning

Stabilizing LLM Supervised Fine-Tuning via Explicit Distributional Control

यह योगदान एंकोर्ड लर्निंग (Anchored Learning) को प्रस्तुत करता है, जो वितरण विचलन (distribution drift) को नियंत्रित करने के लिए एक गतिशील रूप से विकसित होते मूविंग एंकर (moving anchor) का उपयोग करके एलएलएम (LLM) के सुपरवाइज्ड फाइन-ट्यूनिंग में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को कम करता है, जिससे मानक विधियों की तुलना में क्षमता क्षरण को काफी कम करते हुए लगभग इष्टतम प्रदर्शन लाभ प्राप्त होता है।

Xinyu Wang, Changzhi Sun, Yuanbin Wu, Xiaoling Wang2026-05-07
🤖 AI

CCL-D: A High-Precision Diagnostic System for Slow and Hang Anomalies in Large-Scale Model Training

यह शोध पत्र CCL-D प्रस्तुत करता है, जो एक उच्च-परिशुद्धता वाला नैदानिक तंत्र है जो एक हल्के रियल-टाइम प्रोब को एक इंटेलिजेंट एनालाइज़र के साथ जोड़ता है ताकि बड़े पैमाने पर वितरित प्रशिक्षण (डिस्ट्रीब्यूटेड ट्रेनिंग) में धीमी या हैंगिंग संचार विसंगतियों के मूल कारणों का तेजी से पता लगाया जा सके और उन्हें सटीक रूप से पहचाना जा सके, जिससे 4,000-GPU क्लस्टर पर छह मिनट के भीतर दोषपूर्ण GPU रेंक्स की पहचान करने और लगभग पूर्ण कवरेज प्राप्त करने में सफलता मिली है।

Yida Gu, Fakang Wang, Jianhao Fu, Zhenhang Sun, Qianyu Zhang, Hairui Zhao, Xingchen Liu, Yang Tian, Wenjing Huang, Zedon (…)2026-05-07
🤖 AI

How Does Thinking Mode Change LLM Moral Judgments? A Controlled Instant-vs-Thinking Comparison Across Five Frontier Models

यह अध्ययन पाता है कि जबकि फ्रंटियर एलएलएम (LLM) में तर्क करने के तरीकों को सक्षम करने से उनके समग्र बाइनरी नैतिक निर्णयों में महत्वपूर्ण बदलाव नहीं आता है, यह विशिष्ट विवादास्पद परिदृश्यों में क्रॉस-मॉडल असहमति और जनसांख्यिकीय विसंगतियों को उल्लेखनीय रूप से कम करता है और साथ ही मॉडलों के स्व-लेबल नैतिक ढांचों को अधिक बार स्थानांतरित करता है।

Sai Sourabh Madur2026-05-07
🤖 AI

Pen-Strategist: A Reasoning Framework for Penetration Testing Strategy Formation and Analysis

पेन-स्ट्रैटेजिस्ट (Pen-Strategist) फ्रेमवर्क एक फाइन-ट्यून्ड रीजनिंग मॉडल और एक सिमेंटिक क्लासिफायर पेश करके कुशल साइबर सुरक्षा पेशेवरों की कमी को संबोधित करता है जो पेनिट्रेशन टेस्टिंग रणनीतियां तैयार करने, कार्रवाई योग्य कदम चुनने और असुरक्षित मशीनों पर उप-कार्यों (subtasks) को पूरा करने में मौजूदा बेसलाइन्स और कमर्शियल एलएलएम (LLMs) की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Yasod Ginige, Pasindu Marasinghe, Sajal Jain, Suranga Seneviratne2026-05-07
💬 NLP

SpecPL: Disentangling Spectral Granularity for Prompt Learning

SpecPL एक नवीन प्रॉम्प्ट-लर्निंग फ्रेमवर्क पेश करता है जो विजन-लैंग्वेज मॉडल्स में मोडैलिटी विषमता (modality asymmetry) को पाटने के लिए काउंटरफैक्चुअल ग्रैनुलैरिटी सुपरविजन के माध्यम से स्पेक्ट्रल ग्रैनुलैरिटी को डिकपल करता है, जो विजुअल गाइडेंस के साथ टेक्स्ट-ओरिएंटेड बेसलाइन मॉडल्स को पुनर्जीवित करके 11 बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jingtao Zhou, Xirui Kang, Feiyang Huang, Lai-Man Po2026-05-07
⚡ electrical engineering

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

JASTIN एक नवीन, निर्देश-संचालित ढांचा है जो विविध ऑडियो और स्पीच सामग्री के अत्याधुनिक ज़ीरो-शॉट मूल्यांकन को प्राप्त करने के लिए बड़े भाषा मॉडलों को फ्रोजन ऑडियो एनकोडर के साथ संरेखित करता है, जो मूल्यांकन को एक स्व-निर्देशित तर्क कार्य के रूप में तैयार करता है।

Leying Zhang, Bowen Shi, Haibin Wu, Bach Viet Do, Yanmin Qian2026-05-07
💬 NLP

RaguTeam at SemEval-2026 Task 8: Meno and Friends in a Judge-Orchestrated LLM Ensemble for Faithful Multi-Turn Response Generation

RaguTeam के SemEval-2026 टास्क 8 के लिए विजेता सिस्टम ने, जो सबसे अच्छे रिस्पॉन्स को चुनने के लिए GPT-4o-mini जज द्वारा ऑर्केस्ट्रेटेड सात LLMs के एक हेट्रोजेनियस एनसेम्बल का उपयोग करता है, सबसे मजबूत बेसलाइन से काफी बेहतर प्रदर्शन करते हुए और लागत प्रभावी Meno-Lite-0.1 मॉडल को पेश करते हुए और टास्क की एनोटेशन सीमाओं की आलोचना करते हुए प्रथम स्थान प्राप्त किया।

Ivan Bondarenko, Roman Derunets, Oleg Sedukhin, Mikhail Komarov, Ivan Chernov, Mikhail Kulakov2026-05-07
🤖 AI

SADE: Symptom-Aware Diagnostic Escalation for LLM-Based Network Troubleshooting

यह शोध पत्र SADE को प्रस्तुत करता है, जो एक LLM-आधारित नेटवर्क ट्रबलशूटिंग एजेंट है जो साक्ष्य प्राप्ति (evidence acquisition) को परिकल्पना प्रतिबद्धता (hypothesis commitment) से अलग करने के लिए क्लासिकल सिस्को पद्धति को एक स्पष्ट, चरण-बद्ध नीति (phase-gated policy) में एनकोड करता है, जिससे NIKA बेंचमार्क पर मौजूदा बेसलाइन की तुलना में रूट-कॉज़ F1 स्कोर में 37 प्रतिशत अंक का महत्वपूर्ण सुधार प्राप्त होता है।

Kuan-Hao Tseng, Niruth Bogahawatta, Yasod Ginige, Kosta Dekic, Arunan Sivanathan, Suranga Seneviratne2026-05-07
💬 NLP

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM एक हाइब्रिड-DPO ढांचे को पेश करके मानक डायरेक्ट प्रिफरेंस ऑप्टिमाइजेशन (Direct Preference Optimization) में वर्बोसिटी बायस (verbosity bias) और लॉजिकल एलाइनमेंट गैप्स (logical alignment gaps) को संबोधित करता है जो विविध शैक्षणिक डोमेन और मॉडल आर्किटेक्चर में लॉजिकल करेक्टनेस (logical correctness) और आंसर कवरेज (answer coverage) में महत्वपूर्ण सुधार प्राप्त करने के लिए NLI सिग्नल्स को वर्िफायर LLM स्कोर्स के साथ जोड़ता है और मानव एनोटेशन की आवश्यकता को समाप्त करता है।

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock2026-05-07