📊 statistics

Randomized PCA Forest for Unsupervised Outlier Detection

यह शोधपत्र 'रैंडमाइज्ड पीसीए फॉरेस्ट' (Randomized PCA Forest) नामक एक नवीन अनसुपरवाइज्ड आउटलियर डिटेक्शन विधि प्रस्तावित करता है, जो आउटलियर स्कोर प्राप्त करने के लिए अनुमानित K-निकटतम पड़ोसी (K-Nearest Neighbor) खोज हेतु रैंडमाइज्ड पीसीए के अंतर्निहित गुणों का लाभ उठाता है, और विभिन्न डेटासेट्स पर शास्त्रीय एवं अत्याधुनिक दृष्टिकोणों की तुलना में बेहतर प्रदर्शन और कम्प्यूटेशनल दक्षता प्रदर्शित करता है।

Muhammad Rajabinasab, Farhad Pakdaman, Moncef Gabbouj, Peter Schneider-Kamp, Arthur Zimek2026-05-12
🤖 machine learning

EventTSF: Event-Aware Non-Stationary Time Series Forecasting

EventTSF एक ऑटोरेग्रेसिव डिफ्यूजन फ्रेमवर्क है जो इवेंट-अवेयर फ्लो-मैचिंग टाइमस्टेप्स के माध्यम से टेक्स्टुअल इवेंट डेटा को एकीकृत करके नॉन-स्टेशनरी टाइम सीरीज़ फोरकास्टिंग में सुधार करता है, जिससे मल्टीमॉडल इंटरैक्शन और इम्बैलेंस्ड डिनोइजिंग कठिनाई की चुनौतियों का समाधान होता है और मौजूदा बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करता है।

Yunfeng Ge, Ming Jin, Yiji Zhao, Hongyan Li, Bo Du, Chang Xu, Shirui Pan2026-05-12
🤖 machine learning

Multimodal Representation Learning Conditioned on Semantic Relations

यह शोध पत्र रिलेशन-कंडीशन्ड मल्टीमॉडल लर्निंग (RCML) का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो विभिन्न रिट्रीवल और क्लासिफिकेशन कार्यों में CLIP जैसे पारंपरिक रिलेशन-एग्नोस्टिक मॉडल्स से बेहतर प्रदर्शन करने के लिए नेचुरल-लैंग्वेज सिमेंटिक रिलेशंस पर आधारित कॉन्टेक्स्ट-अवेयर मल्टीमॉडल एम्बेडिंग्स जनरेट करता है।

Yang Qiao, Yuntong Hu, Bowen Zhu, Hasibul Haque, Liang Zhao2026-05-12
🤖 AI

GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs

यह शोधपत्र GUARD को प्रस्तुत करता है, जो एक ऐसा परीक्षण ढांचा है जो उच्च-स्तरीय सरकारी नैतिकता दिशानिर्देशों को कार्रवाई योग्य प्रश्नों में क्रियान्वित करता है और बड़े भाषा मॉडलों (LLMs) तथा विज़न-लैंग्वेज मॉडलों (VLMs) की अनुपालन और सुरक्षा सुदृढ़ता का व्यवस्थित रूप से मूल्यांकन और रिपोर्ट करने के लिए जेलब्रेक डायग्नोस्टिक्स को एकीकृत करता है।

Haibo Jin, Ruoxi Chen, Peiyan Zhang, Andy Zhou, Zelei Cheng, Haohan Wang2026-05-12
🤖 AI

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

यह शोध पत्र Scam2Prompt को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो प्रोडक्शन लार्ज लैंग्वेज मॉडल्स में एक गंभीर और बिगड़ती सुरक्षा भेद्यता को उजागर करता है, जहाँ दुर्भावनापूर्ण स्कैम साइटों से प्राप्त स्वचालित प्रॉम्प्ट कई मॉडल्स में 47.3% मामलों तक हानिकारक कोड उत्पन्न करने में सफलतापूर्वक ट्रिगर करते हैं, जिससे गार्डरेल्स और RAG जैसे वर्तमान सुरक्षा उपाय अपर्याप्त हो जाते हैं।

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long2026-05-12✓ Author reviewed
📊 statistics

Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation

यह शोध पत्र टॉप-एच (Top-H) डिकोडिंग को प्रस्तुत करता है, जो एक एंट्रॉपी-प्रतिबंधित मास मैक्सिमाइजेशन फ्रेमवर्क पर आधारित एक नवीन सैंपलिंग एल्गोरिदम है जो लार्ज लैंग्वेज मॉडल्स में रचनात्मकता और सुसंगतता के बीच प्रभावी ढंग से संतुलन बनाता है, और तथ्यात्मक कार्यों में मजबूती बनाए रखते हुए क्रिएटिव राइटिंग बेंचमार्क पर मिन-पी (min-p) सैंपलिंग जैसी अत्याधुनिक विधियों से बेहतर प्रदर्शन करता है।

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram2026-05-12
⚡ electrical engineering

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

यह शोध पत्र AU-Harness प्रस्तुत करता है, जो एक ओपन-सोर्स टूलकिट है जिसे वर्तमान लार्ज ऑडियो लैंग्वेज मॉडल (LALM) मूल्यांकनों में अक्षमता और मानकीकरण की कमी को दूर करने के लिए डिज़ाइन किया गया है, जो व्यवस्थित और निष्पक्ष मॉडल मूल्यांकन के लिए एक स्केलेबल, 151% तेज़ फ्रेमवर्क और मजबूत मल्टी-टर्न डायलॉग सपोर्ट प्रदान करता है।

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash (…)2026-05-12
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

यह शोध पत्र इस धारणा को चुनौती देता है कि "SFT याद करता है, RL सामान्यीकरण करता है" और चेकपॉइंट-वार एवं स्पेक्ट्रल विश्लेषणों के माध्यम से यह प्रदर्शित करता है कि SFT अक्सर आउट-ऑफ-डिस्ट्रीब्यूशन विस्मृति (out-of-distribution forgetting) का कारण बनता है जिसे बाद में RL द्वारा पुनर्स्थापित किया जाता है, एक ऐसी रिकवरी प्रक्रिया जो सिंगुलर मानों (singular values) में परिवर्तनों के बजाय सिंगुलर वेक्टर्स के रोटेशन से जुड़ी है।

Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa2026-05-12
🤖 AI

Positional Encoding via Token-Aware Phase Attention

यह शोध पत्र टोकन-अवेयर फेज अटेंशन (TAPA) को प्रस्तुत करता है, जो एक नवीन पोजीशनल एनकोडिंग विधि है जो एक सीखने योग्य फेज फंक्शन को शामिल करके RoPE की अंतर्निहित दीर्घ-रेंज मॉडलिंग सीमाओं पर विजय प्राप्त करती है, जिससे न्यूनतम अतिरिक्त प्रशिक्षण के साथ दीर्घ-संदर्भ परिदृश्यों में बेहतर परप्लेक्सिटी और रिट्रीवल प्रदर्शन प्राप्त होता है।

Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian2026-05-12
🤖 machine learning

GLAI: GreenLightningAI for Accelerated Training through Knowledge Decoupling

ग्रीनलाइटनिंगएआई (GLAI) एक नवीन आर्किटेक्चरल ब्लॉक पेश करता है जो स्थिर सक्रियण पैटर्न (activation patterns) को स्थिर करके संरचनात्मक और मात्रात्मक ज्ञान को अलग करता है ताकि केवल संख्यात्मक भार (numerical weights) को अनुकूलित किया जा सके, जिससे पारंपरिक एमएलपी (MLPs) की तुलना में सटीकता बनाए रखते हुए या उसमें सुधार करते हुए प्रशिक्षण में लगभग 40% की तेजी आती है।

Jose I. Mestre, Alberto Fernández-Hernández, Cristian Pérez-Corral, Manuel F. Dolz, Jose Duato, Enrique S. Quintana-Ortí2026-05-12