💬 NLP

Three Buddhist Vocabularies: Computational Stylometry of the English Pali Canon across Sutta, Vinaya, and Abhidhamma

यह शोध पत्र सुत्त, विनय और अभिधम्म पिटाकों के माध्यम से अंग्रेजी पाली कैनन का एक संगणकीय शैलीमितीय (कंप्यूटेशनल स्टाइलोमेट्रिक) विश्लेषण प्रस्तुत करता है, जो प्रत्येक संग्रह के लिए विशिष्ट शाब्दिक प्रोफाइल को प्रकट करता है—जैसे कि अभिधम्म की उच्च विविधता और संख्यात्मक घनत्व, थेरवाद और मूलसर्वस्तिवाद विनय की साझा कानूनी विरासत, और समय के साथ महत्वपूर्ण अनुवाद भिन्नताएं—जबकि यह पुष्टि करता है कि सभी ग्रंथ जिप्स के नियम (जिप्स लॉ) का पालन करते हैं।

Joy Bose2026-06-25
💬 NLP

Story Operators: Decomposing the Original \to Sequel Transformation in Embedding Space

यह शोध पत्र मूल और सीक्वल एम्बेडिंग्स के बीच विस्थापन को PCA के माध्यम से व्याख्यात्मक अक्षों में विघटित करके साहित्यिक सीक्वल का विश्लेषण करने के लिए एक ज्यामितीय ढांचे का प्रस्ताव करता है, जो विभिन्न लेखकों में विशिष्ट रूपांतरण पैटर्न को प्रकट करता है और मार्क ट्वेन के प्रलेखित लेखक संबंधी इरादे के विरुद्ध *हकलबेरी फिन* में संरचनात्मक बदलाव को मान्य करता है।

W. Frederick Zimmerman2026-06-25
💬 NLP

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

यह सर्वेक्षण विविध खतरे के मॉडलों को सूचीबद्ध करके, पहचान और शमन रणनीतियों को व्यवस्थित करके, और असमान भाषा कवरेज, हानि को परिभाषित करने में सांस्कृतिक बारीकियों, तथा वैध बोलियों की अभिव्यक्ति को दबाने के जोखिम जैसे निरंतर बने रहने वाले चुनौतियों को उजागर करके, बहुभाषी लार्ज लैंग्वेज मॉडल्स के लिए विषाक्तता का पता लगाने और उसके शमन पर वर्तमान शोध का संश्लेषण करता है।

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen2026-06-25
💬 NLP

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

यह शोध पत्र "रिक्लैम इवैल्यूएशन" (reclaim evaluation) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल की स्मृति में उनके सहायक तर्क के बिना गलत निष्कर्षों को बनाए रखना, बिल्कुल भी स्मृति न होने की तुलना में अधिक हानिकारक है, और एक "सोर्स-फर्स्ट" (source-first) नीति का प्रस्ताव करता है जो गणना योग्य स्रोतों को सुरक्षित रखती है जबकि व्युत्पन्न निष्कर्षों को त्याग देती है ताकि सुधार क्षमता को बहाल किया जा सके और मेमोरी लूप्स में त्रुटि प्रसार को रोका जा सके।

Alex Kwon2026-06-25
🤖 machine learning

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

यह शोधपत्र 'जनरलाइजेशन स्पेक्ट्रम' (Generalization Spectrum) प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है कि विभिन्न स्थानांतरण दूरियों (transfer distances) के माध्यम से प्रति-नमूना सामान्यीकरण को मापता है, जिससे यह पता चलता है कि जबकि सुदृढीकरण शिक्षण (reinforcement learning), सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में रटने (memorization) को निकट-स्थानांतरण (near-transfer) में अधिक कुशलता से परिवर्तित करता है, विभिन्न अनुकूलन तकनीकें अक्सर सामान्यीकरण त्रिज्या (generalization radius) का विस्तार करने में विफल रहती हैं या दूर-स्थानांतरण (far-transfer) क्षमताओं को कम भी कर सकती हैं।

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai2026-06-25
💬 NLP

Probing in the Wild: A Case Study of Self-Supervised Speech Representations on Mandarin Sub-dialects with Unsupervised Articulatory Analysis

यह शोध पत्र मंदारिन स्व-पर्यवेक्षित वाक् मॉडलों (self-supervised speech models) का उप-बोलियों पर विश्लेषण करने के लिए एक अनसुपरवाइज्ड प्रोबिंग पाइपलाइन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ ध्वनिक रूप से प्रमुख उच्चारण संबंधी विशेषताएँ स्थिर रहती हैं, वहीं सूक्ष्म स्पेक्ट्रल अंतर महत्वपूर्ण बोली-निर्भर भिन्नता दर्शाते हैं जो बीजिंग भाषण के प्रति मॉडल की बढ़ी हुई संवेदनशीलता से प्रेरित होते हैं।

Shu Shang, Fuliang Weng, Zeqian Hu, Yaqian Zhou2026-06-25
⚡ electrical engineering

Fully Differentiable Neural Forced Alignment via Soft Dynamic Programming

यह शोध पत्र एक पूर्णतः विभेदनीय (fully differentiable) न्यूरल आर्किटेक्चर को प्रस्तुत करता है जो फोर्स्ड अलाइनमेंट के लिए एक डुअल-ब्रांच एनकोडर और एक नवीन कंट्रास्टिव लॉस के साथ अनुकूलित सॉफ्ट डायनेमिक प्रोग्रामिंग डिकोडर का उपयोग करता है, जो अंग्रेजी बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और अनदेखी भाषाओं के प्रति मजबूत सामान्यीकरण प्रदर्शित करता है।

Rotem Rousso, Eyal Cohen, Joseph Keshet2026-06-25
💬 NLP

Optimizing Abstractive Summarization With Fine-Tuned PEGASUS

यह शोध पत्र प्रदर्शित करता है कि XL-Sum अंग्रेजी कॉर्पस पर PEGASUS मॉडल को फाइन-ट्यून करने से अत्याधुनिक (state-of-the-art) एब्स्ट्रैक्टिव समराइजेशन प्रदर्शन प्राप्त होता है, जो ROUGE-1, ROUGE-2 और ROUGE-L स्कोर में पर्याप्त सुधार के साथ बेसलाइन mT5 मॉडल से काफी बेहतर प्रदर्शन करता है।

Sadiul Arefin Rafi, Naimur Rahman, Kazi Nazibul Islam, Ha-mim Ahmad, Farig Yousuf Sadeque2026-06-25
💬 NLP

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

यह शोध पत्र लक्ष्य (target), हमलावर (attacker) और निर्णायक (jury) मॉडलों का उपयोग करते हुए एक नवीन बहु-भूमिका वाले रेड टीमिंग ढांचे को प्रस्तुत करता है जो बड़े भाषा मॉडलों (LLMs) में कमजोरियों का व्यवस्थित रूप से मूल्यांकन करने और उन्हें उजागर करने के लिए है, जो यह प्रदर्शित करता है कि आर्किटेक्चरल डिज़ाइन विकल्प विविध कार्यों और भाषाओं में सुरक्षा और निष्ठा (faithfulness) को महत्वपूर्ण रूप से प्रभावित करते हैं, साथ ही सूक्ष्म अननिष्ठता (unfaithfulness) का पता लगाने और क्रॉस-लिंग्विस्टिक प्रतिकूल जनरेशन (cross-linguistic adversarial generation) को पूरी तरह से स्वचालित करने में वर्तमान सीमाओं को भी रेखांकित करता है।

Abrar Alotaibi, Raed Mughus, Moataz Ahmed2026-06-25