💬 NLP

Automatic Generation of Highlights for Academic Paper Via Prompt-based Learning

यह अध्ययन प्रदर्शित करता है कि प्रॉम्प्ट-आधारित लर्निंग, विशेष रूप से सावधानीपूर्वक डिज़ाइन किए गए टेम्पलेट्स और फ्यू-शॉट उदाहरणों के साथ ChatGPT का लाभ उठाते हुए, बड़े पैमाने पर कार्य-विशिष्ट लेबल किए गए प्रशिक्षण डेटा की आवश्यकता के बिना, उच्च गुणवत्ता वाले अकादमिक पेपर हाइलाइट्स प्रभावी ढंग से उत्पन्न कर सकती है।

Yi Xiang, Chengzhi Zhang, Heng Zhang2026-06-25
💬 NLP

Measuring Research Difficulty of Academic Papers: A Case Study in Natural Language Processing

यह शोध पत्र नेचुरल लैंग्वेज प्रोसेसिंग में अनुसंधान की कठिनाई को मापने के लिए एक व्यापक, एंट्रॉपी-भारित मूल्यांकन प्रणाली का प्रस्ताव और सत्यापन करता है, जो यह प्रकट करता है कि मध्यम रूप से कठिन अनुसंधान—जो पृष्ठ संख्या, संदर्भ मात्रा और संस्थागत प्रतिष्ठा जैसे कारकों द्वारा पहचाना जाता है—उच्चतम शैक्षणिक प्रभाव प्राप्त करने की प्रवृत्ति रखता है।

Haochuan Li, Jingyuan Li, Yi Zhao, Heng Zhang, Yukai Yang, Zile Hu, Chengzhi Zhang2026-06-25
💬 NLP

Data-Driven Evolution of Library and Information Science Research Methods (1990-2022): A Perspective Based on Fine-grained Method Entities

यह अध्ययन डेटा-संचालित विधि संस्थाओं के सूक्ष्म निष्कर्षण के माध्यम से 1990 से 2022 तक पुस्तकालय और सूचना विज्ञान अनुसंधान पद्धतियों के विकास का विश्लेषण करता है, जो यह प्रकट करता है कि डेटा संसाधन पद्धतिगत परिवर्तन के एक महत्वपूर्ण चालक हैं, जो उद्भव, स्थिरता और व्यावहारिक अनुप्रयोग के एक चक्रीय पैटर्न द्वारा अभिलक्षित है।

Chengzhi Zhang, Yi Mao, Shuyu Peng2026-06-25
💬 NLP

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

यह शोध पत्र लोकल ब्रांच रूटिंग (LBR) को प्रस्तुत करता है, जो एक टोकन-स्तरीय टेस्ट-टाइम स्केलिंग फ्रेमवर्क है जो स्थानीय लुकअहेड पेड़ों का विस्तार करके और इष्टतम शाखाओं को चुनने के लिए एक हल्के राउटर का उपयोग करके भाषा मॉडल की तर्क क्षमता को कुशलतापूर्वक बढ़ाता है, जिससे एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) सक्षम होती है और गणितीय तर्क कार्यों पर मौजूदा डिस्क्रीट चेन-ऑफ-थॉट और सॉफ्ट-टोकन बेसलाइनों से बेहतर प्रदर्शन करता है।

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao (…)2026-06-25
💬 NLP

Three Buddhist Vocabularies: Computational Stylometry of the English Pali Canon across Sutta, Vinaya, and Abhidhamma

यह शोध पत्र सुत्त, विनय और अभिधम्म पिटाकों के माध्यम से अंग्रेजी पाली कैनन का एक संगणकीय शैलीमितीय (कंप्यूटेशनल स्टाइलोमेट्रिक) विश्लेषण प्रस्तुत करता है, जो प्रत्येक संग्रह के लिए विशिष्ट शाब्दिक प्रोफाइल को प्रकट करता है—जैसे कि अभिधम्म की उच्च विविधता और संख्यात्मक घनत्व, थेरवाद और मूलसर्वस्तिवाद विनय की साझा कानूनी विरासत, और समय के साथ महत्वपूर्ण अनुवाद भिन्नताएं—जबकि यह पुष्टि करता है कि सभी ग्रंथ जिप्स के नियम (जिप्स लॉ) का पालन करते हैं।

Joy Bose2026-06-25
💬 NLP

Story Operators: Decomposing the Original \to Sequel Transformation in Embedding Space

यह शोध पत्र मूल और सीक्वल एम्बेडिंग्स के बीच विस्थापन को PCA के माध्यम से व्याख्यात्मक अक्षों में विघटित करके साहित्यिक सीक्वल का विश्लेषण करने के लिए एक ज्यामितीय ढांचे का प्रस्ताव करता है, जो विभिन्न लेखकों में विशिष्ट रूपांतरण पैटर्न को प्रकट करता है और मार्क ट्वेन के प्रलेखित लेखक संबंधी इरादे के विरुद्ध *हकलबेरी फिन* में संरचनात्मक बदलाव को मान्य करता है।

W. Frederick Zimmerman2026-06-25
💬 NLP

A Survey of Toxicity Detection and Mitigation Strategies for Multilingual Language Models

यह सर्वेक्षण विविध खतरे के मॉडलों को सूचीबद्ध करके, पहचान और शमन रणनीतियों को व्यवस्थित करके, और असमान भाषा कवरेज, हानि को परिभाषित करने में सांस्कृतिक बारीकियों, तथा वैध बोलियों की अभिव्यक्ति को दबाने के जोखिम जैसे निरंतर बने रहने वाले चुनौतियों को उजागर करके, बहुभाषी लार्ज लैंग्वेज मॉडल्स के लिए विषाक्तता का पता लगाने और उसके शमन पर वर्तमान शोध का संश्लेषण करता है।

Soham Dan, Himanshu Beniwal, Thomas Hartvigsen2026-06-25
💬 NLP

Reclaim Evaluation: A Lossy Memory Is Worse Than an Empty One

यह शोध पत्र "रिक्लैम इवैल्यूएशन" (reclaim evaluation) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल की स्मृति में उनके सहायक तर्क के बिना गलत निष्कर्षों को बनाए रखना, बिल्कुल भी स्मृति न होने की तुलना में अधिक हानिकारक है, और एक "सोर्स-फर्स्ट" (source-first) नीति का प्रस्ताव करता है जो गणना योग्य स्रोतों को सुरक्षित रखती है जबकि व्युत्पन्न निष्कर्षों को त्याग देती है ताकि सुधार क्षमता को बहाल किया जा सके और मेमोरी लूप्स में त्रुटि प्रसार को रोका जा सके।

Alex Kwon2026-06-25
🤖 machine learning

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

यह शोधपत्र 'जनरलाइजेशन स्पेक्ट्रम' (Generalization Spectrum) प्रस्तुत करता है, जो एक नवीन मूल्यांकन ढांचा है कि विभिन्न स्थानांतरण दूरियों (transfer distances) के माध्यम से प्रति-नमूना सामान्यीकरण को मापता है, जिससे यह पता चलता है कि जबकि सुदृढीकरण शिक्षण (reinforcement learning), सुपरवाइज्ड फाइन-ट्यूनिंग की तुलना में रटने (memorization) को निकट-स्थानांतरण (near-transfer) में अधिक कुशलता से परिवर्तित करता है, विभिन्न अनुकूलन तकनीकें अक्सर सामान्यीकरण त्रिज्या (generalization radius) का विस्तार करने में विफल रहती हैं या दूर-स्थानांतरण (far-transfer) क्षमताओं को कम भी कर सकती हैं।

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai2026-06-25