💬 NLP

Best Preprocessing Techniques for Sentiment Analysis

यह शोध पत्र ट्विटर सेंटीमेंट एनालिसिस के लिए प्रीप्रोसेसिंग तकनीकों के प्रभाव और इष्टतम क्रम का व्यवस्थित रूप से मूल्यांकन करता है, जिसमें यह पाया गया है कि टोकनाइज़ेशन सबसे महत्वपूर्ण चरण है, स्पेलिंग सुधार का प्रभाव सबसे कम है, और सर्वोत्तम अनुक्रम में टोकनाइज़ेशन, टेक्स्ट क्लीनिंग, स्टेमिंग और नेगेशन को सुरक्षित रखते हुए स्टॉपवर्ड रिमूवल शामिल है।

Saranzaya Magsarjav, Melissa Humphries, Jonathan Tuke, Lewis Mitchell2026-06-24
💬 NLP

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

"केववुमन" (Cavewoman) अध्ययन यह प्रकट करता है कि जबकि मॉडल के आउटपुट को कंप्रेस करना इन्फरेंस लागत को काफी कम कर सकता है, उपयोगकर्ता के इनपुट को कंप्रेस करना प्रतिगामी है, क्योंकि यह मॉडल को लंबे उत्तर उत्पन्न करने के लिए मजबूर करता है जो शुद्ध लागत को बढ़ाते हैं और सटीकता को कम करते हैं।

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt2026-06-24
🤖 AI

Exploring Academic Influence of Algorithms by Co-occurrence Network Based on Full-text of Academic Papers

यह अध्ययन चार दशकों से अधिक के पूर्ण-पाठ शैक्षणिक शोध पत्रों से बड़े पैमाने पर सह-घटित नेटवर्क (co-occurrence networks) का निर्माण करता है ताकि प्राकृतिक भाषा प्रसंस्करण (natural language processing) में एल्गोरिदम के संरचनात्मक विकास और सामूहिक प्रभाव का विश्लेषण किया जा सके, जो यह प्रकट करता है कि क्लासिक और अत्यधिक केंद्रीय एल्गोरिदम अपना प्रभुत्व बनाए रखते हैं जबकि घटते हुए एल्गोरिदम पहले अपने मुख्य नेटवर्क पदों को खो देते हैं।

Yuzhuo Wang, Chengzhi Zhang, Min Song, Seong Deok Kim, Youngsoo Ko, Juhee Lee2026-06-24
💬 NLP

PORTER: Language-Grounded Event Representations for Portable Structured EHR Foundation Models

PORTER एक भाषा-आधारित (language-grounded) EHR फाउंडेशन मॉडल है जो टेक्स्ट विवरणों और एक समर्पित संख्यात्मक पथ (numeric pathway) का उपयोग करके इवेंट रिप्रजेंटेशन को निश्चित शब्दावलियों से अलग करता है, जिससे शब्दावली सामंजस्य (vocabulary harmonization) या पुन: प्रशिक्षण की आवश्यकता के बिना मजबूत क्रॉस-इंस्टीट्यूशनल ट्रांसफर और विविध नैदानिक कार्यों पर उच्च प्रदर्शन सक्षम होता है।

Lin Lawrence Guo, Adam Paul Yan, Emily Vettese, Lillian Sung2026-06-24
🤖 machine learning

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

यह शोध पत्र यह प्रदर्शित करता है कि प्री-इक्विलिब्रियम सैचुरेशन (pre-equilibrium saturation) के कारण डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स में लोरा (LoRA) ट्रेनिंग कोलैप्स का पता लगाने के लिए मानक टॉप-1 आर्गमैक्स कंसन्ट्रेशन (top-1 argmax concentration) मेट्रिक अप्रभावी है, और एक कैलिब्रेटेड मैक्स लोरा ग्रेडिएंट नॉर्म (max LoRA gradient norm) मॉनिटर से इसे बदलने का प्रस्ताव देता है जो अस्थिर प्रशिक्षण कॉन्फ़िगरेशन की पहचान करने में काफी उच्च परिशुद्धता प्राप्त करता है।

Lucky Verma, Pratik Yadav2026-06-24
💬 NLP

Metis: Bridging Text and Code Memory for Self-Evolving Agents

यह शोधपत्र मेटिस (Metis) को प्रस्तुत करता है, जो एक स्व-विकसित एजेंट प्रणाली है जो प्राकृतिक भाषा के पाठ और निष्पादन योग्य कोड को गतिशील रूप से संयोजित करने के लिए एक पदानुक्रमित द्वि-प्रतिनिधित्व स्मृति (hierarchical dual-representation memory) का उपयोग करती है, जिससे दोनों प्रकार की स्मृतियों की पूरक शक्तियों का लाभ उठाते हुए मौजूदा दृष्टिकोणों की तुलना में बेहतर कार्य सटीकता और निष्पादन दक्षता प्राप्त होती है।

Zijie Dai, Siuhin He, Hui Li, Qihui Zhou, Jiajun Li, Mingcong Song, Guoping Long, Hongjie Si, Xin Yao, Lin Zhang, James (…)2026-06-24
💬 NLP

A P\={a}ninian Foundation for Indic Language Processing

यह शोध पत्र पाणिनी के प्राचीन व्याकरण पर आधारित भारतीय भाषाओं के प्रसंस्करण के लिए एक एकीकृत कम्प्यूटेशनल ढांचे का प्रस्ताव करता है, जिसमें यह तर्क दिया गया है कि विविध भारतीय भाषाओं में इस साझा रूप-वाक्यविन्यास (morphosyntactic) संरचना का लाभ उठाने से अधिक सटीक, डेटा-कुशल और हस्तांतरणीय एनएलपी (NLP) प्रणालियाँ प्राप्त होंगी, साथ ही इन क्षमताओं का परीक्षण करने के लिए एक नया बेंचमार्क सूट भी प्रस्तुत किया गया है।

Ritwik Banerjee, Lav R. Varshney2026-06-24
💬 NLP

Aspect-Based Sentiment Evolution and its Correlation with Review Rounds in Multi-Round Peer Reviews: A Deep Learning Approach

यह अध्ययन नेचर कम्युनिकेशंस के 11,063 बहु-चरणीय सहकर्मी (पीयर) समीक्षाओं का विश्लेषण करने के लिए एक डीप लर्निंग दृष्टिकोण का उपयोग करता है, जो यह प्रकट करता है कि जैसे-जैसे समीक्षा के दौर बढ़ते हैं, सकारात्मक भावनाएं बढ़ती हैं जबकि नकारात्मक भावनाएं घटती हैं, और पहलू-स्तरीय (एस्पेक्ट-लेवल) भावना स्कोर समीक्षा के कुल दौरों की संख्या के साथ नकारात्मक रूप से सह-संबंधित होते हैं।

Ruxue Hana, Haomin Zhoua, Jiangtao Zhong, Chengzhi Zhang2026-06-24
💬 NLP

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

यह शोधपत्र SURGELLM को प्रस्तुत करता है, जो एक एकीकृत ट्रांसफॉर्मर फ्रेमवर्क है जो सर्जिकल फीचर गेटिंग (surgical feature gating), टास्क-कंडीशन्ड प्रीफिक्स टोकन (task-conditioned prefix tokens) और इंस्टेंस-वेटेड नॉर्मलाइजेशन (Instance-Weighted Normalization) को एकीकृत करके मल्टी-टास्क एनएलपी प्रदर्शन को बढ़ाता है ताकि मिसमैच्ड इंडक्टिव बायस (mismatched inductive biases), क्लास इम्बैलेंस (class imbalance) और बाहरी लेक्सिकल कंडीशनिंग (external lexical conditioning) की आवश्यकता को प्रभावी ढंग से संबोधित किया जा सके, जिससे विविध बेंचमार्क में महत्वपूर्ण मैक्रो-एफ1 (macro-F1) सुधार प्राप्त होते हैं।

Noor Islam S. Mohammad, Ulug Bayazit2026-06-24
💬 NLP

Pigeonholing: Bad prompts hurt models to collapse and make mistakes

यह शोध पत्र "पिजनहोलिंग" (pigeonholing) नामक एक घटना को प्रस्तुत करता है, जहाँ लार्ज लैंग्वेज मॉडल्स में अनजाने में उत्पन्न होने वाले खराब संदर्भ मॉडल के प्रदर्शन में गिरावट और मोड कोलैप्स (mode collapse) का कारण बनते हैं क्योंकि वे मॉडल को त्रुटियों को दोहराने या अपने आउटपुट को सीमित करने के लिए मजबूर करते हैं, और इन समस्याओं को प्रभावी ढंग से कम करने के लिए एक सिंथेटिक एरर-आधारित RLVR प्रशिक्षण पद्धति का प्रस्ताव देता है।

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques2026-06-24