💬 NLP

Query-Conditioned Test-Time Self-Training for Large Language Models

यह शोध पत्र QueST को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स को सीधे इनपुट क्वेरी से प्राप्त पर्यवेक्षण (supervision) का उपयोग करके इन्फरेंस के दौरान अपने मापदंडों (parameters) को अनुकूलित करने में सक्षम बनाता है, जिससे बाहरी डेटा पर निर्भर रहे बिना तर्क संबंधी कार्यों में क्वेरी-विशिष्ट सुधार प्राप्त किया जा सके।

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim2026-05-14
💬 NLP

Phasor Memory Networks: Stable Backpropagation Through Time for Scalable Explicit Memory

यह शोध पत्र फेज़र मेमोरी नेटवर्क (PMNet) को प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो यूनिटरी फेज़र डायनेमिक्स और पदानुक्रमित सीखने योग्य एंकर्स के माध्यम से स्पष्ट मेमोरी सिस्टम में लंबे समय से चली आ रही ग्रेडिएंट अस्थिरता को हल करता है, जिससे एक संक्षिप्त 119M पैरामीटर वाला मॉडल लंबी दूरी की रिट्रीवल (long-range retrieval) में लगभग पूर्णता प्राप्त करने और काफी बड़े मॉडलों के प्रदर्शन के बराबर पहुँचने में सक्षम होता है।

Sungwoo Goo, Hwi-yeol Yun, Sangkeun Jung2026-05-14
💬 NLP

Continual Learning with Multilingual Foundation Model

यह शोध पत्र एक पुनरुत्पादक, बहु-चरणीय ढांचे को प्रस्तुत करता है जो डेटा की कमी और क्रॉस-लिंग्विस्टिक भिन्नता जैसी चुनौतियों का समाधान करते हुए, अंग्रेजी, स्पेनिश और इतालवी सोशल मीडिया पर पुनः प्राप्त (reclaimed) LGBTQ+ अपशब्दों का प्रभावी ढंग से पता लगाने के लिए XLM-RoBERTa फाउंडेशन मॉडल और डेटा संवर्धन (data augmentation) के लिए GPT-4o-mini बैक-ट्रांसलेशन और भाषा-विशिष्ट थ्रेशोल्ड ऑप्टिमाइज़ेशन का लाभ उठाता है।

Barathi Ganesh HB, Michal Ptaszynski, Rene Melendez, Juuso Eronen2026-05-14
🤖 AI

Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

यह शोध पत्र लेखन, अपसारी चिंतन (divergent thinking) और वैज्ञानिक विचारोन्मेष (scientific ideation) के क्षेत्र में लार्ज लैंग्वेज मॉडल (LLM) के प्रदर्शन की भविष्यवाणी करने के लिए मौजूदा मानव रचनात्मकता परीक्षणों का व्यवस्थित रूप से मूल्यांकन करता है, जो उनकी सीमित वैधता को प्रकट करता है और 'डाइवर्जेंट रिमोट एसोसिएशन टेस्ट' (DRAT) को पहले सुदृढ़ उपकरण के रूप में प्रस्तुत करता है जो अभिसारी (convergent) और अपसारी दोनों प्रकार के चिंतन का एक साथ आकलन करके वैज्ञानिक विचारोन्मेष की भविष्यवाणी करने में सक्षम है।

Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji2026-05-14
💬 NLP

OSDN: Improving Delta Rule with Provable Online Preconditioning in Linear Attention

यह शोध पत्र ऑनलाइन स्केल्ड डेल्टानेट (OSDN) को प्रस्तुत करता है, जो एक लीनियर अटेंशन मॉडल है जो फीचर-वाइज स्केलिंग के लिए एक ऑनलाइन-अपडेटेड डायगोनल प्रीकंडीशनर को शामिल करके डेल्टा रूल को उन्नत करता है, जिससे यह हार्डवेयर-कुशल पैरेललिज्म बनाए रखते हुए प्रमाणित सुपर-जियोमेट्रिक कन्वर्जेंस प्राप्त करता है और इन-कॉन्टेक्स्ट एसोसिएटिव रिकॉल में महत्वपूर्ण सुधार करता है।

Chenyu Zhou, Hongpei Li, Yuerou Liu, Jianghao Lin, Dongdong Ge, Yinyu Ye2026-05-14
💬 NLP

PersonalAI 2.0: Enhancing knowledge graph traversal/retrieval with planning mechanism for Personalized LLM Agents

PersonalAI 2.0 एक नवीन ढांचा है जो बाहरी नॉलेज ग्राफ को एडेप्टिव क्वेरी प्रोसेसिंग के लिए एक गतिशील, बहु-चरणीय योजना तंत्र के साथ एकीकृत करके व्यक्तिगत LLM एजेंटों को उन्नत करता है, जिससे मौजूदा GraphRAG विधियों की तुलना में कई बेंचमार्क में बेहतर तथ्यात्मक सटीकता और कम मतिभ्रम (hallucination) दर प्राप्त होती है।

Mikhail Menschikov, Matvey Iskornev, Alexander Kharitonov, Alina Bogdanova, Mikhail Belkin, Ekaterina Lisitsyna, Artyom (…)2026-05-14
💬 NLP

Effective Context in Transformers: An Analysis of Fragmentation and Tokenization

यह शोधपत्र एक परिमित-संदर्भ सूचना-सैद्धांतिक ढांचा स्थापित करता है जो यह प्रदर्शित करता है कि जबकि विखंडन (छोटे इकाइयों का उपयोग करना) अनुकूलतम लॉग-लॉस को बढ़ाकर आंतरिक रूप से भविष्यवाणी प्रदर्शन को खराब कर सकता है, लालची टोकनाइज़ेशन (बड़ी इकाइयों का उपयोग करना) प्रभावी रूप से मॉडल की उपयोगी संदर्भ विंडो को विस्तारित कर सकता है, जिससे बाइट/कैरेक्टर-स्तरीय और सबवर्ड-आधारित ट्रांसफॉर्मर मॉडलों के बीच प्रदर्शन के अंतर की व्याख्या होती है।

Amirmehdi Jafari Fesharaki, Mohammadamin Rami, Aslan Tchamkerten2026-05-14
💬 NLP

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

यह शोध पत्र प्रकट करता है कि मेनी-शॉट चेन-ऑफ-थॉट इन-कॉन्टेक्स्ट लर्निंग, सरल पैटर्न मैचिंग के बजाय इन-कॉन्टेक्स्ट टेस्ट-टाइम लर्निंग के रूप में व्यवहार करती है, जो यह प्रदर्शित करता है कि मानक स्केलिंग नियम तर्क संबंधी कार्यों के लिए विफल हो जाते हैं और महत्वपूर्ण प्रदर्शन लाभ के लिए प्रदर्शन क्रम को अनुकूलित करने हेतु कर्विलिनियर डेमोंस्ट्रेशन सिलेक्शन (CDS) का प्रस्ताव करता है।

Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung2026-05-14
🤖 AI

AI-Generated Slides: Are They Good? Can Students Tell?

यह अध्ययन शैक्षिक स्लाइड्स बनाने के लिए विभिन्न जनरेटिव एआई (generative AI) उपकरणों का मूल्यांकन करता है, जिसमें यह पाया गया है कि कोडिंग असिस्टेंट सबसे अधिक शैक्षणिक रूप से सुदृढ़ सामग्री तैयार करते हैं और छात्र एआई-जनित स्लाइड्स को मानव-निर्मित स्लाइड्स के समान गुणवत्ता का मानते हैं, जो अक्सर कथित निम्न गुणवत्ता को एआई स्रोत के साथ जोड़ते हैं।

Juho Leinonen, Lisa Zhang, Arto Hellas2026-05-14
💬 NLP

Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models

यह शोधपत्र प्रदर्शन प्रतिगमन (demonstration regurgitation) को रोकने के लिए लोकेल-कंडीशन्ड रोटेटिंग फ्यू-शॉट प्रॉम्पटिंग के साथ एक 1-बिट स्मॉल लैंग्वेज मॉडल का उपयोग करके एक ऑन-डिवाइस PII सब्स्टिट्यूशन पाइपलाइन प्रस्तावित करता है, जो यह प्रकट करता है कि हालांकि यह दृष्टिकोण नियम-आधारित विधियों की तुलना में अधिक स्वाभाविक टेक्स्ट उत्पन्न करता है, लेकिन अंततः अपर्याप्त प्रशिक्षण डेटा विविधता के कारण डाउनस्ट्रीम नेमड एंटिटी रिकग्निशन (NER) प्रदर्शन को नुकसान पहुँचाता है।

Anuj Sadani, Deepak Kumar2026-05-14