🤖 machine learning

Frayed RoPE and Long Inputs: A Geometric Perspective

यह शोध पत्र एक ज्यामितीय विश्लेषण प्रस्तुत करता है जो यह प्रकट करता है कि रोटरी पोजीशनल एम्बेडिंग (RoPE), "सिंक टोकन" कार्यक्षमता के लिए आवश्यक की (key) और क्वेरी (query) क्लस्टर्स के अलगाव को बाधित करके लंबे इनपुट्स पर प्रदर्शन को कम कर देता है, जिससे RoPE-ID का प्रस्ताव मिलता है, जो एक ऐसा संशोधन है जो विस्तारित संदर्भों में प्रभावी सामान्यीकरण सक्षम करने के लिए चैनलों के एक उपसमूह पर उच्च-आवृत्ति रोटेशन लागू करता है।

Davis Wertheimer, Aozhong Zhang, Derrick Liu, Penghang Yin, Naigang Wang2026-03-20
💬 NLP

An Agentic System for Schema Aware NL2SQL Generation

यह शोध पत्र NL2SQL जनरेशन के लिए एक लागत प्रभावी, स्कीमा-जागरूक एजेंटिक सिस्टम का प्रस्ताव करता है जो मुख्य रूप से एक चयनात्मक लार्ज लैंग्वेज मॉडल (LLM) फॉलबैक के साथ स्मॉल लैंग्वेज मॉडल्स (SLMs) का उपयोग करता है, जो गोपनीयता और संसाधन बाधाओं को संबोधित करते हुए BIRD बेंचमार्क पर महत्वपूर्ण लागत कटौती और मजबूत प्रदर्शन प्राप्त करता है।

David Onyango, Naseef Mansoor2026-03-20
💬 NLP

BenchBrowser -- Collecting Evidence for Evaluating Benchmark Validity

लौकिक ब्राउज़र (Laukik Browser) एक रिट्रीवल टूल है जिसे अभ्यासकर्ताओं को उनके उपयोग के मामलों से संबंधित विशिष्ट परीक्षण मदों को सामने लाकर बेंचमार्क वैधता का मूल्यांकन करने में मदद करने के लिए डिज़ाइन किया गया है, जिससे संकीर्ण सामग्री कवरेज और अस्थिर रैंकिंग जैसी समस्याओं का निदान किया जा सके ताकि इच्छित लक्ष्यों और वास्तविक बेंचमार्क मापों के बीच के अंतर को पाटा जा सके।

Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito2026-03-20
💬 NLP

How Psychological Learning Paradigms Shaped and Constrained Artificial Intelligence

यह शोध पत्र तर्क देता है कि कृत्रिम बुद्धिमत्ता की ऐतिहासिक सीमाएँ उन मनोवैज्ञानिक शिक्षण प्रतिमानों के संरचनात्मक अवरोधों को विरासत में प्राप्त करने से उत्पन्न होती हैं जिनसे इसे प्रेरित किया गया था, और 'रीसिंथ ट्राइमॉड्यूलर फ्रेमवर्क' (ReSynth trimodular framework) प्रस्तावित करता है—जो रटकर सीखने के प्रति एक अंतर-सांस्कृतिक दृष्टिकोण को एकीकृत करता है—ताकि तर्क, उद्देश्य और ज्ञान को वास्तुशिल्प रूप से अलग किया जा सके, जो कृत्रिम सामान्य बुद्धिमत्ता (AGI) प्राप्त करने के लिए एक आवश्यक शर्त है।

Alex Anvi Eponon, Ildar Batyrshin, Christian E. Maldonado-Sifuentes, Grigori Sidorov2026-03-20
💬 NLP

Large-Scale Analysis of Political Propaganda on Moltbook

यह अध्ययन AI-एजेंट प्लेटफॉर्म मोलटबुक (Moltbook) के 6,70,,000 से अधिक पोस्ट का विश्लेषण करने के लिए NLP-आधारित क्लासिफायर का उपयोग करता है, जो यह प्रकट करता है कि राजनीतिक दुष्प्रचार एजेंटों और समुदायों की एक छोटी अल्पसंख्यक संख्या के बीच अत्यधिक केंद्रित है जबकि टिप्पणियों के माध्यम से इसके प्रसार के सीमित प्रमाण दिखाई देते हैं।

Julia Jose, Meghna Manoj Nair, Rachel Greenstadt2026-03-20
💬 NLP

PowerFlow: Unlocking the Dual Nature of LLMs via Principled Distribution Matching

PowerFlow एक सिद्धांत-आधारित अनसुपरवाइज्ड फाइन-ट्यूनिंग फ्रेमवर्क पेश करता है जो LLM अनुकूलन को एक लेंथ-अवेयर ट्रजेक्टरी-बैलेंस ऑब्जेक्टिव का उपयोग करके वितरण मिलान (distribution matching) समस्या के रूप में पुनर्गठित करता है ताकि समायोज्य α\alpha-पावर वितरणों को लक्षित करके तार्किक तर्क और रचनात्मक अभिव्यक्ति की दोहरी क्षमताओं को उद्ेलित किया जा सके, जिससे यह मौजूदा ह्यूरिस्टिक-आधारित विधियों से बेहतर प्रदर्शन करता है और सुपरवाइज्ड बेसलाइन्स से आगे निकल जाता है।

Ruishuo Chen, Yu Chen, Zhuoran Li, Longbo Huang2026-03-20
💬 NLP

From Topic to Transition Structure: Unsupervised Concept Discovery at Corpus Scale via Predictive Associative Memory

यह शोधपत्र प्रेडिक्टिव एसोसिएटिव मेमोरी (predictive associative memory) का उपयोग करके अनसुपरवाइज्ड, कॉर्पस-स्केल "ट्रांज़िशन-स्ट्रक्चर" अवधारणाओं को खोजने की एक विधि प्रस्तुत करता है जो यह पकड़ती हैं कि टेक्स्ट कैसे कार्य करते हैं और विकसित होते हैं, जो उन्हें पारंपरिक एम्बेडिंग-आधारित मॉडलों से अलग करती हैं जो टेक्स्ट को उनके सिमेंटिक विषय के आधार पर समूहीकृत करते हैं।

Jason Dury2026-03-20
💬 NLP

Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation

यह शोध पत्र एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) आधारित डिकोडर सैंपलर प्रस्तुत करता है जो लार्ज लैंग्वेज मॉडल्स के लिए सैंपलिंग मापदंडों को गतिशील रूप से समायोजित करने हेतु एक हल्का, टेस्ट-टाइम पॉलिसी सीखता है, जो बिना मॉडल पुनप्रशिक्षण के सारांशीकरण कार्यों में स्थिर डिकोडिंग रणनीतियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Asmita Bhardwaj, Yuya Jeremy Ong, Eelaaf Zahid, Basel Shbita2026-03-20
📊 statistics

The Truncation Blind Spot: How Decoding Strategies Systematically Exclude Human-Like Token Choices

यह शोध पत्र प्रकट करता है कि मानक संभावना-आधारित डिकोडिंग रणनीतियाँ एक "ट्रंकेशन ब्लाइंड स्पॉट" (truncation blind spot) निर्मित करती हैं, जो सांख्यिकीय रूप से दुर्लभ लेकिन संदर्भगत रूप से उपयुक्त मानवीय टोकन विकल्पों को व्यवस्थित रूप से बाहर कर देती हैं, एक ऐसा बेमेल जो मशीन-जनित पाठ को मॉडल के पैमाने के बावजूद आसानी से पता लगाने योग्य बनाता है और पता लगाने से बचने तथा पाठ की सुसंगतता बनाए रखने के बीच के मौलिक द्वंद्व को रेखांकित करता है।

Esteban Garces Arias, Nurzhan Sapargali, Christian Heumann, Matthias Aßenmacher2026-03-20
💬 NLP

EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models

एन्ट्रॉपीकैश (EntropyCache) डिफ्यूजन-आधारित लार्ज लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-मुक्त KV कैशिंग विधि है जो डिकोडेड टोकन एन्ट्रॉपी का उपयोग एक स्थिर-लागत वाले सिग्नल के रूप में यह गतिशील रूप से निर्णय लेने के लिए करती है कि कब कैश किए गए स्टेट्स को पुनर्गणना (recompute) किया जाए, जिससे न्यूनतम ओवरहेड के साथ प्रतिस्पर्धी सटीकता बनाए रखते हुए महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त होता है।

Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo2026-03-20