💬 NLP

Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective

यह शोध पत्र एक नवीन डायनेमिक क्लिपिंग तंत्र का प्रस्ताव देकर 'वेरिफिएबल रिवार्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) में एंट्रॉपी कोलैप्स को संबोधित करता है, जो पॉलिसी एंट्रॉपी को सटीक रूप से नियंत्रित करने के लिए एक ग्रेडिएंट-प्रिजर्विंग परिप्रेक्ष्य का लाभ उठाता है, जिससे समयपूर्व अति-आत्मविश्वास को रोका जा सके और एलएलएम (LLM) तर्क प्रदर्शन को बढ़ाया जा सके।

Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao2026-05-11
💬 NLP

Retrieval Heads are Dynamic

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में रिट्रीवल हेड्स (retrieval heads) के स्थिर दृष्टिकोण को चुनौती देता है, यह प्रदर्शित करते हुए कि वे गतिशील, टाइमस्टेप-विशिष्ट और हिडन स्टेट्स (hidden states) के माध्यम से पूर्वानुमेय हैं, जिससे एक आंतरिक नियोजन तंत्र (internal planning mechanism) का अनावरण होता है जिसे स्थिर मॉडल पकड़ने में विफल रहते हैं।

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang2026-05-11
💬 NLP

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

यह शोध पत्र ScrapeGraphAI-100k को प्रस्तुत करता है, जो व्यावहारिक टेलीमेट्री से प्राप्त 93,695 स्कीमा-प्रतिबंधित निष्कर्षण घटनाओं का एक बड़े पैमाने का, वास्तविक दुनिया का डेटासेट है, जो बड़े भाषा मॉडलों (LLMs) को उन संरचित पीढ़ी कार्यों पर प्रशिक्षित करने और उनका बेंचमार्किंग करने में सक्षम बनाता है जहाँ पूर्व सिंथेटिक या केवल टेक्स्ट कॉर्पोरा अपर्याप्त थे।

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan2026-05-11
💬 NLP

Utility-Preserving De-Identification for Math Tutoring: Investigating Numeric Ambiguity in the MathEd-PII Benchmark Dataset

यह शोध पत्र MathEd-PII बेंचमार्क प्रस्तुत करता है और यह प्रदर्शित करता है कि डोमेन-जागरूक प्रॉम्प्टिंग रणनीतियाँ गणितीय ट्यूटरिंग संवादों में जेनेरिक PII डिटेक्शन की तुलना में काफी बेहतर प्रदर्शन करती हैं, क्योंकि वे शैक्षिक उपयोगिता को बनाए रखते हुए गोपनीयता सुनिश्चित करने के लिए संख्यात्मक अस्पष्टता को हल करती हैं।

Zhuqian Zhou, Kirk Vanacore, Bakhtawar Ahtisham, Jinsook Lee, Doug Pietrzak, Daryl Hedley, Jorge Dias, Chris Shaw, Ruth (…)2026-05-11
💬 NLP

Domain-level metacognitive monitoring in frontier LLMs: A 33-model atlas

यह अध्ययन 33 फ्रंटियर एलएलएम (LLMs) के माध्यम से 1,500 एमएमएलयू (MMLU) मदों का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि समग्र मेटाकॉग्निटिव मॉनिटरिंग स्कोर महत्वपूर्ण, स्थिर डोमेन-स्तरीय विविधताओं को छिपा देते हैं, जिसमें प्रयुक्त ज्ञान (applied knowledge) की निगरानी करना औपचारिक तर्क या प्राकृतिक विज्ञान की तुलना में विश्वसनीय रूप से आसान है, जिससे मॉडल परिनियोजन से पहले डोमेन-विशिष्ट स्क्रीनिंग के उपयोग का समर्थन मिलता है।

Jon-Paul Cacioli2026-05-11
🤖 machine learning

RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory

RateQuant रेट-डिस्टॉर्शन थ्योरी का लाभ उठाकर, प्रति-क्वांटाइज़र डिस्टॉर्शन मॉडल को फिट करने और क्लोज्ड-फॉर्म रिवर्स वॉटरफिलिंग के माध्यम से इष्टतम बिट आवंटन के लिए समाधान निकालकर, नैव (naive) मिक्स्ड-प्रिसिजन KV कैश क्वांटाइजेशन की कमियों को दूर करता है, जिससे न्यूनतम कैलिब्रेशन ओवरहेड के साथ महत्वपूर्ण परप्लेक्सिटी (perplexity) में कमी आती है।

Fei Zuo, Zikang Zhou, Hao Cong, Xiaoyan Xi, Ho Fai Leung2026-05-11
🤖 machine learning

Toeplitz MLP Mixers are Low Complexity, Information-Rich Sequence Models

यह शोध पत्र टोप्लिट्ज़ एमएलपी मिक्सर (TMM) को प्रस्तुत करता है, जो एक ट्रांसफॉर्मर-समान आर्किटेक्चर है जो अन्य सब-क्वाड्रेटिक मॉडलों की तुलना में बेहतर प्रशिक्षण दक्षता, सूचना प्रतिधारण और इन-कॉन्टेक्स्ट लर्निंग प्रदर्शन प्रदर्शित करते हुए, सब-क्वाड्रेटिक जटिलता प्राप्त करने के लिए अटेंशन को त्रिकोणीय-मास्क्ड टोप्लिट्ज़ मैट्रिक्स गुणन से बदल देता है।

Benjamin L. Badger, Ethan Roland2026-05-11
🤖 AI

State Representation and Termination for Recursive Reasoning Systems

यह शोधपत्र पुनरावर्ती तर्क प्रणालियों (recursive reasoning systems) के लिए एक रूपरेखा प्रस्तावित करता है जो विकसित होते तर्क की स्थिति को एक ज्ञानपरक अवस्था ग्राफ (epistemic state graph) के रूप में निरूपित करता है और "ऑर्डर-गैप" (order-gap) मीट्रिक को एक स्थानीय, आवश्यक और पर्याप्त शर्त के रूप में प्रस्तुत करता है ताकि यह निर्धारित किया जा सके कि आगे का पुनरावृत्ति सुधार लाने की संभावना कम कब होती है।

Debashis Guha, Amritendu Mukherjee, Sanjay Kukreja, Tarun Kumar2026-05-11
🤖 machine learning

ProtSent: Protein Sentence Transformers

यह शोध पत्र ProtSent को पेश करता है, जो एक कंट्रास्टिव फाइन-ट्यूनिंग फ्रेमवर्क है जो प्रोटीन लैंग्वेज मॉडल्स को सामान्य-उद्देश्य वाले एम्बेडिंग मॉडल्स में अनुकूलित करता है, जिससे कार्य-विशिष्ट पर्यवेक्षण की आवश्यकता के बिना प्रोटीन कार्य, संरचना और विकास से संबंधित 23 डाउनस्ट्रीम कार्यों में प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dan Ofer, Oriel Perets, Michal Linial, Nadav Rappoport2026-05-11
🤖 machine learning

Benchmarked Yet Not Measured -- Generative AI Should be Evaluated Against Real-World Utility

यह शोध पत्र यह तर्क देता है कि जनरेटिव एआई के मजबूत बेंचमार्क प्रदर्शन और इसकी सीमित वास्तविक दुनिया की उपयोगिता के बीच का अंतर त्रुटिपूर्ण मूल्यांकन प्रथाओं से उत्पन्न होता है, और विशिष्ट परिनियोजन संदर्भों के भीतर मानव परिणामों में निरंतर सुधार को मापने की ओर मूल्यांकन को स्थानांतरित करने के लिए SCU-GenEval ढांचे का प्रस्ताव करता है।

Ishani Mondal, Shweta Bhardwaj2026-05-11