💬 NLP

Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

यह शोध पत्र टेस्ट-टाइम स्केलिंग के लिए एक हल्का, प्रोब-आधारित तरीका प्रस्तावित करता है जो फ्रोजन लार्ज लैंग्वेज मॉडल्स की आंतरिक अवस्थाओं का विश्लेषण करके मल्टी-स्टेप रीजनिंग को सत्यापित करता है, जिससे बिना किसी महंगी एनोटेशन के, बहुत बड़े प्रोसेस रिवॉर्ड मॉडल्स के तुलनीय या उनसे बेहतर प्रदर्शन प्राप्त होता है।

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin (…)2026-04-23
💬 NLP

Interpretability from the Ground Up: Stakeholder-Centric Design of Automated Scoring in Educational Assessments

यह शोध पत्र चार मुख्य सिद्धांतों (निष्ठा, आधारभूतता, पता लगाने की क्षमता और विनिमेयता) को परिभाषित करके व्याख्यात्मक स्वचालित स्कोरिंग के लिए एक हितधारक-केंद्रित दृष्टिकोण प्रस्तावित करता है और एनालिटिकस्कोर (AnalyticScore) ढांचे के माध्यम से यह प्रदर्शित करता है कि ऐसे व्याख्यात्मक सिस्टम अत्याधुनिक ब्लैक-बॉक्स मॉडल के समान सटीकता प्राप्त कर सकते हैं और मानव एनोटेशन व्यवहारों के साथ निकटता से संरेखित हो सकते हैं।

Yunsung Kim, Mike Hardy, Joseph Tey, Candace Thille, Chris Piech2026-04-23
💬 NLP

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

यह शोध पत्र SCOPE को प्रस्तुत करता है, जो एक टेस्ट-टाइम सुदृढीकरण लर्निंग (reinforcement learning) ढांचा है जो कन्फर्मेशन बायस (confirmation bias) और स्पार्स रिवॉर्ड्स (sparse rewards) को कम करने के लिए साधारण मेजॉरिटी वोटिंग को डायनेमिक सबग्रुप पार्टिशनिंग और कॉन्फिडेंस-वेटेड स्यूडो-लेबल एस्टीमेशन रणनीति से बदलकर LLM रीजनिंग को बढ़ाता है, जिससे चुनौतीपूर्ण गणितीय बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang2026-04-23
💬 NLP

Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMs

यह अध्ययन प्रदर्शित करता है कि जबकि पर्याप्त पर्यवेक्षण के साथ उथले ऑटो-रिग्रेसिव (autoregressive) LLMs में तार्किक संबंधात्मक अर्थ उभर सकते हैं, उनकी विशिष्ट प्रतिवर्तन विफलताएं (reversal failures) मुख्य रूप से उलटा तर्क की समझ की कमी के बजाय बाएं-से-दाएं क्रम पूर्वाग्रह के कारण होती हैं।

Yihua Zhu, Qianying Liu, Jiaxin Wang, Fei Cheng, Chaoran Liu, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira2026-04-23
💬 NLP

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

यह शोध पत्र पर्नोवेवर (PersonaWeaver) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विश्व-निर्माण (world-building) को व्यवहार-निर्माण (behavioral-building) से अलग करके मानक एलएलएम (LLMs) में निहित नैतिक और सहायकता संबंधी पूर्वाग्रहों को कम करता है, ताकि नाटकीय कहानी कहने के अनुकूल विविध नैतिक दृष्टिकोणों और संवादात्मक शैलियों वाले प्रक्रियात्मक रूप से विविध पात्र उत्पन्न किए जा सकें।

Maan Qraitem, Kate Saenko, Bryan A. Plummer2026-04-23
💬 NLP

Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization

यह शोध पत्र PURPLE को प्रस्तुत करता है, जो एक कॉन्टेक्स्टुअल बैंडिट फ्रेमवर्क है जो रिट्रीवल-ऑगमेंटेड LLM पर्सनलाइजेशन के लिए यूजर प्रोफाइल्स को अनुकूलित करने हेतु सिमेंटिक रेलेवेंस (semantic relevance) को जनरेशन लाइकलीहुड (generation likelihood) पर प्रशिक्षित प्लैकेट-लूस रैंकिंग मॉडल (Plackett-Luce ranking model) से बदलकर रिकॉर्ड चयन को सीधे रिस्पॉन्स क्वालिटी के साथ संरेखित करता है।

Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin (…)2026-04-23
💬 NLP

What Language Models Know But Don't Say: Non-Generative Prior Extraction for Generalization

यह शोध पत्र LoID को प्रस्तुत करता है, जो एक नियतात्मक (deterministic) विधि है जो लार्ज लैंग्वेज मॉडल्स के भीतर विपरीत अर्थ संबंधी दिशाओं में टोकन-स्तरीय आत्मविश्वास का विश्लेषण करके बायेशियन लॉजिस्टिक रिग्रेशन के लिए सूचनात्मक पूर्व वितरणों (prior distributions) को निकालती है, जिससे मौजूदा टेक्स्ट-जनरेशन आधारित दृष्टिकोणों की तुलना में छोटे, आउट-ऑफ-डिस्ट्रीब्यूशन टैबुलर डेटासेट पर सामान्यीकरण (generalization) में महत्वपूर्ण सुधार होता है।

Sara Rezaeimanesh, Mohammad M. Ghassemi2026-04-23
💬 NLP

Agnostic Language Identification and Generation

यह शोध पत्र भाषा पहचान और निर्माण में 'स्ट्रॉन्ग रियलाइज़ेबिलिटी' (strong realizability) धारणा को उन एग्नोस्टिक उद्देश्यों (agnostic objectives) का प्रस्ताव देकर शिथिल करता है जो इनपुट डेटा वितरणों पर कोई प्रतिबंध नहीं लगाते हैं, जिससे इन कार्यों के लिए नवीन लक्षण वर्णन और लगभग सटीक सांख्यिकीय दरें प्राप्त होती हैं।

Mikael Møller Høgsgaard, Chirag Pabbaraju2026-04-23
💬 NLP

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

यह शोधपत्र CAST को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एल्गोरिद्मिक प्रॉम्प्टिंग और स्पष्ट मध्यवर्ती तर्क का उपयोग करके सारांश और टैगिंग जैसे टेक्स्ट विश्लेषण कार्यों में लार्ज लैंग्वेज मॉडल्स के आउटपुट की स्थिरता को बढ़ाता है, जिससे गुणवत्ता से समझौता किए बिना स्थिरता में महत्वपूर्ण सुधार प्राप्त होता है।

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang2026-04-23
🤖 machine learning

Transparent Screening for LLM Inference and Training Impacts

यह शोध पत्र एक पारदर्शी, ऑडिट योग्य ढांचे को प्रस्तुत करता है जो प्राकृतिक-भाषा अनुप्रयोग विवरणों को सीमित पर्यावरणीय अनुमानों में परिवर्तित करता है ताकि बड़े भाषा मॉडलों के इन्फरेंस और प्रशिक्षण प्रभावों का तुलनात्मक विश्लेषण सक्षम किया जा सके, विशेष रूप से उन अपारदर्शी मालिकाना सेवाओं के लिए जहाँ प्रत्यक्ष माप उपलब्ध नहीं है।

Arnault Pachot, Thierry Petit2026-04-23