💬 NLP

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+ एक एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) फ्रेमवर्क है जो रणनीतिक सारांशीकरण और मॉडल-नियंत्रित पुनरावृत्ति सीमाओं के माध्यम से पुनरावृत्तीय तर्क को अनुकूलित करता है, जो पारंपरिक लॉन्ग चेन-ऑफ-थॉट विधियों की तुलना में सटीकता, दक्षता और सामान्यीकरण में महत्वपूर्ण सुधार करता है।

Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongl (…)2026-06-03
💬 NLP

Letting Tutor Personas Speak Up for LLMs: Learning Steering Vectors from Dialogue via Preference Optimization

यह शोध पत्र मानव संवाद के माध्यम से प्राथमिकता अनुकूलन (preference optimization) द्वारा स्टीयरिंग वेक्टर्स (steering vectors) सीखकर लार्ज लैंग्वेज मॉडल (LLM) ट्यूटरिंग व्यवहार को नियंत्रित करने की एक विधि प्रस्तावित करता है, जो मॉडल को स्पष्ट प्रॉम्प्टिंग के बिना विविध ट्यूटर व्यक्तित्वों को अनुकूल रूप से आत्मसात करने में सक्षम बनाता है और साथ ही सिमेंटिक संरेखण (semantic alignment) और व्याख्यात्मकता में सुधार करता है।

Jaewook Lee, Alexander Scarlatos, Simon Woodhead, Andrew Lan2026-06-03
💬 NLP

Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers

यह शोध पत्र यह पहचान करता है कि मौजूदा कॉन्फिडेंस कैलिब्रेशन विधियाँ बड़े भाषा मॉडल (LLMs) के लिए तब विफल हो जाती हैं जब प्रश्नों के कई सही उत्तर होते हैं क्योंकि वे व्यवस्थित रूप से कम आकलन (underestimation) करते हैं, और एक नया बेंचमार्क (MACE) तथा एक सिमेंटिक कॉन्फिडेंस एग्रीगेशन (SCA) विधि प्रस्तावित करता है ताकि एकल और बहु-उत्तर परिदृश्यों दोनों में सुदृढ़ कैलिब्रेशन प्राप्त किया जा सके।

Yuhan Wang, Shiyu Ni, Zhikai Ding, Zihang Zhan, Yuanzi Li, Keping Bi2026-06-03
💬 NLP

Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs

यह शोध पत्र यह प्रदर्शित करता है कि व्याख्यात्मक कलाकृतियों (interpretability artifacts) पर हल्के, फ्रोजन एडेप्टर (frozen adapters) को प्रशिक्षित करना बड़े भाषा मॉडलों को अंतर्निहित मॉडल को संशोधित किए बिना, विभिन्न कार्यों और पैमानों में विश्वसनीय, उच्च-गुणवत्ता वाली स्व-व्याख्याएं उत्पन्न करने में सक्षम बनाता है।

Keenan Pepper, Alex McKenzie, Florin Pop, Stijn Servaes, Martin Leitgab, Mike Vaiana, Judd Rosenblatt, Michael S. A. Gra (…)2026-06-03✓ Author reviewed
💬 NLP

When Should LLMs Be Less Specific? Selective Abstraction for Reliable Long-Form Text Generation

यह शोध पत्र सेलेक्टिव एब्स्ट्रैक्शन (Selective Abstraction) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो अनिश्चित परमाणु दावों (atomic claims) को कम विशिष्ट, उच्च-विश्वास वाले अमूर्तीकरणों (abstractions) से बदलकर दीर्घ-रूप (long-form) एलएलएम जनरेशन की विश्वसनीयता को बढ़ाता है, जिससे प्रतिक्रिया की समग्र सूचनात्मक सामग्री को संरक्षित करते हुए सटीकता में महत्वपूर्ण सुधार होता है।

Shani Goren, Ido Galil, Ran El-Yaniv2026-06-03
💬 NLP

Whom to Query for What: Adaptive Group Elicitation via Multi-Turn LLM Interactions

यह शोध पत्र एक सैद्धांतिक रूप से आधारित, अनुकूलन योग्य ढांचे का प्रस्ताव करता है जो सीमित बजट और लुप्त डेटा के तहत जनसंख्या-स्तरीय प्रतिक्रिया भविष्यवाणी में सुधार करने के लिए, प्रश्नों और उत्तरदाताओं दोनों को गतिशील रूप से चुनने हेतु LLM-आधारित प्रश्न स्कोरिंग को हेट्रोजेनियस ग्राफ न्यूरल नेटवर्क प्रसार के साथ जोड़ता है।

Ruomeng Ding, Tianwei Gao, Thomas P. Zollo, Eitan Bachmat, Richard Zemel, Zhun Deng2026-06-03
💬 NLP

MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation

यह शोध पत्र MT-OSC को प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो एक कंडेंसर एजेंट (Condenser Agent) और एक लाइटवेट डिसाइडर (Decider) का उपयोग करके मल्टी-टर्न चैट हिस्ट्री को स्वचालित और कुशलतापूर्वक संकुचित करता है, जिससे विविध संवादात्मक बेंचमार्क पर LLM प्रदर्शन को संरक्षित या बेहतर करते हुए टोकन की संख्या और विलंबता (latency) को महत्वपूर्ण रूप से कम किया जाता है।

Jyotika Singh, Fang Tu, Miguel Ballesteros, Weiyi Sun, Sandip Ghoshal, Michelle Yuan, Yassine Benajiba, Sujith Ravi, Dan (…)2026-06-03
🤖 machine learning

Hallucination Is Linearly Decodable from Mid-Layer Hidden States in Quantized LLMs

यह शोध पत्र प्रदर्शित करता है कि 4-बिट क्वांटाइज़्ड ओपन-सोर्स एलएलएम (LLMs) के मिड-लेयर हिडन स्टेट्स में मतिभ्रम (hallucination) को एनकोड करने वाला एक रैखिक रूप से विभाज्य सत्यता संकेत (linearly separable truthfulness signal) मजबूती से मौजूद है, जो सरल लीनियर प्रोब्स का उपयोग करके लगभग पूर्ण AUROC स्कोर के साथ पता लगाने में सक्षम बनाता है, जबकि सैंपलिंग-आधारित विधियाँ समान मूल्यांकन प्रोटोकॉल के तहत काफी खराब प्रदर्शन करती हैं।

Aizierjiang Aiersilan2026-06-03
💻 computer science

Attention Calibration for Position-Fair Dense Information Retrieval

यह शोध पत्र एक ट्यूनेबल स्ट्रेंथ कोएफिशिएंट (tunable strength coefficient) के साथ एक इन्फरेंस-टाइम अटेंशन कैलिब्रेशन विधि प्रस्तुत करता है जो कई भाषाओं और डोमेन में डेंस रिट्रीवल मॉडल्स में पोजीशनल बायस को प्रभावी ढंग से कम करता है, जिससे समग्र रिट्रीवल प्रदर्शन से समझौता किए बिना या मॉडल को पुन: प्रशिक्षित किए बिना पोजीशनल फेयरनेस में सुधार होता है।

Andrianos Michail, Elias Schuhmacher, Juri Opitz, Simon Clematide, Rico Sennrich2026-06-03
💬 NLP

Greener Than Humans? Environmental Attitudes in Large Language Models

यह शोध पत्र 31 बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में पर्यावरणीय दृष्टिकोणों का मूल्यांकन करने के लिए एक बेंचमार्क प्रस्तुत करता है, जिसमें यह पाया गया है कि वे अक्सर औसत मानव की तुलना में अधिक प्रगतिशील स्थिरता रुख प्रदर्शित करते हैं लेकिन प्रॉम्प्टिंग के माध्यम से वैचारिक हेरफेर के प्रति संवेदनशील बने रहते हैं, जिससे स्थिरता संबंधी निर्णय लेने के लिए उनके परिनियोजन में शासन और निरीक्षण की आवश्यकता पर बल मिलता है।

Stefanie Kunkel, Tilman Hartwig, Marcus Voss, Emma K. Schütt, Angelika Gellrich2026-06-03