💻 computer science

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

यह शोध पत्र माइंडस्केप-अवेयर आरएजी (MiA-RAG) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो पदानुक्रमित सारांशीकरण के माध्यम से एक वैश्विक अर्थपूर्ण "माइंडस्केप" का निर्माण करके एलएलएम-आधारित प्रणालियों में दीर्घ-संदर्भ समझ को बढ़ाता है ताकि पुनर्प्राप्ति और सृजन दोनों को निर्देशित किया जा सके, जिससे बिखरे हुए साक्ष्यों के बीच अधिक मानवीय, सुसंगत तर्क सक्षम हो सके।

Yuqing Li, Jiangnan Li, Zheng Lin, Ziyan Zhou, Junjie Wu, Weiping Wang, Jie Zhou, Mo Yu2026-05-29
🤖 machine learning

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

यह शोध पत्र बड़े भाषा मॉडलों (large language models) में टोकेनाइज़र प्रत्यारोपण (tokenizer transplantation) में एक संरचनात्मक "असममित यथार्थता" (asymmetric realizability) भेद्यता की पहचान करता है, जहाँ विशिष्ट गुणांक वेक्टरों (coefficient vectors) को "ब्रेकर टोकन" के रूप में इंजीनियर किया जा सकता है जो डोनर मॉडल में निष्क्रिय रहते हैं लेकिन बेस मॉडल में उच्च-सैलियन्स पुनर्निर्माण (high-salience reconstructions) को ट्रिगर करते हैं, जिससे वे मानक वेट-मर्जिंग जाँच और LoRA-आधारित शमन (mitigations) से बच निकलते हैं।

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao2026-05-29
💻 computer science

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

यह शोध पत्र भाषा मॉडल आत्मविश्वास अनुमान (language model confidence estimation) के लिए एक नवीन मूल्यांकन ढांचा प्रस्तुत करता है जो मजबूती, स्थिरता और भाषाई विविधताओं के प्रति संवेदनशीलता का आकलन करता है, जिससे यह पता चलता है कि मौजूदा विधियाँ अक्सर अर्थपूर्ण रूप से भिन्न उत्तरों के बीच अंतर करने में विफल रहती हैं, भले ही वे शुद्धता के अनुरूप हों।

Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth2026-05-29
🤖 AI

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

यह शोध पत्र 'रूलर्स' (Rulers) का परिचय देता है, जो एक तीन-चरणीय इन्फरेंस-टाइम फ्रेमवर्क है जो मानवीय रूब्रिक्स को लॉक किए गए विनिर्देशों (specifications) में परिवर्तित करता है, संरचित साक्ष्य ग्राउंडिंग (structured evidence grounding) को लागू करता है, और विविध टेक्स्ट मूल्यांकन कार्यों में अधिक विश्वसनीय और मानव-संरेखित (human-aligned) एलएलएम स्कोरिंग प्राप्त करने के लिए सामान्य विफलता मोड पर काबू पाने हेतु पोस्ट-हॉक अंशांकन (post-hoc calibration) लागू करता है।

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong2026-05-29
🤖 AI

Steering Language Models Before They Speak: Logit-Level Interventions

यह शोध पत्र SWAI को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) इन्फरेंस-टाइम विधि है जो कॉर्पस-व्युत्पन्न सांख्यिकीय पूर्वाग्रहों (statistical biases) को सीधे टॉप-K लोगिट उम्मीदवारों (top-K logit candidates) पर लागू करके भाषा मॉडल के आउटपुट को विनम्रता या पठनीयता जैसे विशिष्ट गुणों की ओर निर्देशित करता है, जिससे मॉडल मापदंडों को संशोधित किए बिना या सहायक मॉडलों की आवश्यकता के बिना बेहतर नियंत्रण प्राप्त होता है।

Hyeseon An, Shinwoo Park, Hyundong Jin, Yo-Sub Han2026-05-29
💻 computer science

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

यह शोध पत्र "ThinkTwice" का प्रस्ताव करता है, जो एक ऐसा ढांचा (framework) है जो सैंपलिंग के माध्यम से कई संभावित आउटपुट उत्पन्न करने और अनसुपरवाइज्ड एग्रीमेंट (unsupervised agreement) या सुपरवाइज्ड रिवॉर्ड मॉडल के माध्यम से सर्वश्रेष्ठ का चयन करके दस्तावेज़-स्तरीय सूचना निष्कर्षण (document-level information extraction) में सुधार करता है, जिससे यह पारंपरिक ग्रीडी डिकोडिंग (greedy decoding) विधियों से बेहतर प्रदर्शन करता है।

Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre2026-05-29
🤖 machine learning

Procedural Pretraining: Warming Up Language Models with Abstract Data

यह शोध पत्र यह प्रदर्शित करता है कि "प्रक्रियात्मक प्रीट्रेनिंग" (procedural pretraining), जिसमें भाषा मॉडलों को औपचारिक भाषाओं और एल्गोरिदम द्वारा उत्पन्न अमूर्त संरचित डेटा के एक छोटे अंश के संपर्क में शुरू में लाया जाता है, मानक प्राकृतिक भाषा प्रीट्रेनिंग की तुलना में उनकी तर्क करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है, अभिसरण (convergence) को तेज करता है, और कम्प्यूटेशनल लागत को कम करता है।

Liangze Jiang, Zachary Shinnick, Anton van den Hengel, Hemanth Saratchandran, Damien Teney2026-05-29
🤖 AI

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

यह शोध पत्र 'चेन-ऑफ-मेटा-थॉट' (CoMT) और 'कॉन्फिडेंस-कैलिब्रेटेड रीइन्फोर्समेंट लर्निंग' (CCRL) नामक एक संज्ञानात्मक रूप से संरेखित पोस्ट-ट्रेनिंग फ्रेमवर्क का प्रस्ताव करता है जो एलएलएम (LLM) तर्क की सामान्यीकरण क्षमता और विश्वसनीयता में सुधार करने के लिए अमूर्त रणनीति अधिग्रहण को विशिष्ट निष्पादन से अलग करता है, जिससे मानक विधियों की तुलना में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Shaojie Wang, Liang Zhang2026-05-29
🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

यह शोध पत्र प्रोएक्टिव इंटरएक्टिव रीजनिंग (PIR) को प्रस्तुत करता है, जो एक नया प्रतिमान (पैराडाइम) है जो तर्क करने वाले LLMs को पैसिव सॉल्वर से प्रोएक्टिव इनक्वायरर में बदल देता है, जो आधार (प्रिमाइज़) और इरादे की अनिश्चितता को संबोधित करने के लिए आंतरिक तर्क के साथ उपयोगकर्ता स्पष्टीकरण को जोड़ता है, जिससे सटीकता और दक्षता में उल्लेखनीय सुधार होता है और कम्प्यूटेशनल लागत कम होती है।

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang2026-05-29
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

यह शोध पत्र PEAR को पेश करता है, जो एक SFT-चरण की विधि है जो ऑफलाइन डेटा और भविष्य की RL नीतियों के बीच बेमेल (mismatch) के आधार पर प्रशिक्षण नुकसान (training losses) को पुन: भारित (reweight) करने के लिए इम्पॉर्टेंस सैंपलिंग का उपयोग करती है, जिससे मानक SFT की तुलना में रीजनिंग कार्यों पर डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29