💬 NLP

The Illusion of Insight in Reasoning Models

यह शोध पत्र तर्क मॉडलों में अंतर्निहित "आहा!" (Aha!) क्षणों की धारणा को चुनौती देता है, यह प्रदर्शित करते हुए कि रीजनिंग के मध्य में होने वाले बदलाव दुर्लभ हैं, प्रशिक्षण की प्रगति से असंबद्ध हैं, और आमतौर पर अप्रभावी होते हैं, जो उन्हें अस्थिर अनुमान (inference) के लक्षणों के रूप में प्रकट करता है जिन्हें केवल उच्च अनिश्चितता के तहत कृत्रिम रूप से ट्रिगर किए जाने पर ही प्रदर्शन में सुधार के लिए लाभ उठाया जा सकता है।

Liv G. d'Aliberti, Manoel Horta Ribeiro2026-04-21
💬 NLP

Pearmut: Human Evaluation of Translation Made Trivial

यह शोधपत्र Pearmut को पेश करता है, जो एक हल्का और फीचर-समृद्ध प्लेटफॉर्म है जिसे बहुभाषी एनएलपी (NLP) कार्यों, विशेष रूप से मशीन अनुवाद के लिए मानव मूल्यांकन की सेटअप और निष्पादन को सरल बनाने के लिए डिज़ाइन किया गया है, जो इंजीनियरिंग बाधाओं को हटाकर और मानक प्रोटोकॉल का समर्थन करके विश्वसनीय मानव मूल्यांकन को मॉडल विकास का एक नियमित हिस्सा बनाता है।

Vilém Zouhar, Tom Kocmi2026-04-21
💬 NLP

Do LLMs Encode Functional Importance of Reasoning Tokens?

यह शोध पत्र ग्रीडी प्रूनिंग (greedy pruning) को प्रस्तुत करता है, जो गैर-आवश्यक रीजनिंग टोकन को पुनरावृत्ति से हटाने की एक संभावना-संरक्षण (likelihood-preserving) विधि है, जो यह प्रदर्शित करता है कि मॉडल आंतरिक रूप से कार्यात्मक महत्व को कूटबद्ध करते हैं और फ्रंटियर मॉडल्स से प्राप्त संकुचित श्रृंखलाओं पर प्रशिक्षित छात्रों की तुलना में उन छात्रों का प्रदर्शन बेहतर होता है जिन्हें इन प्रून की गई श्रृंखलाओं पर प्रशिक्षित किया गया है।

Janvijay Singh, Dilek Hakkani-Tür2026-04-21
💬 NLP

From Implicit to Explicit: Token-Efficient Logical Supervision for Mathematical Reasoning in LLMs

यह शोध पत्र फर्स्ट-स्टेप लॉजिकल रीजनिंग (FSLR) का प्रस्ताव करता है, जो एक टोकन-कुशल प्रशिक्षण ढांचा है जो तार्किक संबंध संबंधी समझ को बढ़ाने के लिए प्रारंभिक नियोजन चरण (initial planning step) को स्पष्ट रूप से पर्यवेक्षित करता है, जिससे यह सटीकता और प्रशिक्षण दक्षता दोनों में मानक चेन-ऑफ-थॉट (Chain-of-Thought) SFT से बेहतर प्रदर्शन करता है।

Shaojie Wang, Liang Zhang2026-04-21
💬 NLP

SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?

यह शोधपत्र SpeakerSleuth प्रस्तुत करता है, जो यह उजागर करता है कि यद्यपि लार्ज ऑडियो-लैंग्वेज मॉडल्स में अंतर्निहित ध्वनिक भेदभाव कौशल मौजूद हैं, फिर भी वे ध्वनिक संकेतों के बजाय पाठ्य सुसंगतता को प्राथमिकता देने वाले महत्वपूर्ण पूर्वाग्रह के कारण बहु-चरण संवादों में वक्ता की निरंतरता का विश्वसनीय रूप से निर्णय लेने में संघर्ष करते हैं।

Jonggeun Lee, Junseong Pyo, Gyuhyeon Seo, Yohan Jo2026-04-21
💬 NLP

When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation

यह शोध पत्र तर्क देता है कि विजन-लैंग्वेज मॉडल मूल्यांकन में, विवरण की विशिष्टता (specificity) को लंबाई से अलग किया जाना चाहिए, जो एक नियंत्रित डेटासेट के माध्यम से यह प्रदर्शित करता है कि संक्षिप्त और सूचना-सघन विवरण, शब्दबहुल विवरणों की तुलना में अधिक पसंद किए जाते हैं और यह भी कि लंबाई के बजट का आवंटन किस प्रकार किया जाता है, विशिष्टता को महत्वपूर्ण रूप से प्रभावित करता है।

Rhea Kapur, Robert Hawkins, Elisa Kreiss2026-04-21
💬 NLP

Reinforced Efficient Reasoning via Semantically Diverse Exploration

यह शोध पत्र ROSE का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है, जो मौजूदा MCTS-आधारित विधियों की सीमाओं को दूर करने के लिए सिमेंटिक-एन्ट्रॉपी-आधारित ब्रांचिंग, ε\varepsilon-एक्सप्लोरेशन और एक लेंथ-अवेयर सेगमेंट-लेवल एडवांटेज एस्टिमेटर को एकीकृत करके तर्क दक्षता और विविधता को बढ़ाता है।

Ziqi Zhao, Zhaochun Ren, Jiahong Zou, Liu Yang, Zhiwei Xu, Xuri Ge, Zhumin Chen, Xinyu Ma, Daiting Shi, Shuaiqiang Wang (…)2026-04-21
💬 NLP

Compositional Steering of Large Language Models with Steering Tokens

यह शोधपत्र कंपोजिशनल स्टीयरिंग टोकन्स (compositional steering tokens) प्रस्तुत करता है, जो एक ऐसी विधि है जो इनपुट टोकन्स में प्राकृतिक भाषा के व्यवहारों को समाहित करती है और प्रभावी ज़ीरो-शॉट मल्टी-बिहेवियर स्टीयरिंग को सक्षम करने के लिए एक समर्पित कंपोज़िशन टोकन सीखती है, जो मौजूदा एक्टिवेशन-आधारित और इंस्ट्रक्शन-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करती है।

Gorjan Radevski, Kiril Gashteovski, Giwon Hong, Carolin Lawrence, Goran Glavaš2026-04-21
💬 NLP

Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection

यह शोध पत्र MFMDScen प्रस्तुत करता है, जो एक व्यापक बहुभाषी बेंचमार्क है जो विविध आर्थिक परिदृश्यों में 22 लार्ज लैंग्वेज मॉडल्स के व्यवहार संबंधी पूर्वाग्रहों का मूल्यांकन करता है, जिससे यह पता चलता है कि वित्तीय गलत सूचनाओं का पता लगाने के मामले में वाणिज्यिक और ओपन-सोर्स दोनों मॉडल्स में महत्वपूर्ण पूर्वाग्रह बने हुए हैं।

Zhiwei Liu, Yupen Cao, Yuechen Jiang, Mohsinul Kabir, Polydoros Giannouris, Chen Xu, Ziyang Xu, Tianlei Zhu, Md. Tariquz (…)2026-04-21
💬 NLP

Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions

यह शोध पत्र यह प्रदर्शित करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स में निर्दिष्ट संभाव्यता वितरणों (probability distributions) से यादृच्छिक संख्याएँ उत्पन्न करने की क्षमता मौलिक रूप से नहीं है, जो बैच और स्वतंत्र सैंपलिंग दोनों मोड में गंभीर सांख्यिकीय विफलताओं को प्रदर्शित करते हैं जो डाउनस्ट्रीम अनुप्रयोगों में व्यवस्थित पूर्वाग्रहों को प्रसारित करते हैं।

Minda Zhao, Yilun Du, Mengyu Wang2026-04-21