💬 NLP

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

यह शोध पत्र बहुविकल्पीय प्रश्नों पर बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के आंतरिक ज्ञान और आउटपुट व्यवहार के बीच के बेमेल होने की पहचान करता है और उसे संबोधित करता है, जो हिडन रिप्रेजेंटेशन्स (छिपे हुए निरूपणों) का ज्यामितीय विश्लेषण करता है और KAPPA को पेश करता है, जो एक हल्का इन्फरेंस-टाइम हस्तक्षेप है जो सटीकता में सुधार करने के लिए ज्ञान और प्रेडिक्शन सबस्पेस (ज्ञान और भविष्यवाणी उप-स्थानों) को संरेखित करता है।

Yoonah Park, Haesung Pyun, Yohan Jo2026-02-05
💬 NLP

Scaling Agents for Computer Use

यह शोध पत्र बिहेवियर जज (BJudge) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो व्यवहार वृत्तांतों (behavior narratives) का उपयोग करके कई निष्पादन रोलआउट्स का मूल्यांकन और चयन करके कंप्यूटर-उपयोग एजेंटों की विश्वसनीयता में सुधार करता है, जिससे OSWorld पर मानव-स्तर की क्षमताओं से भी बेहतर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang2026-02-05
💬 NLP

Sparse Subnetwork Enhancement for Underrepresented Languages in Large Language Models

यह शोध पत्र एक लागत प्रभावी ढांचे का प्रस्ताव करता है जो लैंग्वेज एक्टिवेशन प्रोबेबिलिटी एंट्रॉपी (LAPE) का उपयोग करके भाषा-विशिष्ट विरल सबनेटवर्कों की पहचान और फाइन-ट्यूनिंग के माध्यम से बड़े भाषा मॉडलों में कम प्रतिनिधित्व वाली भाषाओं को उन्नत करता है, जिससे सामान्य क्षमताओं को बनाए रखते हुए और कैटास्ट्रोफिक फॉरगेटिंग को रोकते हुए न्यूनतम पैरामीटर अपडेट के साथ बेहतर प्रदर्शन प्राप्त होता है।

Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Simon Ostermann2026-02-05
💬 NLP

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

यह शोध पत्र एक संरचित रेड-टीमिंग चुनौती के माध्यम से विकसित जेलब्रेक रणनीतियों का एक व्यापक, तंत्र-उन्मुख वर्गीकरण प्रस्तुत करता है, जिसका उपयोग हमलों की व्यापकता का विश्लेषण करने, एक वर्गीकरण-निर्देशित डिटेक्टर के रूप में GPT-5 को बेंचमार्क करने और जेलब्रेक डिटेक्शन अनुसंधान को आगे बढ़ाने के लिए एक नया इतालवी मल्टी-टर्न एडवर्सरियल डेटासेट पेश करने के लिए किया गया है।

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi2026-02-05
💬 NLP

EvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&A

यह शोधपत्र EvasionBench प्रस्तुत करता है, जो अर्निंग कॉल्स (earnings calls) में प्रबंधकीय टालमटोल (managerial evasion) का पता लगाने के लिए एक बड़े पैमाने का बेंचमार्क और वर्गीकरण है, जिसमें एक कड़ाई से एनोटेट किया गया डेटासेट और एक विशेष 4B-पैरामीटर वाला क्लासिफायर है जो अग्रणी वाणिज्यिक मॉडलों से बेहतर प्रदर्शन करता है।

Shijian Ma, Yan Lin, Yi Yang2026-02-05
💬 NLP

SpeechMapper: Speech-to-text Embedding Projector for LLMs

SpeechMapper एक गणनात्मक रूप से कुशल, दो-चरणीय प्रशिक्षण ढांचे को पेश करता है जो न्यूनतम निर्देश ट्यूनिंग लागू करने से पहले एक स्पीच-टू-टेक्स्ट प्रोजेक्टर को स्वतंत्र रूप से प्री-ट्रेन करता है, जिससे बड़े पैमाने पर निर्देश डेटा पर सभी घटकों को संयुक्त रूप से प्रशिक्षित करने से जुड़े ओवरफिटिंग और उच्च लागतों से बचते हुए, स्पीच-LLM एकीकरण में बेहतर सामान्यीकरण और प्रदर्शन प्राप्त किया जाता है।

Biswesh Mohapatra, Marcely Zanon Boito, Ioan Calapodescu2026-02-05
💬 NLP

Latent Chain-of-Thought as Planning: Decoupling Reasoning from Verbalization

यह शोध पत्र PLaT प्रस्तुत करता है, जो एक ऐसा ढांचा है जो गुप्त तर्क (latent reasoning) को एक नियत नियोजन प्रक्षेपवक्र (deterministic planning trajectory) के रूप में मॉडल करके तर्क को मौखिक अभिव्यक्ति (verbalization) से अलग करता है, जिससे गतिशील समाप्ति (dynamic termination) और ग्रीडी सटीकता (greedy accuracy) में समझौते के बावजूद समाधान विविधता में बेहतर स्केलेबिलिटी सक्षम होती है।

Jiecong Wang, Hao Peng, Chunyang Liu2026-02-05
💬 NLP

Scaling Multiagent Systems with Process Rewards

यह शोध पत्र MAPPA को प्रस्तुत करता है, जो एक फाइन-ट्यूनिंग विधि है जो मल्टी-एजेंट सिस्टम में क्रेडिट असाइनमेंट और सैंपल एफिशिएंसी की चुनौतियों को हल करने के लिए AI फीडबैक से प्राप्त प्रति-एक्शन प्रोसेस रिवार्ड्स का लाभ उठाती है, जो जटिल गणित और डेटा विश्लेषण कार्यों पर महत्वपूर्ण प्रदर्शन सुधार प्रदर्शित करती है।

Ed Li, Junyu Ren, Cat Yan2026-02-05
💬 NLP

Linguistic Blind Spots in Clinical Decision Extraction

यह अध्ययन प्रकट करता है कि क्लिनिकल डिसीजन एक्सट्रैक्शन मॉडल नैरेटिव-शैली के स्पैन के साथ संघर्ष करते हैं जिनमें हेजिंग (संशय), निषेध (negation) और उच्च स्टॉपवर्ड अनुपात होता है—जो सलाह और सावधानी श्रेणियों में सामान्य हैं—जो इन भाषाई ब्लाइंड स्पॉट्स को संबोधित करने के लिए बाउंड्री-टोलरेंट मूल्यांकन रणनीतियों की आवश्यकता को रेखांकित करता है।

Mohamed Elgaar, Hadi Amiri2026-02-05
💬 NLP

Likelihood-Based Reward Designs for General LLM Reasoning

यह शोध पत्र व्यवस्थित रूप से यह प्रदर्शित करता है कि चेन-ऑफ-थॉट रीजनिंग पर बड़े भाषा मॉडलों को फाइन-ट्यून करने के लिए संदर्भ उत्तर के लॉग-प्रोबेबिलिटी (log-probability) का उपयोग करना एक श्रेष्ठ और बहुमुखी विधि है, जो सत्यापन योग्य (verifiable) सेटिंग्स में बाइनरी रिवॉर्ड्स से बेहतर प्रदर्शन करती है और गैर-सत्यापन योग्य (non-verifiable) परिदृश्यों में सुपरवाइज्ड फाइन-ट्यूनिंग के बराबर होती है, जबकि संभाव्यता-आधारित विकल्पों के दोषों से बचती है।

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier2026-02-05