🤖 machine learning

TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference

TIDE एक पोस्ट-ट्रेनिंग सिस्टम है जो लार्ज लैंग्वेज मॉडल्स में चेकपॉइंट लेयर्स के साथ हल्के सीखे हुए राउटर्स को जोड़कर प्रति-टोकन अर्ली एग्जिट (early exit) सक्षम बनाता है, जिससे बिना मॉडल रिट्रेनिंग के टोकन्स को उनके हिडन स्टेट्स अभिसरित (converge) होने पर अनावश्यक गणनाओं को छोड़ने की अनुमति मिलती है।

Jaber Jaber, Osama Jaber2026-03-24
💬 NLP

Conspiracy Frame: a Semiotically-Driven Approach for Conspiracy Theories Detection

यह शोध पत्र "कॉन्सपिरेसी फ्रेम" (Conspiracy Frame) को प्रस्तुत करता है, जो एक संकेत विज्ञान-संचालित (semiotically-driven) अर्थगत प्रतिनिधित्व और एक संगत एनोटेटेड टेलीग्राम डेटासेट (Con.Fra.) है, ताकि षड्यंत्र सिद्धांतों (conspiracy theories) का पता लगाने में सुधार किया जा सके, यह प्रदर्शित करते हुए कि जबकि फ्रेम-आधारित इन-कॉन्टेक्स्ट प्रॉम्प्टिंग क्षमता प्रदर्शित करती है, इन फ्रेम्स को अमूर्त अर्थगत पैटर्न में मैप करना अधिक सूक्ष्म, संकेत विज्ञान-जागरूक डिटेक्शन मॉडल के लिए एक आशाजनक मार्ग प्रदान करता है।

Heidi Campana Piva, Shaina Ashraf, Maziar Kianimoghadam Jouneghani, Arianna Longo, Rossana Damiano, Lucie Flek, Marco An (…)2026-03-24
🤖 machine learning

PLR: Plackett-Luce for Reordering In-Context Learning Examples

यह शोध पत्र PLR का प्रस्ताव करता है, जो एक संभाव्य पद्धति है जो इष्टतम इन-कॉन्टेक्स्ट उदाहरण क्रमों (in-context example orderings) को कुशलतापूर्वक सीखने के लिए प्लैकेट-लूस मॉडल (Plackett-Luce model) का लाभ उठाती है, जिससे व्यापक खोज की आवश्यकता के बिना वर्गीकरण और गणितीय तर्क कार्यों में फ्यू-शॉट सटीकता (few-shot accuracy) में निरंतर सुधार होता है।

Pawel Batorski, Paul Swoboda2026-03-24
💬 NLP

Multi-Perspective LLM Annotations for Valid Analyses in Subjective Tasks

यह शोध पत्र पर्सपेक्टिव-ड्रिवन इन्फरेंस (Perspective-Driven Inference) को प्रस्तुत करता है, जो एक अनुकूलन योग्य सैंपलिंग विधि है जो व्यक्तिपरक कार्यों में विविध जनसांख्यिकीय समूहों के बीच एलएलएम (LLM) एनोटेशन के वितरण का सटीक अनुमान लगाने के लिए एक सीमित मानव एनोटेशन बजट का लाभ उठाती है, जिससे एकल ग्राउंड-ट्रुथ धारणाओं की सीमाओं को संबोधित किया जा सके।

Navya Mehrotra, Adam Visokay, Kristina Gligorić2026-03-24
💬 NLP

Semantic Shift: the Fundamental Challenge in Text Embedding and Retrieval

यह शोध पत्र "सिमेंटिक शिफ्ट" (अर्थगत परिवर्तन)—जो पाठ के भीतर अर्थों का संरचित विकास और प्रसार है—को एम्बेडिंग कोलैप्स (एम्बेडिंग पतन) और रिट्रीवल डिग्रेडेशन (पुनर्प्राप्ति क्षरण) के पीछे के मौलिक कारण के रूप में पहचानता है, जो केवल टेक्स्ट की लंबाई से परे यह निदान करने के लिए एक नया सैद्धांतिक ढांचा और गणना योग्य मीट्रिक प्रदान करता है कि कब एनिसोट्रॉपी (विषमदैशिकता) डाउनस्ट्रीम कार्यों को नुकसान पहुँचाती है।

Hang Gao, Dimitris N. Metaxas2026-03-24
💬 NLP

PROMPT2BOX: Uncovering Entailment Structure among LLM Prompts

यह शोध पत्र PROMPT2BOX को पेश करता है, जो एक नवीन फ्रेमवर्क है जो केवल विषयगत समानता से परे विशिष्टता संबंधों (specificity relations) को पकड़ने के लिए LLM प्रॉम्प्ट्स को एक बॉक्स एम्बेडिंग स्पेस में एम्बेड करता है, जिससे पारंपरिक वेक्टर-आधारित विधियों की तुलना में अधिक सूक्ष्म कमजोरी विश्लेषण और बेहतर पदानुक्रमित क्लस्टरिंग (hierarchical clustering) सक्षम होती है।

Neeladri Bhuiya, Shib Sankar Dasgupta, Andrew McCallum, Haw-Shiuan Chang2026-03-24
💬 NLP

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

यह शोध पत्र KG-Hopper को पेश करता है, जो एक सुदृढीकरण लर्निंग (reinforcement learning) फ्रेमवर्क है जो कॉम्पैक्ट 7B ओपन-सोर्स LLMs को एक ही इन्फरेंस राउंड में एकीकृत मल्टी-हॉप नॉलेज ग्राफ रीजनिंग करने में सक्षम बनाता है, जो कई बेंचमार्क पर बड़े अनुक्रमिक (sequential) सिस्टमों और प्रोप्राइटरी मॉडल्स से बेहतर प्रदर्शन करता है।

Shuai Wang, Yinan Yu2026-03-24
💬 NLP

Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis

यह शोध पत्र क्रॉस-कॉन्टेक्स्ट वेरिफिकेशन (CCV) और पदानुक्रमित क्रॉस-कॉन्टेक्स्ट आर्किटेक्चर (HCCA) को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो स्वतंत्र सत्रों में समाधान विविधता को मापकर और वास्तविक तर्क एवं पूर्ण स्मरण (परफेक्ट रिकॉल) के बीच अंतर करने के लिए सूचना-प्रतिबंधित मल्टी-एजेंट विश्लेषण का उपयोग करके LLM कोडिंग कार्यों में बेंचमार्क संदूषण (कंटैमिनेशन) का पता लगाता है, जिससे मौजूदा पहचान विधियों की सीमाओं को दूर किया जा सके और पूर्व संदूषण लेबल में उच्च फाल्स पॉजिटिव दरों को उजागर किया जा सके।

Tae-Eun Song2026-03-24
🤖 machine learning

DSPA: Dynamic SAE Steering for Data-Efficient Preference Alignment

यह शोध पत्र DSPA को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम प्रेफरेंस अलाइनमेंट विधि है जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए प्रॉम्प्ट संदर्भ के आधार पर स्पार्स ऑटोएन्कोडर लेटेंट्स को गतिशील रूप से निर्देशित करता है, जिससे काफी कम कम्प्यूटेशनल लागत और बिना किसी वेट अपडेट के यह संभव होता है।

James Wedgwood, Aashiq Muhamed, Mona T. Diab, Virginia Smith2026-03-24
💬 NLP

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

यह शोध पत्र TaigiSpeech प्रस्तुत करता है, जो स्वास्थ्य सेवा और होम असिस्टेंट अनुप्रयोगों में इरादा पहचान (intent detection) के लिए डिज़ाइन किए गए 21 वृद्ध ताइवानी ताइगी वक्ताओं के 3,000 कथनों का एक वास्तविक दुनिया का डेटासेट है, साथ ही कम-संसाधन वाली, अलिखित भाषाओं के लिए लेबल किए गए डेटा की कमी को दूर करने हेतु LLM छद्म-लेबलिंग (pseudo-labeling) और मल्टीमॉडल फ्रेमवर्क का उपयोग करने वाली स्केलेबल डेटा माइनिंग रणनीतियों को भी प्रस्तुत करता है।

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-F (…)2026-03-24