🤖 machine learning

Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs

यह शोध पत्र डिक्शनरी-अलाइन्ड कॉन्सेप्ट कंट्रोल (DACO) को प्रस्तुत करता है, जो 15,000 मल्टीमॉडल अवधारणाओं के एक क्यूरेटेड डेटासेट और एक स्पार्स ऑटोएनकोडर का लाभ उठाकर फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के ग्रैनुलर, इन्फरेंस-टाइम स्टीयरिंग को सक्षम बनाता है, जो उनकी सामान्य क्षमताओं को संरक्षित करते हुए दुर्भावनापूर्ण प्रश्नों के विरुद्ध उनकी सुरक्षा को महत्वपूर्ण रूप से बढ़ाता है।

Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal2026-04-13
🤖 machine learning

Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective

यह शोध पत्र यह प्रदर्शित करके चेन-ऑफ-थॉट डिस्टिलेशन (Chain-of-Thought distillation) में एक सार्वभौमिक क्षमता अंतराल की प्रचलित धारणा को चुनौती देता है कि प्रदर्शन में गिरावट अक्सर अंतर्निहित मॉडल सीमाओं के बजाय त्रुटिपूर्ण मूल्यांकन प्रोटोकॉल से उत्पन्न होती है, जिससे प्रभावी शिक्षक-छात्र युग्मों के चयन के लिए व्यावहारिक दिशा-निर्देश प्रदान किए जा सके।

Tokio Kajitsuka, Ukyo Honda, Sho Takase2026-04-13
💬 NLP

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

यह शोध पत्र TaxPraBen को प्रस्तुत करता है, जो 13 चीनी कर अभ्यास कार्यों—जिसमें जोखिम रोकथाम और रणनीति योजना जैसे वास्तविक परिदृश्य शामिल हैं—पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला स्केलेबल बेंचमार्क है—जो मॉडल्स के बीच प्रदर्शन में महत्वपूर्ण असमानताओं को प्रकट करता है और कानूनी रूप से विनियमित डोमेन में विशेष मूल्यांकन की आवश्यकता पर प्रकाश डालता है।

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yu2026-04-13
💬 NLP

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

यह शोध पत्र लिटमस (Re)Agent को प्रस्तुत करता है, जो एक DAG-संचालित एजेंटिक प्रणाली और 1,500 प्रश्नों का एक नियंत्रित बेंचमार्क है जिसे संरचित तर्क के माध्यम से अपूर्ण साक्ष्यों को संश्लेषित करके लक्षित भाषाओं में बहुभाषी मॉडल के प्रदर्शन का पूर्वानुमान लगाने के लिए डिज़ाइन किया गया है, जो उन परिदृश्यों में उत्कृष्ट सटीकता प्रदर्शित करता है जहाँ प्रत्यक्ष मूल्यांकन डेटा विरल होता है।

Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury2026-04-13
💬 NLP

Confident in a Confidence Score: Investigating the Sensitivity of Confidence Scores to Supervised Fine-Tuning

यह शोध पत्र इस बात की जांच करता है कि कैसे सुपरवाइज्ड फाइन-ट्यूनिंग (supervised fine-tuning) भाषा मॉडलों में कॉन्फिडेंस स्कोर और आउटपुट गुणवत्ता के बीच के सहसंबंध को कम करती है, यह प्रदर्शित करते हुए कि प्रशिक्षण वितरण की समानता जैसे कारकों के कारण ये मेट्रिक्स 'ऑफ-द-शेल्फ' (off-the-shelf) अविश्वसनीय हो जाते हैं और अधिक मजबूत अनिश्चितता परिमाणीकरण (uncertainty quantification) विधियों की तत्काल आवश्यकता पर प्रकाश डालते हैं।

Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Jackie Chi Kit Cheung2026-04-13
💬 NLP

Quantisation Reshapes the Metacognitive Geometry of Language Models

यह शोध पत्र यह प्रदर्शित करता है कि मॉडल क्वांटाइजेशन (quantization), अंतर्निहित भेदभाव संकेतों (discrimination signals) को प्रभावित किए बिना M-अनुपात सामान्यीकरणों (M-ratio normalizations) को बदलकर, LLMs में डोमेन-स्तरीय मेटाकॉग्निटिव दक्षता प्रोफाइलों को मौलिक रूप से पुनर्गठित करता है, जिससे इन्फरेंस फॉर्मेट (inference format) पर विश्वास-आधारित डायग्नोस्टिक्स की एक महत्वपूर्ण निर्भरता का पता चलता जिसे डोमेन-कंडीशनल ट्रेनिंग के माध्यम से हल नहीं किया जा सकता है।

Jon-Paul Cacioli2026-04-13
💬 NLP

Testing the Assumptions of Active Learning for Translation Tasks with Few Samples

यह शोध पत्र कम नमूनों वाले अनुवाद कार्यों के लिए सक्रिय शिक्षण (active learning) की मूल धारणाओं को इस तथ्य को प्रदर्शित करते हुए चुनौती देता है कि चयनित डेटा की सूचनात्मकता (informatity) और विविधता का प्रदर्शन के साथ कोई सहसंबंध नहीं है, जबकि नमूना क्रम (sample ordering) और प्री-ट्रेनिंग डेटा के साथ अंतःक्रियाएं ही सफलता के प्राथमिक चालक हैं।

Lorenzo Jaime Yu Flores, Cesare Spinoso di-Piano, Ori Ernst, David Ifeoluwa Adelani, Jackie Chi Kit Cheung2026-04-13
💬 NLP

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

यह शोध पत्र PerMix-RLVR का प्रस्ताव करता है, जो एक प्रशिक्षण रणनीति है जो रोल-प्लेइंग कार्यों में हानिकारक व्यक्तित्व विविधताओं के विरुद्ध मॉडल की मजबूती को बढ़ाने और उच्च-सटीक व्यक्तित्व अभिव्यक्ति को बनाए रखने के लिए सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ व्यक्तित्व मिश्रण (persona mixing) को सुदृढीकरण लर्निंग (reinforcement learning) के साथ जोड़ती है।

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun2026-04-13
💬 NLP

Towards Linguistically-informed Representations for English as a Second or Foreign Language: Review, Construction and Application

यह शोध पत्र 1,643 एनोटेटेड वाक्यों के एक नवीन, रचनावादी-आधारित वाक्य-अर्थ संबंधी संसाधन का निर्माण करके अंग्रेजी को दूसरी भाषा या विदेशी भाषा (ESFL) के रूप में समर्पित निरूपणों की आवश्यकता को संबोधित करता है, जो ESFL को एक विशिष्ट भाषाई प्रणाली के रूप में पकड़ता है और भाषाई निकेत परिकल्पना (Linguistic Niche Hypothesis) के एक पायलट अध्ययन के माध्यम से द्वितीय भाषा अधिग्रहण अनुसंधान में इसकी उपयोगिता को प्रदर्शित करता है।

Wenxi Li, Xihao Wang, Weiwei Sun2026-04-13
💬 NLP

Regime-Conditional Retrieval: Theory and a Transferable Router for Two-Hop QA

यह शोध पत्र टू-हॉप QA रिट्रीवल में Q-डोमिनेंट और B-डोमिनेंट रेजीमों के बीच के सैद्धांतिक अंतर को औपचारिक रूप बनाता है और RegimeRouter को पेश करता है, जो एक हल्का, ज़ीरो-शॉट ट्रांसफ़रेबल राउटर है जो अनुकूलतम रिट्रीवल रणनीतियों को गतिशील रूप से चुनने के लिए सरफेस-टेक्स्ट प्रेडिकेट्स का लाभ उठाता है, जिससे बेंचमार्क डेटासेट्स पर रिकॉल में महत्वपूर्ण सुधार होता है।

Andre Bacellar2026-04-13