💬 NLP

Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring

यह शोधपत्र TELLME प्रस्तुत करता है, जो एक नवीन विधि है जो उनके अंतर्निहित चिंतन प्रक्रियाओं (latent thinking processes) में सुधार करके लार्ज लैंग्वेज मॉडल्स की अंतर्निहित पारदर्शिता और निगरानी क्षमता को बढ़ाती है, जिससे अनुपयुक्त व्यवहारों की अधिक प्रभावी पहचान संभव हो पाती है और विविध आर्किटेक्चर एवं डिटॉक्सिफिकेशन कार्यों में निरंतर प्रदर्शन लाभ प्रदर्शित होता है।

Guanxu Chen, Jing Shao, Tao Luo, Lijie Hu, Qihao Lin, Dongrui Liu2026-05-28
💬 NLP

xKV: Cross-Layer KV-Cache Compression via Aligned Singular Vector Extraction

यह शोध पत्र xKV को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग विधि है जो परतों के बीच संरेखित सिंगुलर वेक्टर्स के संयुक्त गुणनखंडन (joint factorization) और चयनात्मक पुनर्निर्माण (selective reconstruction) के माध्यम से KV-कैश मेमोरी को 8 गुना संकुचित करती है और इन्फरेंस को 4.23 गुना तक तेज करती है, जो बिना प्रीट्रेनिंग की आवश्यकता के कुशल लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस के लिए एक प्लग-एंड-प्ले समाधान प्रदान करती है।

Chi-Chih Chang, Wei-Cheng Lin, Chien-Yu Lin, Hung-Yueh Chiang, Yash Akhauri, Xilai Dai, Huiqiang Jiang, Yucheng Li, Luis (…)2026-05-28
💬 NLP

Regression Language Models for Code

यह शोध पत्र एक एकीकृत, हल्के रिग्रेशन लैंग्वेज मॉडल (RLM) को प्रस्तुत करता है जो विभिन्न प्रोग्रामिंग भाषाओं और हार्डवेयर प्लेटफॉर्म्स में मेमोरी फुटप्रिंट, लेटेंसी और एक्यूरेसी सहित विविध कोड निष्पादन मेट्रिक्स की सटीक भविष्यवाणी करने के लिए एक फ्रोजन (frozen) LLM एनकोडर का लाभ उठाता है, जो बिना किसी कार्य-विशिष्ट अनुकूलन के पूर्व फीचर-इंजीनियर्ड और ग्राफ-आधारित दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Yash Akhauri, Xingyou Song, Arissa Wongpanich, Bryan Lewandowski, Mohamed S. Abdelfattah2026-05-28
💬 NLP

SelfJudge: Faster Speculative Decoding via Self-Supervised Judge Verification

यह शोधपत्र SelfJudge का प्रस्ताव करता है, जो एक स्व-पर्यवेक्षित (self-supervised) विधि है जो सिमेंटिक संरक्षण (semantic preservation) के आधार पर स्पेकुलेटिव डिकोडिंग उम्मीदवारों को सत्यापित करने के लिए स्वयं लक्षित मॉडल का उपयोग करके जज वर्िफायर को प्रशिक्षित करती है, जिससे मानव एनोटेशन या ग्राउंड ट्रुथ पर निर्भर किए बिना तेज़ और अधिक सामान्यीकरण योग्य LLM इन्फरेंस सक्षम होता है।

Kanghoon Yoon, Minsub Kim, Sungjae Lee, Joonhyung Lee, Sunghyeon Woo, Yeonjun In, Se Jung Kwon, Chanyoung Park, Dongsoo (…)2026-05-28
💬 NLP

Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages

यह शोध पत्र कैमेलिया (Camellia) को प्रस्तुत करता है, जो नौ एशियाई भाषाओं में 19,000 से अधिक एनोटेटेड संस्थाओं और 2,000 मास्क किए गए संदर्भों से युक्त एक बेंचमार्क है, ताकि गैर-पश्चिमी संस्कृतियों के संबंध में बहुभाषी लार्ज लैंग्वेज मॉडल्स (LLMs) में महत्वपूर्ण सांस्कृतिक पूर्वाग्रहों और संदर्भ समझ के अंतराल का मूल्यांकन और अनावरण किया जा सके।

Tarek Naous, Anagha Savit, Carlos Rafael Catalan, Geyang Guo, Jaehyeok Lee, Kyungdon Lee, Lheane Marie Dizon, Mengyu Ye (…)2026-05-28
💬 NLP

Probing Social Identity Bias in Chinese LLMs with Gendered Pronouns and Social Groups

यह अध्ययन दस चीनी लार्ज लैंग्वेज मॉडल्स में मैंडरिन-विशिष्ट प्रॉम्प्ट्स का उपयोग करके 240 सामाजिक समूहों में इनग्रुप (अंतःसमूह) और आउटग्रुप (बाह्यसमूह) फ्रेमिंग की तुलना करते हुए सामाजिक पहचान संबंधी पूर्वाग्रहों का मूल्यांकन करता है, जो यह प्रकट करता है कि हालांकि इंस्ट्रक्शन ट्यूनिंग भावना संबंधी विषमताओं को कम करती है, विषाक्तता अंतराल बने रहते हैं और स्पष्ट रूप से स्त्रीलिंग बहुवचन सर्वनामों के उपयोग से और अधिक बढ़ जाते हैं।

Geng Liu, Feng Li, Junjie Mu, Mengxiao Zhu, Francesco Pierri2026-05-28
💬 NLP

EAGer: Entropy-Aware GEneRation for Adaptive Inference-Time Scaling

EAGer एक प्रशिक्षण-मुक्त, एंट्रॉपी-जागरूक इन्फरेंस-टाइम स्केलिंग विधि है जो केवल उच्च-अनिश्चितता वाले टोकन पर ही रीजनिंग पथों को ब्रांच करके कंप्यूटेशनल संसाधनों को गतिशील रूप से आवंटित करती है, जिससे टोकन के उपयोग को 64% तक कम किया जा सकता है और जटिल रीजनिंग बेंचमार्क पर Pass@k प्रदर्शन में महत्वपूर्ण सुधार किया जा सकता है।

Daniel Scalena, Leonidas Zotos, Elisabetta Fersini, Malvina Nissim, Ahmet Üstün2026-05-28
💬 NLP

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training

यह शोध पत्र ORBIT को प्रस्तुत करता है, जो एक रूब्रिक-आधारित वृद्धिशील प्रशिक्षण ढांचा (incremental training framework) है जो खुले-अंत वाले चिकित्सा संवादों पर बड़े भाषा मॉडलों (large language models) को प्रभावी ढंग से संरेखित करने के लिए गतिशील रूप से जनरेट किए गए, केस-कंडीशन्ड रूब्रिक्स का लाभ उठाता है, जिससे पारंपरिक रिवॉर्ड मॉडलिंग की कमियों से बचते हुए न्यूनतम प्रशिक्षण डेटा के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang2026-05-28
💬 NLP

Assessing Factual Music Comprehension in Large Audio Language Models

यह शोध पत्र लार्ज ऑडियो लैंग्वेज मॉडल्स के लिए मौजूदा MusicQA मूल्यांकनों की तथ्यात्मक सटीकता संबंधी सीमाओं की आलोचना करता है और तीन विविध डेटासेट्स पर छह रिट्रीवल कार्यों के माध्यम से संगीत बोध का वस्तुनिष्ठ रूप से आकलन करने के लिए एक नए बेंचमार्क और प्रिसिजन (Precision), रिकॉल (Recall) और F1 स्कोर का उपयोग करने वाले एक संरचित प्रोटोकॉल को प्रस्तुत करता है।

Daniel Chenyu Lin, Michael Freeman, John Thickstun2026-05-28
💬 NLP

AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens

यह शोध पत्र AdvJudge-Zero प्रस्तुत करता है, जो एक ऐसी विधि है जो यह प्रदर्शित करती है कि जज के अपने वितरण (distribution) से नमूने के रूप में लिए गए छोटे, कम-परप्लेक्सिटी (low-perplexity) वाले टोकन का उपयोग करके LLM-as-a-Judge के बाइनरी फैसलों को उच्च सफलता दर के साथ बदला जा सकता है, और एक LoRA-आधारित रक्षा तंत्र का प्रस्ताव करता है जो इन प्रतिकूल हमलों (adversarial attacks) को प्रभावी ढंग से कम करता है और RLHF प्रशिक्षण में रिवॉर्ड कोलैप्स (reward collapse) को रोकता है।

Tung-Ling Li, Yuhao Wu, Hongliang Liu2026-05-28