💬 NLP

Generative Value Conflicts Reveal LLM Priorities

यह शोधपत्र ConflictScope को प्रस्तुत करता है, जो एक स्वचालित पाइपलाइन है जो यह प्रकट करती है कि कैसे बड़े भाषा मॉडल (large language models) खुले-अंत वाले संघर्ष परिदृश्यों में अपने सुरक्षात्मक मूल्यों से व्यक्तिगत मूल्यों की ओर अपने मूल्य प्राथमिकताओं को बदलते हैं, साथ ही यह भी प्रदर्शित करती है कि विस्तृत सिस्टम प्रॉम्प्ट लक्षित मूल्य रैंकिंग के साथ संरेखण को मध्यम रूप से सुधार सकते हैं।

Andy Liu, Kshitish Ghate, Mona Diab, Daniel Fried, Atoosa Kasirzadeh, Max Kleiman-Weiner2026-02-27
💬 NLP

Improving Discrete Diffusion Unmasking Policies Beyond Explicit Reference Policies

यह शोध पत्र डिस्क्रीट डिफ्यूजन मॉडल्स के लिए एक लर्नड अनमास्किंग शेड्यूलर प्रस्तावित करता है, जिसे एक स्पष्ट रेफरेंस पॉलिसी के साथ KL-रेगुलराइज्ड मार्कोव डिसीजन प्रोसेस के रूप में तैयार किया गया है, जो सैद्धांतिक और अनुभवजन्य रूप से मौजूदा ह्यूरिस्टिक शेड्यूल्स से बेहतर प्रदर्शन करता है क्योंकि यह ऐसे सैंपल्स उत्पन्न करता है जो डेटा वितरण से बेहतर मेल खाते हैं।

Chunsan Hong, Seonho An, Min-Soo Kim, Jong Chul Ye2026-02-27
💬 NLP

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

यह शोध पत्र PATCH को प्रस्तुत करता है, जो एक नवीन विधि है जो भाषा मॉडल में व्यक्तिगत रूप से पहचान योग्य जानकारी (PII) के रिसाव के लिए जिम्मेदार विशिष्ट कम्प्यूटेशनल सर्किट की पहचान करती है और उन्हें सीधे संपादित करती है, जिससे मौजूदा सुरक्षा प्रणालियों की तुलना में डिफरेंशियल प्राइवेसी के साथ मिलकर काफी बेहतर प्राइवेसी-यूटिलिटी ट्रेड-ऑफ और लगभग शून्य अवशिष्ट रिसाव प्राप्त होता है।

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma2026-02-27
💬 NLP

Mapping Semantic & Syntactic Relationships with Geometric Rotation

यह शोध पत्र रोटर-इनवेरिएंट शिफ्ट एस्टीमेशन (RISE) प्रस्तुत करता है, जो एक ज्यामितीय विधि है जो विविध भाषाओं और एम्बेडिंग मॉडलों में विमर्श-स्तर के अर्थ संबंधी और वाक्य-रचनात्मक रूपांतरणों को सुसंगत घूर्णन संक्रियाओं के रूप में सफलतापूर्वक मैप करती है, जिससे वाक्य स्तर पर रैखिक प्रतिनिधित्व परिकल्पना के लिए अनुभवजन्य समर्थन प्राप्त होता है।

Michael Freenor, Lauren Alvarez2026-02-27
💬 NLP

PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions

यह शोध पत्र विस्तृत छवि विवरणों के मूल्यांकन के लिए एक सीन ग्राफ-निर्देशित LLM-as-a-Judge मीट्रिक, PoSh को प्रस्तुत करता है, और नए DOCENT बेंचमार्क के माध्यम से इसे मान्य करता है, जो मौजूदा मीट्रिक्स की तुलना में मानव निर्णयों के साथ बेहतर सहसंबंध और विविध प्रकार की छवियों में मजबूती प्रदर्शित करता है।

Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina El (…)2026-02-27
💬 NLP

RELOOP: Recursive Retrieval with Multi-Hop Reasoner and Planners for Heterogeneous QA

RELOOP एक संरचना-जागरूक रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है जो विषम साक्ष्य स्रोतों (टेक्स्ट, टेबल और नॉलेज ग्राफ) को एक पदानुक्रमित अनुक्रम में एकीकृत करता है और जटिल मल्टी-हॉप प्रश्नों को कुशलतापूर्वक हल करने के लिए गाइडेड, बजट-जागरूक पुनरावृत्ति के साथ एक मल्टी-एजेंट सिस्टम का उपयोग करता है, जिससे सटीकता और निरंतरता में सुधार होता है।

Ruiyi Yang, Hao Xue, Imran Razzak, Hakim Hacid, Flora D. Salim2026-02-27
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

यह शोधपत्र Toolathlon को प्रस्तुत करता है, जो 32 विविध अनुप्रयोगों और सत्यापन योग्य निष्पादन वाले 108 यथार्थवादी, दीर्घ-क्षितिज (long-horizon) कार्यों वाला एक व्यापक बेंचमार्क है, जिसे जटिल, वास्तविक दुनिया के बहु-चरणीय वर्कफ़्लो में वर्तमान अत्याधुनिक भाषा एजेंटों की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Ju (…)2026-02-27
💬 NLP

Temporal Sparse Autoencoders: Leveraging the Sequential Nature of Language for Interpretability

यह शोध पत्र टेम्पोरल स्पार्स ऑटोएनकोडर (T-SAEs) प्रस्तुत करता है, जो एक नवीन विधि है जो स्पष्ट सिमेंटिक सुपरविजन की आवश्यकता के बिना, कंट्रास्टिव लॉस के माध्यम से भाषा की अनुक्रमिक प्रकृति का लाभ उठाकर भाषा मॉडलों में अधिक सुचारू, सुसंगत और मानव-व्याख्या योग्य सिमेंटिक फीचर्स को खोजने का कार्य करती है।

Usha Bhalla, Alex Oesterling, Claudio Mayrink Verdun, Himabindu Lakkaraju, Flavio P. Calmon2026-02-27
💬 NLP

Intelligence per Watt: Measuring Intelligence Efficiency of Local AI

यह शोध पत्र स्थानीय AI इन्फरेंस (inference) की दक्षता का मूल्यांकन करने के लिए एक नए मीट्रिक के रूप में "इंटेलिजेंस पर वाट" (IPW) को प्रस्तुत करता है, जो एक बड़े पैमाने के अनुभवजन्य अध्ययन के माध्यम से यह प्रदर्शित करता है कि स्थानीय त्वरकों (accelerators) पर चलने वाले छोटे भाषा मॉडल क्लाउड-आधारित विकल्पों की तुलना में काफी बेहतर ऊर्जा दक्षता प्रदान करते हुए वास्तविक दुनिया के अधिकांश प्रश्नों को सटीक रूप से संभाल सकते हैं, जिससे केंद्रीकृत बुनियादी ढांचे से मांग को पुनर्वितरित करने के लिए स्थानीय इन्फरेंस को एक व्यवहार्य रणनीति के रूप में प्रमाणित किया जा सके।

Jon Saad-Falcon, Avanika Narayan, Hakki Orhun Akengin, J. Wes Griffin, Herumb Shandilya, Adrian Gamarra Lafuente, Medhya (…)2026-02-27
💬 NLP

Unmasking Reasoning Processes: A Process-aware Benchmark for Evaluating Structural Mathematical Reasoning in LLMs

टेम्पलेट-आधारित गणना के कारण वर्तमान बेंचमार्क की संतृप्ति को संबोधित करने के लिए, यह शोध पत्र ReasoningMath-Plus पेश करता है, जो 150 संरचनात्मक रूप से जटिल समस्याओं वाला एक प्रक्रिया-जागरूक (process-aware) बेंचमार्क है और एक संगत मूल्यांकन ढांचा (HCRS और एक प्रोसेस रिवॉर्ड मॉडल) है जो अग्रणी LLMs में उच्च उत्तर सटीकता और वास्तविक संरचनात्मक तर्क क्षमता के बीच महत्वपूर्ण अंतराल को प्रकट करता है।

Xiang Zheng, Weiqi Zhai, Wei Wang, Boyu Yang, Wenbo Li, Ruixiang Luo, Haoxiang Sun, Yucheng Wang, Zhengze Li, Meng Wang (…)2026-02-27