💬 NLP

OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs

OmniTrace एक हल्का, मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो ओम्नी-मोडल लार्ज लैंग्वेज मॉडल्स में उत्पन्न कथनों के एट्रिब्यूशन (attribution) की चुनौती को संबोधित करता है, जो एट्रिब्यूशन को जनरेशन-टाइम ट्रेसिंग समस्या के रूप में औपचारिक रूप देता है, जिससे बिना किसी रिट्रेनिंग या सुपरविजन के सुसंगत, स्पैन-स्तरीय क्रॉस-मोडल स्पष्टीकरण सक्षम होते हैं।

Qianqi Yan, Yichen Guo, Ching-Chen Kuo, Shan Jiang, Hang Yin, Yang Zhao, Xin Eric Wang2026-04-16
💬 NLP

DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs

यह शोध पत्र DeEscalWild को प्रस्तुत करता है, जो ओपन-सोर्स वीडियो से क्यूरेट किए गए पुलिस-नागरिक संपर्क के 1,500 उच्च-सटीक परिदृश्यों का एक नवीन बेंचमार्क डेटासेट है, जो छोटे भाषा मॉडलों (SLMs) को बड़े सामान्य-उद्देश्य वाले मॉडलों की तुलना में बेहतर डी-एस्केलेशन प्रदर्शन प्राप्त करने में सक्षम बनाता है, जबकि वे वास्तविक दुनिया के कानून प्रवर्तन प्रशिक्षण के लिए पोर्टेबल, एज हार्डवेयर पर कुशलतापूर्वक कार्य करते हैं।

Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam2026-04-16
💬 NLP

Document-tuning for robust alignment to animals

यह शोध पत्र 'एनिमल हार्म बेंचमार्क' (Animal Harm Benchmark) प्रस्तुत करता है और यह प्रदर्शित करता है कि सिंथेटिक दस्तावेजों के साथ भाषा मॉडलों को फाइन-ट्यून करने से पशु करुणा पर उनके संरेखण में महत्वपूर्ण सुधार होता है, हालांकि यह मूल्य हस्तक्षेप नाजुक है और स्पष्ट संरक्षण रणनीतियों के बिना बाद के असंबंधित इंस्ट्रक्शन-ट्यूनिंग के दौरान घट जाता है।

Jasmine Brazilek, Miles Tidmarsh2026-04-16
💬 NLP

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

यह शोध पत्र InfiniteScienceGym पेश करता है, जो एक प्रक्रियात्मक रूप से जनरेट किया गया बेंचमार्क है जो बड़े भाषा मॉडलों (LLMs) के साक्ष्य-आधारित तर्क और टूल उपयोग का मूल्यांकन करने के लिए सत्यापन योग्य प्रश्नों के साथ स्व-निहित वैज्ञानिक रिपॉजिटरी बनाता है, जिससे यह पता चलता है कि वर्तमान मॉडल सटीकता और अनुत्तरित प्रश्नों की पहचान करने में संघर्ष करते हैं।

Oliver Bentham, Vivek Srikumar2026-04-16
💬 NLP

Evaluating the Evaluator: Problems with SemEval-2020 Task 1 for Lexical Semantic Change Detection

यह शोध पत्र परिवर्तन के अपने संकीर्ण परिचालन (operationalization), डेटा की गुणवत्ता संबंधी महत्वपूर्ण समस्याओं और प्रतिबंधात्मक डिज़ाइन विकल्पों के माध्यम से SemEval-2020 टास्क 1, जो लेक्सिकल सिमेंटिक चेंज डिटेक्शन के लिए अग्रणी बेंचमार्क है, का आलोचनात्मक पुनर्मूल्यांकन करता है, और अंततः यह तर्क देता है कि इसे प्रगति के एक निश्चित माप के बजाय एक आंशिक उपकरण के रूप में देखा जाना चाहिए, साथ ही सिद्धांत, पारदर्शिता और विस्तार में भविष्य के सुधारों का आह्वान भी करता है।

Bach Phan-Tat, Kris Heylen, Dirk Geeraerts, Stefano De Pascale, Dirk Speelmana2026-04-16
💬 NLP

Hessian-Enhanced Token Attribution (HETA): Interpreting Autoregressive LLMs

यह शोध पत्र हेसियन-एन्हांस्ड टोकन एट्रिब्यूशन (HETA) को प्रस्तुत करता है, जो एक नवीन ढांचा है जिसे सिमेंटिक ट्रांज़िशन वेक्टर्स, हेसियन-आधारित संवेदनशीलता स्कोर और KL डाइवर्जेंस को संयोजित करके डिकोडर-ओनली ऑटोरेग्रेसिव लैंग्वेज मॉडल्स की व्याख्यात्मकता में सुधार करने के लिए डिज़ाइन किया गया है ताकि अधिक निष्ठावान और मानव-संरेखित टोकन एट्रिब्यूशन उत्पन्न किए जा सकें, साथ ही जेनेरेटिव एट्रिब्यूशन गुणवत्ता के मूल्यांकन के लिए एक नए बेंचमार्क को भी प्रस्तुत किया गया है।

Vishal Pramanik, Maisha Maliha, Nathaniel D. Bastian, Sumit Kumar Jha2026-04-16
💬 NLP

Indexing Multimodal Language Models for Large-scale Image Retrieval

यह शोध पत्र एक प्रशिक्षण-मुक्त दृष्टिकोण प्रस्तावित करता है जो बड़े पैमाने पर इमेज रिट्रीवल के लिए ज़ीरो-शॉट समानता अनुमानक (similarity estimators) के रूप में मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs) का लाभ उठाता है, जो बिना किसी फाइन-ट्यूनिंग के विशेष री-रैंकर्स के विकल्प के रूप में उनकी उत्कृष्ट मजबूती और प्रभावशीलता को प्रदर्शित करता है।

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias2026-04-16
💬 NLP

L2D-Clinical: Learning to Defer for Adaptive Model Selection in Clinical Text Classification

यह शोध पत्र L2D-Clinical प्रस्तुत करता है, जो एक ऐसा ढांचा है जो क्लिनिकल टेक्स्ट वर्गीकरण के लिए विशिष्ट BERT मॉडलों और सामान्य प्रयोजन वाले LLMs के बीच अनुकूल रूप से चयन करता है, जिससे केवल तभी विलंब (defer) करने के लिए सीखा जाता है जब LLM बेहतर प्रदर्शन प्रदान करता हो, जिससे API लागत को कम करते हुए सटीकता में सुधार होता है।

Rishik Kondadadi, John E. Ortega2026-04-16
💬 NLP

English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training

यह शोध पत्र व्यवस्थित रूप से प्रदर्शित करता है कि एलएलएम (LLM) पोस्ट-ट्रेनिंग के दौरान बहुभाषी डेटा को शामिल करना अंग्रेजी सहित सभी भाषाओं में प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है, और यहाँ तक कि न्यूनतम गैर-अंग्रेजी समावेश भी केवल अंग्रेजी वाले दृष्टिकोणों की तुलना में बेहतर है, विशेष रूप से कम-संसाधन वाली भाषाओं के लिए।

Mehak Dhaliwal, Shashwat Chaurasia, Yao Qin, Dezhi Hong, Thomas Butler2026-04-16
💬 NLP

Giving Voice to the Constitution: Low-Resource Text-to-Speech for Quechua and Spanish Using a Bilingual Legal Corpus

यह शोध पत्र पेरू के संविधान के लिए उच्च गुणवत्ता वाली द्विभाषी क्वेचुआ और स्पेनिश वाणी को संश्लेषित करने हेतु तीन अत्याधुनिक टीटीएस (TTS) आर्किटेक्चर का उपयोग करते हुए एक एकीकृत पाइपलाइन प्रस्तुत करता है, जो कम-संसाधन वाली क्वेचुआ भाषा में डेटा की कमी को दूर करने के लिए क्रॉस-लिंगुअल ट्रांसफर का लाभ उठाता है और समावेशी कानूनी स्पीच प्रौद्योगिकियों के लिए ओपन-सोर्स संसाधन प्रदान करता है।

John E. Ortega, Rodolfo Zevallos, Fabricio Carraro2026-04-16