🤖 AI

RLSF: Fine-tuning LLMs via Symbolic Feedback

यह शोध पत्र 'रिनफोर्समेंट लर्निंग वाया सिम्बोलिक फीडबैक' (RLSF) को प्रस्तुत करता है, जो एक नवीन फाइन-ट्यूनिंग प्रतिमान है जो सूक्ष्म, टोकन-स्तरीय फीडबैक प्रदान करने के लिए प्रतीकात्मक तर्क उपकरणों (सिम्बोलिक रीजनिंग टूल्स) का लाभ उठाता है, जिससे छोटे LLMs विशिष्ट डोमेन-आधारित तार्किक संरेखण वाले कार्यों पर बड़े क्लोज्ड-सोर्स मॉडल्स को महत्वपूर्ण रूप से पीछे छोड़ने में सक्षम होते हैं।

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh2026-02-27
💬 NLP

ANCHOLIK-NER: A Benchmark Dataset for Bangla Regional Named Entity Recognition

यह शोध पत्र ANCHOLIK-NER को प्रस्तुत करता है, जो पांच बांग्ला क्षेत्रीय बोलियों में नाम इकाई पहचान (Named Entity Recognition) के लिए पहला बेंचमार्क डेटासेट है, और बोली-जागरूक एनएलपी (NLP) प्रणालियों को विकसित करने के लिए एक मौलिक कदम स्थापित करने हेतु इस पर ट्रांसफार्मर-आधारित मॉडलों का मूल्यांकन करता है।

Bidyarthi Paul, Faika Fairuj Preotee, Shuvashis Sarker, Shamim Rahim Refat, Shifat Islam, Tashreef Muhammad, Mohammad As (…)2026-02-27
💬 NLP

Evaluating the Diversity and Quality of LLM Generated Content

यह शोध पत्र "प्रभावी अर्थपूर्ण विविधता" (effective semantic diversity) को मापने के लिए एक रूपरेखा प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि हालांकि मानक मेट्रिक्स के तहत प्राथमिकता-ट्यून किए गए (preference-tuned) LLMs कम विविध दिखाई दे सकते हैं, वे वास्तव में बेस या सुपरवाइज्ड फाइन-ट्यून्ड मॉडलों की तुलना में उच्च-गुणवत्ता वाले आउटपुट की अधिक विविधता उत्पन्न करते हैं, जिसमें अद्वितीय सामग्री उत्पन्न करने के लिए छोटे मॉडल अधिक पैरामीटर-कुशल सिद्ध होते हैं।

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani2026-02-27
💬 NLP

Cost-of-Pass: An Economic Framework for Evaluating Language Models

यह शोध पत्र "कॉस्ट-ऑफ-पास" (Cost-of-Pass) प्रस्तुत करता है, जो एक आर्थिक ढांचा है जो सटीकता और अनुमान लागत (inference costs) को जोड़कर भाषा मॉडल की उत्पादकता का मूल्यांकन करता है, यह प्रकट करते हुए कि पूरक मॉडल-स्तरीय नवाचार ही लागत-दक्षता के प्राथमिक चालक हैं और तैनाती संबंधी निर्णयों के मार्गदर्शन के लिए एक सिद्धांतपूर्ण उपकरण प्रदान करते हैं।

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou2026-02-27
💬 NLP

Can LLMs Simulate Human Behavioral Variability? A Case Study in the Phonemic Fluency Task

यह अध्ययन प्रदर्शित करता है कि यद्यपि कुछ बड़े भाषा मॉडल (LLMs) ध्वन्यात्मक प्रवाह (phonemic fluency) कार्य में मानवीय औसत का अनुमान लगा सकते हैं, वे मानवीय व्यवहारिक परिवर्तनशीलता के विस्तार और संरचना को दोहराने में लगातार विफल रहते हैं, जो संज्ञानात्मक अनुसंधान में मानव प्रतिभागियों के विकल्प के रूप में LLMs के उपयोग में महत्वपूर्ण सीमाओं को रेखांकित करता है।

Mengyang Qiu, Zoe Brisebois, Siena Sun2026-02-27
💬 NLP

Knowledge Fusion of Large Language Models Via Modular SkillPacks

यह शोधपत्र GraftLLM को प्रस्तुत करता है, जो एक नवीन विधि है जो बड़े, विषम भाषा मॉडलों के लिए कुशल, विस्मृति-मुक्त (forget-free) क्रॉस-कैपेबिलिटी ट्रांसफर और मॉडल फ्यूजन को सक्षम बनाता है, जो सामान्य क्षमताओं को संरक्षित करते हुए और पैरामीटर संघर्षों को न्यूनतम करते हुए स्रोत क्षमताओं को संक्षिप्त, हस्तांतरणीय "स्किलपैक" (SkillPacks) में संकुचित करता है।

Guodong Du, Zhuo Li, Xuanning Zhou, Junlin Li, Zesheng Shi, Wanyu Lin, Ho-Kin Tang, Xiucheng Li, Fangming Liu, Wenya Wan (…)2026-02-27
💬 NLP

DeVisE: Behavioral Testing of Medical Large Language Models

यह शोध पत्र DeVisE को पेश करता है, जो एक व्यवहारिक परीक्षण ढांचा है जो आईसीयू डिस्चार्ज नोट्स में जनसांख्यिकीय और महत्वपूर्ण संकेतों (वाइटल साइन) के गुणों के नियंत्रित प्रति-तथ्यात्मक परिवर्तनों (काउंटरफैक्चुअल परटर्बेशन्स) का उपयोग करता है ताकि यह प्रकट किया जा सके कि वर्तमान मेडिकल लार्ज लैंग्वेज मॉडल्स उनकी संवेदनशीलता और तर्क संबंधी निरंतरता में कैसे भिन्न होते हैं, यह प्रदर्शित करते हुए कि मानक मेट्रिक्स अक्सर नैदानिक रूप से प्रासंगिक व्यवहारिक अंतरों को पकड़ने में विफल रहते हैं।

Camila Zurdo Tagliabue, Heloisa Oss Boll, Aykut Erdem, Erkut Erdem, Iacer Calixto2026-02-27
💬 NLP

Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility

यह शोध पत्र प्रदर्शित करता है कि भाषा मॉडल घटना की संभाव्यता (event plausibility) के विश्वसनीय, रैखिक रूप से विभाज्य (linearly separable) निरूपण रखते हैं जो प्रशिक्षण के दौरान निरंतर उभरते हैं और मोडल श्रेणियों के सूक्ष्म मानवीय निर्णयों को प्रभावी ढंग से मॉडल कर सकते हैं, जो एआई क्षमताओं और मानव संज्ञान दोनों में नई अंतर्दृष्टि प्रदान करते हैं।

Michael A. Lepori, Jennifer Hu, Ishita Dasgupta, Roma Patel, Thomas Serre, Ellie Pavlick2026-02-27
💬 NLP

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

यह शोध पत्र LiveMCPBench प्रस्तुत करता है, जो एक बड़े पैमाने का, पुनरुत्पादक बेंचमार्क है जिसमें वास्तविक दुनिया के मल्टी-सर्वर MCP कार्यों पर LLM एजेंटों का मूल्यांकन करने के लिए 70 सर्वर और 527 टूल शामिल हैं, जो यह प्रकट करता है कि रिट्रीवल त्रुटियां (retrieval errors) प्राथमिक बाधा हैं और सक्रिय टूल कंपोजिशन (active tool composition) सफलता दर को महत्वपूर्ण रूप से प्रभावित करता है।

Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun2026-02-27
💬 NLP

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

यह शोध पत्र एक नवीन इमेज-ओरिएंटेड सेल्फ-अडैप्टिव पाइपलाइन का प्रस्ताव करके मल्टीमॉडल सुरक्षा डेटासेट के निर्माण में वर्तमान जोखिम-उन्मुख विधियों की सीमाओं को संबोधित करता है, जो स्वचालित रूप से 35k वास्तविक दुनिया का सुरक्षा डेटासेट उत्पन्न करता है और विभिन्न कार्यों में इसकी प्रभावशीलता को मान्य करने के लिए एक मानकीकृत मूल्यांकन मीट्रिक पेश करता है।

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao2026-02-27