💬 NLP

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

यह शोध पत्र SUSEVIBES बेंचमार्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि वर्तमान LLM-आधारित "वाइब कोडिंग" एजेंट, हालांकि अक्सर कार्यात्मक रूप से सही होते हैं, वास्तविक दुनिया के सॉफ्टवेयर इंजीनियरिंग कार्यों में अत्यधिक असुरक्षित कोड उत्पन्न करते हैं, और प्रारंभिक शमन रणनीतियां अप्रभावी सिद्ध होती हैं।

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li2026-02-18
💬 NLP

Event Detection with a Context-Aware Encoder and LoRA for Improved Performance on Long-Tailed Classes

यह शोध पत्र वाक्य संदर्भ को शामिल करने और लो-रैंक एडेप्टेशन (LoRA) को लागू करने से मैक्रो-F1 प्रदर्शन में महत्वपूर्ण सुधार होता है, विशेष रूप से लॉन्ग-टेल्ड इवेंट क्लासेस के लिए, यह प्रदर्शित करते हुए कि यह यूनिडायरेक्शनल डिकोडर-ओनली LLMs की आर्किटेक्चरल सीमाओं और इवेंट डिटेक्शन में माइक्रो-F1 मेट्रिक्स के पूर्वाग्रह को संबोधित करता है।

Abdullah Al Monsur, Nitesh Vamshi Bommisetty, Gene Louis Kim2026-02-18
💬 NLP

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

यह शोध पत्र ErrorMap को प्रस्तुत करता है, जो लार्ज लैंग्वेज मॉडल (Large Language Model) की विफलताओं के विशिष्ट मूल कारणों का निदान करने की एक नवीन विधि है, और ErrorAtlas को, जो 35 डेटासेट में 83 मॉडलों के विश्लेषण से प्राप्त एक व्यापक वर्गीकरण है, ताकि मूल्यांकन के केंद्र को केवल सफलता के मेट्रिक्स से हटाकर इस बात की गहरी समझ की ओर स्थानांतरित किया जा सके कि मॉडल क्यों विफल होते हैं।

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen2026-02-18
💬 NLP

LLMs Know More About Numbers than They Can Say

यह शोध पत्र यह प्रकट करता है कि जबकि लार्ज लैंग्वेज मॉडल्स अक्सर मिश्रित नोटेशन में संख्याओं की मौखिक तुलना करने में विफल रहते हैं, उनके हिडन स्टेट्स वास्तव में सटीक संख्यात्मक परिमाण और रैंकिंग को एनकोड करते हैं, और सहायक प्रशिक्षण उद्देश्यों के माध्यम से इस आंतरिक ज्ञान का लाभ उठाना उनके स्पष्ट संख्यात्मक तर्क प्रदर्शन में महत्वपूर्ण सुधार कर सकता है।

Fengting Yuchi, Li Du, Jason Eisner2026-02-18
💬 NLP

Curriculum Learning and Pseudo-Labeling Improve the Generalization of Multi-Label Arabic Dialect Identification Models

यह शोध पत्र GPT-4o और डायलेक्ट एक्सेप्टेबिलिटी क्लासिफायर के माध्यम से एक नया डेटासेट बनाकर मल्टी-लेबल अरबी बोली डेटा की कमी को संबोधित करता है, और फिर यह प्रदर्शित करता है कि करिकुलम लर्निंग के साथ एक BERT-आधारित मॉडल को प्रशिक्षित करने से सामान्यीकरण में महत्वपूर्ण सुधार होता है, जिससे पिछले स्टेट-ऑफ-द-आर्ट के 0.55 की तुलना में 0.69 का मैक्रो F1 प्राप्त होता है।

Ali Mekky, Mohamed El Zeftawy, Lara Hassan, Amr Keleg, Preslav Nakov2026-02-18
💬 NLP

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

यह शोध पत्र एक पूरी तरह से स्वचालित अनुवाद पाइपलाइन और सिंथेटिक डेटा का उपयोग करके पोलिश भाषा के लिए LLaVA फ्रेमवर्क को अनुकूलित करने की एक विधि प्रस्तुत करता है, जो अंग्रेजी बेसलाइन की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है और यह प्रदर्शित करता है कि बड़े पैमाने पर स्वचालित अनुवाद कम-संसाधन वाली भाषाओं के लिए उच्च-गुणवत्ता वाले विजन-लैंग्वेज मॉडल को प्रभावी ढंग से बूटस्ट्रैप कर सकता है।

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz (…)2026-02-18
💬 NLP

Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

यह शोध पत्र "क्वेरी-एज़-एंकर" (Query-as-Anchor) को प्रस्तुत करता है, जो एक बड़े पैमाने के प्री-ट्रेनिंग डेटासेट (UserU) और क्लस्टर-आधारित सॉफ्ट प्रॉम्प्ट ट्यूनिंग वाले ड्यूल-टावर LLM आर्किटेक्चर का लाभ उठाकर गतिशील, क्वेरी-जागरूक उपयोगकर्ता प्रतिनिधित्व उत्पन्न करता है, जिससे Alipay के कई औद्योगिक परिदृश्यों में अत्याधुनिक प्रदर्शन और कुशल परिनियोजन प्राप्त होता है।

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Ziyi Gao, Xiaotong Lin, Yun Liu, Xing Fu, Yu Cheng, Yongchao Liu, Weiqia (…)2026-02-18
💬 NLP

FrameRef: A Framing Dataset and Simulation Testbed for Modeling Bounded Rational Information Health

यह शोधपत्र FrameRef को प्रस्तुत करता है, जो व्यवस्थित रूप से पुनर्गठित (reframed) दावों का एक बड़े पैमाने का डेटासेट और एक सिमुलेशन टेस्टबेड है, जो फ्रेमिंग-संवेदनशील एजेंट व्यक्तित्वों (personas) का उपयोग करके यह मॉडल करता है कि कैसे रैंकिंग प्रणालियों के भीतर सूचना प्रदर्शन में छोटे, व्यवस्थित बदलाव समय के साथ संचयी होकर दीर्घकालिक सूचना स्वास्थ्य (information health) को महत्वपूर्ण रूप से प्रभावित कर सकते हैं।

Victor De Lima, Jiqun Liu, Grace Hui Yang2026-02-18
💬 NLP

Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language

यह शोध पत्र प्रदर्शित करता है कि संरचित प्रॉम्प्टिंग तकनीकें, जिनमें स्पष्ट व्याकरण दस्तावेज़ीकरण, नकारात्मक बाधाएं और सिंथेटिक डेटा जनरेशन शामिल हैं, बड़े भाषा मॉडलों को मॉडल फाइन-ट्यूनिंग की आवश्यकता के बिना, तुलु जैसी अत्यंत कम-संसाधन वाली भाषा में उच्च व्याकरणिक सटीकता प्राप्त करने में सक्षम बना सकती हैं।

Prathamesh Devadiga, Paras Chopra2026-02-18
💬 NLP

Measuring Social Integration Through Participation: Categorizing Organizations and Leisure Activities in the Displaced Karelians Interview Archive using LLMs

यह शोध पत्र फिनिश द्वितीय विश्व युद्ध के कारेलियन शरणार्थियों के साक्षात्कारों से संगठनों और अवकाश गतिविधियों के 350,000 से अधिक असंरचित उल्लेखों को एक संरचित ढांचे में वर्गीकृत करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करने की एक विधि प्रस्तुत करता है, जिससे सामाजिक एकीकरण का मात्रात्मक विश्लेषण सक्षम होता है।

Joonatan Laato, Veera Schroderus, Jenna Kanerva, Jenni Kauppi, Virpi Lummaa, Filip Ginter2026-02-18