💬 NLP

Dealing with Controversy: An Emotion and Coping Strategy Corpus Based on Role Playing

यह शोध पत्र एक रोल-प्लेइंग-आधारित कॉर्पस और एक कोपिंग आइडेंटिफिकेशन टास्क (coping identification task) को पेश करके मनोवैज्ञानिक और कम्प्यूटेशनल भावना अनुसंधान के बीच के अंतर को संबोधित करता है ताकि यह जांचा जा सके कि भावनाएं पाठ में व्यवहारिक रणनीतियों के रूप में कैसे कार्य करती हैं, जो मॉडलों द्वारा इन तंत्रों को बेहतर ढंग से पकड़ने की चुनौतियों और क्षमता को प्रकट करता है।

Enrica Troiano, Sofie Labat, Marco Antonio Stranisci, Viviana Patti, Rossana Damiano, Roman Klinger2026-02-03
💬 NLP

LFQA-E: Carefully Benchmarking Long-form QA Evaluation

यह शोध पत्र LFQA-E प्रस्तुत करता है, जो संदर्भ उत्तरों और युग्म तुलनाओं (pairwise comparisons) के साथ एक व्यापक बहुभाषी बेंचमार्क है जिसे लॉन्ग-फॉर्म प्रश्न उत्तर (Long-Form Question Answering) के लिए स्वचालित मेट्रिक्स का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान विधियाँ सघन, लॉन्ग-फॉर्म प्रतिक्रियाओं का आकलन करने में मानवीय निर्णय के स्तर तक पहुँचने में विफल रहती हैं।

Yuchen Fan, Chen Lin, Xin Zhong, Shuo Zhang, Heng Zhou, Yuchen Zhang, Mingyu Liang, Chengxing Xie, Ermo Hua, Gang Chen (…)2026-02-03
💬 NLP

Leveraging LLMs for Translating and Classifying Mental Health Data

यह अध्ययन अंग्रेजी से अनुवादित ग्रीक पोस्ट में अवसाद की गंभीरता का पता लगाने में GPT-3.5-turbo की प्रभावशीलता का मूल्यांकन करता है, जो भाषाओं के बीच असंगत प्रदर्शन को प्रकट करता है और गैर-अंग्रेजी मानसिक स्वास्थ्य अनुप्रयोगों में आगे के अनुसंधान, सावधानीपूर्वक कार्यान्वयन और मानव पर्यवेक्षण की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Konstantinos Skianis, A. Seza Doğruöz, John Pavlopoulos2026-02-03
💬 NLP

SVIP: Towards Verifiable Inference of Open-source Large Language Models

SVIP एक गणनात्मक रूप से कुशल, गुप्त-आधारित प्रोटोकॉल है जो उपयोगकर्ताओं को हिडन रिप्रेजेंटेशन्स (hidden representations) पर एक प्रॉक्सी टास्क को प्रशिक्षित करके विकेंद्रीकृत LLM इन्फरेंस प्रदाताओं की ईमानदारी को सत्यापित करने में सक्षम बनाता है, ताकि मॉडल की विशिष्ट पहचान की जा सके और छोटे, कम सक्षम संस्करणों के साथ अनधिकृत प्रतिस्थापन को रोका जा सके।

Yifan Sun, Yuhang Li, Yue Zhang, Yuchen Jin, Huan Zhang2026-02-03
💬 NLP

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

यह शोध पत्र U-MATH को प्रस्तुत करता है, जो छह मुख्य विषयों के 1,100 ओपन-एंडेड विश्वविद्यालय-स्तरीय समस्याओं का एक नवीन बेंचमार्क है जिसमें 20% मल्टीमॉडल सामग्री शामिल है, साथ ही समाधान निर्णय (solution judgment) के मूल्यांकन के लिए μ\mu-MATH डेटासेट भी है, ताकि वर्तमान LLMs की मल्टीमॉडल तर्क क्षमता और गणितीय समाधानों का सटीक आकलन करने की क्षमता में महत्वपूर्ण सीमाओं को उजागर किया जा सके।

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Til (…)2026-02-03
💬 NLP

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

यह शोध पत्र इवोल्यूशनरी प्री-प्रॉम्ट ऑप्टिमाइज़ेशन (EPPO) पेश करता है, जो एक ऐसी विधि है जो फ्यू-शॉट चेन-ऑफ-थॉट उदाहरणों को चुनने के लिए इवोल्यूशनरी एल्गोरिदम का लाभ उठाती है, जो नैइव (naive) दृष्टिकोणों की तुलना में GSM8k और MathQA जैसे बेंचमार्क पर गणितीय तर्क प्रदर्शन को 10 से अधिक एब्सोल्यूट पॉइंट्स से काफी बेहतर बनाती है।

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud2026-02-03
💬 NLP

RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping

यह शोध पत्र RaZeR का प्रस्ताव करता है, जो एक उन्नत संख्यात्मक प्रारूप (numerical format) है जो अतिरिक्त क्वांटाइजेशन मानों (quantization values) को सहारा देने के लिए FP4 ज़ीरो रिप्रेजेंटेशन और FP8 ब्लॉक स्केलिंग फैक्टर से रेडंडेंट बिट्स का पुनरुद्देश्य (repurposing) करके 4-बिट LLM क्वांटाइजेशन सटीकता में सुधार करता है, जिससे नेटिव NVFP4 की तुलना में महत्वपूर्ण परप्लेक्सिटी (perplexity) में कमी आती है।

Yuzong Chen, Xilai Dai, Jake Hyun, Chi-Chih Chang, Wonsuk Jang, Yuheng Wu, Thierry Tambe, Jae-sun Seo, Mohamed S. Abdelf (…)2026-02-03
🤖 AI

Enhancing Human-Like Responses in Large Language Models

यह शोध पत्र बेहतर प्राकृतिक भाषा समझ, संवादात्मक सुसंगतता और भावनात्मक बुद्धिमत्ता के माध्यम से लार्ज लैंग्वेज मॉडल्स के मानवीय गुणों को बढ़ाने की तकनीकों का अन्वेषण करता है, जो उपयोगकर्ता इंटरैक्शन और एआई अनुप्रयोगों को बदलने की उनकी क्षमता को प्रदर्शित करते हुए उत्पन्न होने वाली नैतिक चिंताओं को संबोधित करने की आवश्यकता पर प्रकाश डालता है।

Ethem Yağız Çalık, Talha Rüzgar Akkuş2026-02-03
💬 NLP

How does a Multilingual LM Handle Multiple Languages?

यह अध्ययन BLOOM-1.7B और Qwen2 जैसे बहुभाषी भाषा मॉडलों की सिमेंटिक रिप्रजेंटेशन (semantic representation) और क्रॉस-लिंगुअल ट्रांसफर (cross-lingual transfer) की क्षमताओं और सीमाओं का आलोचनात्मक मूल्यांकन करता है, जो अधिक समावेशी भाषा प्रौद्योगिकियों के लिए सुधार प्रस्तावित करने हेतु उच्च-संसाधन वाली भाषाओं पर उनके मजबूत प्रदर्शन बनाम कम-संसाधन वाली भाषाओं के साथ उनके संघर्षों को रेखांकित करता है।

Santhosh Kakarla, Gautama Shastry Bulusu Venkata, Aishwarya Gaddam, Maheedhar Sai Omtri Mohan2026-02-03
💬 NLP

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

यह शोध पत्र RESM को प्रस्तुत करता है, जो एक नवीन रीवेटिंग-एन्हांस्ड टास्क सिंगुलर मर्जिंग विधि है, जो बड़े भाषा मॉडलों (LLMs) में संतुलित संरेखण प्राप्त करने के लिए हेल्पफुलनेस (Helpfulness), ऑनेस्टी (Honesty) और हार्मलेसनेस (Harmlessness) के बीच संघर्षों को प्रभावी ढंग से सुलझाकर मौजूदा डेटा मिश्रण और मॉडल मर्जिंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang (…)2026-02-03