💬 NLP

PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning

PCL-Reasoner-V1.5 एक 32-बिलियन-पैरामीटर वाला गणितीय तर्क मॉडल है जो Qwen2.5-32B पर आधारित है और जो ऑनलाइन RL दृष्टिकोणों की तुलना में बेहतर प्रशिक्षण स्थिरता और दक्षता के साथ AIME बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक नवीन ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) पद्धति का लाभ उठाता है।

Yao Lu, Dengdong Fan, Jianzheng Nie, Fan Xu, Jie Chen, Bin Zhou, Yonghong Tian2026-01-22
💬 NLP

Generative Artificial Intelligence, Musical Heritage and the Construction of Peace Narratives: A Case Study in Mali

यह अध्ययन इस बात की जांच करता है कि कैसे जनरेटिव एआई (generative AI), जब एक सांस्कृतिक रूप से जागरूक सहभागी ढांचे के भीतर एकीकृत किया जाता है, तो भाषाई डेटा की कमी, एल्गोरिदम संबंधी पूर्वाग्रह और कॉपीराइट नैतिकता से संबंधित निरंतर चुनौतियों के बावजूद, तकनीकी नवाचार और सांस्कृतिक प्रामाणिकता के बीच संतुलन बनाकर शांति आख्यानों और माली की संगीत विरासत के पुनरुद्धार के लिए एक उत्प्रेरक के रूप में कार्य कर सकता है।

Nouhoum Coulibaly, Ousmane Ly, Michael Leventhal, Ousmane Goro2026-01-22
💬 NLP

TempViz: On the Evaluation of Temporal Knowledge in Text-to-Image Models

यह शोध पत्र TempViz प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज मॉडल्स में टेम्पोरल नॉलेज (कालिक ज्ञान) का समग्र रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला डेटासेट है, जो यह प्रकट करता है कि वर्तमान मॉडल्स में कमजोर टेम्पोरल क्षमता है और मौजूदा ऑटोमेटेड इवैल्यूएशन मेथड्स समय-निर्भर विजुअल क्यूज़ को संभालने की उनकी क्षमता का विश्वसनीय रूप से आकलन करने में विफल रहते हैं।

Carolin Holtermann, Nina Krebs, Anne Lauscher2026-01-22
💬 NLP

Obscuring Data Contamination Through Translation: Evidence from Arabic Corpora

यह शोध पत्र प्रकट करता है कि अंग्रेजी बेंचमार्क का अरबी में अनुवाद करना पारंपरिक पहचान संकेतों को दबाकर लार्ज लैंग्वेज मॉडल्स (LLMs) में डेटा संदूषण (data contamination) को छिपा सकता है, जिससे लेखक एक नई "अनुवाद-जागरूक संदूषण पहचान" (Translation-Aware Contamination Detection) विधि प्रस्तावित करते हैं जो कई अनुवादित बेंचमार्क वेरिएंट्स के बीच प्रदर्शन की तुलना करके रटने (memorization) की विश्वसनीय रूप से पहचान करती है।

Chaymaa Abbas, Nour Shamaa, Mariette Awad2026-01-22
🧬 biology

Circadian Modulation of Semantic Exploration in Social Media Language

रेडिट के बड़े पैमाने के डेटा का विश्लेषण करके, यह अध्ययन प्रदर्शित करता है कि मानव अर्थ संबंधी अन्वेषण (semantic exploration) एक सुदृढ़ सर्कैडियन रिदम प्रदर्शित करता है जिसमें स्थानीय भाषाई विविधता में सुबह का शिखर और वैश्विक विषय संचय (global topic accumulation) में दोपहर का शिखर होता है, जो मूड के बजाय जैविक लय द्वारा संचालित भाषा उपयोग के एक विशिष्ट संज्ञानात्मक आयाम को प्रकट करता है।

Vuong Hung Truong, Mariana Gabrielle Cangco Reyes, Masatoshi Koizumi, Jihwan Myung2026-01-22
💬 NLP

Is Peer Review Really in Decline? Analyzing Review Quality across Venues and Time

घटते मानकों के लोकप्रिय विमर्श को चुनौती देते हुए, यह शोध पत्र समीक्षा गुणवत्ता को मापने के लिए एक नया ढांचा प्रस्तुत करता है और प्रमुख एआई (AI) एवं भाषाविज्ञान सम्मेलनों के कालानुक्रमिक विश्लेषण के माध्यम से यह प्रदर्शित करता है कि मध्यिका समीक्षा गुणवत्ता समय के साथ स्थिर बनी हुई है।

Ilia Kuznetsov, Rohan Nayak, Alla Rozovskaya, Iryna Gurevych2026-01-22
💬 NLP

Taxonomy-Aligned Risk Extraction from 10-K Filings with Autonomous Improvement Using LLMs

यह शोध पत्र 10-K फाइलिंग से एक पूर्व-निर्धारित वर्गीकरण (taxonomy) के अनुरूप संरचित जोखिम कारकों को निकालने के लिए एक तीन-चरणीय LLM-आधारित पाइपलाइन प्रस्तुत करता है और इसमें निरंतर वर्गीकरण परिशोधन के लिए एक स्वायत्त एजेंट शामिल है, जो उच्च निष्कर्षण सटीकता और आर्थिक रूप से सार्थक उद्योग-विशिष्ट जोखिम प्रोफाइल को कैप्चर करने की क्षमता दोनों को प्रदर्शित करता है।

Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike2026-01-22
💬 NLP

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

यह सर्वेक्षण कानूनी अनुप्रयोगों में बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के मूल्यांकन के लिए चुनौतियों का व्यवस्थित रूप से परीक्षण करता है, मौजूदा मूल्यांकन विधियों और बेंचमार्क को वर्गीकृत करता है, और भविष्य की दिशाओं को रेखांकित करता है ताकि यह सुनिश्चित किया जा सके कि उनकी तर्क क्षमता, निष्पक्षता और विश्वसनीयता वास्तविक दुनिया के कानूनी अभ्यास के अनुरूप हो।

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng (…)2026-01-22
💬 NLP

Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks

यह शोध पत्र AdSent प्रस्तुत करता है, जो एक सुदृढ़ फेक न्यूज डिटेक्शन फ्रेमवर्क है जो LLMs का उपयोग करके नियंत्रित भावना-आधारित हमलों और निरंतर सत्यता भविष्यवाणियों को सुनिश्चित करने के लिए एक नवीन भावना-अज्ञेय (sentiment-agnostic) प्रशिक्षण रणनीति का प्रस्ताव करके वर्तमान मॉडलों की प्रतिकूल भावना हेरफेर (adversarial sentiment manipulation) के प्रति संवेदनशीलता को संबोधित करता है।

Sahar Tahmasebi, Eric Müller-Budack, Ralph Ewerth2026-01-22
💻 computer science

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

यह शोध पत्र प्रॉम्प्टिंग4डीबगिंग (P4D) को प्रस्तुत करता है, जो एक स्वचालित रेड-टीमिंग टूल है जो यह प्रदर्शित करके टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के सुरक्षा तंत्रों में महत्वपूर्ण कमजोरियों को उजागर करता है कि कैसे पहले "सुरक्षित" माने जाने वाले कई प्रॉम्प्ट्स का उपयोग मौजूदा सुरक्षा उपायों को बायपास करने के लिए किया जा सकता है, जिससे वर्तमान मूल्यांकन बेंचमार्क की विश्वसनीयता को चुनौती मिलती है।

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu2026-01-15