💬 NLP

LamPO: A Lambda Style Policy Optimization for Reasoning Language Models

LoMP0 एक नवीन पॉलिसी ऑप्टिमाइज़ेशन विधि है जो तर्क करने वाले भाषा मॉडलों (reasoning language models) के लिए है, जो स्केलर ग्रुप एडवांटेज को पेयरवाइज डिकम्पोज्ड एडवांटेज से बदलकर सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ सुदृढीकरण शिक्षण (reinforcement learning) को उन्नत करती है ताकि सूक्ष्म संबंधात्मक जानकारी को संरक्षित किया जा सके, जिससे GRPO जैसे मौजूदा दृष्टिकोणों की तुलना में गणितीय और वैज्ञानिक बेंचमार्क पर अधिक स्थिर प्रशिक्षण और बेहतर प्रदर्शन प्राप्त होता है।

Zhe Yuan, Yipeng Zhou, Jinghan Li, Xinyuan Chen, Bowen Deng, Zhiqian Chen, Liang Zhao2026-05-21
💬 NLP

Tracing the ongoing emergence of human-like reasoning in Large Language Models

यह शोध पत्र प्रकट करता है कि जहाँ लार्ज लैंग्वेज मॉडल्स (Large Language Models) सिमेंटिक लॉजिक (semantic logic) में उच्च सटीकता प्रदर्शित करते हैं, वहीं वे आम तौर पर उस प्रैग्मैटिक रीजनिंग (pragmatic reasoning) को दोहराने में विफल रहते हैं जो मनुष्यों को संदर्भ-निर्भर अर्थों के साथ सशर्त कथनों को समृद्ध करने की अनुमति देती है, एक ऐसी क्षमता जो मॉडल आर्किटेक्चर या प्रशिक्षण अभिविन्यास के बावजूद एक उभरती हुई क्षमता बनी हुई है।

Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada2026-05-21
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

यह शोध पत्र TextReg को प्रस्तुत करता है, जो एक ऐसा रेगुलराइजेशन फ्रेमवर्क है जो टेक्स्टुअल ग्रेडिएंट्स के माध्यम से रिप्रेजेंटेशनल इनएफिशिएंसी (representational inefficiency) को नियंत्रित करके लार्ज लैंग्वेज मॉडल्स में प्रॉम्प्ट डिस्ट्रिब्यूशनल ओवरफिटिंग को कम करता है, जिससे मौजूदा ऑप्टिमाइजेशन विधियों की तुलना में आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन में महत्वपूर्ण सुधार होता है।

Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang2026-05-21
💬 NLP

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media

यह शोध पत्र लंबे, असंरचित सोशल मीडिया टेक्स्ट का विश्लेषण करने में लार्ज लैंग्वेज मॉडल्स की क्षमताओं का आकलन करने के लिए एक प्रश्न-आधारित मूल्यांकन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि इनपुट स्केल, कार्य जटिलता और संख्यात्मक तर्क संबंधी आवश्यकताओं के बढ़ने के साथ उनका प्रदर्शन काफी कम हो जाता है।

Yuefeng Shi, Nedjma Ousidhoum, Jose Camacho-Collados2026-05-21
💬 NLP

LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

यह शोध पत्र LASH को पेश करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो न्यूनतम क्वेरी बजट के साथ संरेखित (aligned) लार्ज लैंग्वेज मॉडल्स पर अत्याधुनिक अटैक सक्सेस रेट्स प्राप्त करने के लिए एक जेनेटिक ऑप्टिमाइज़र का उपयोग करके कई विषम जेलब्रेक रणनीतियों के आउटपुट को अनुकूल रूप से संयोजित करता है।

Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty2026-05-21
💬 NLP

"I didn't Make the Micro Decisions": Measuring, Inducing, and Exposing Goal-Level AI Contributions in Collaboration

यह शोधपत्र CoTrace को प्रस्तुत करता है, जो एक लक्ष्य-स्तरीय एट्रिब्यूशन फ्रेमवर्क है जो यह प्रकट करता है कि कैसे LLMs मानव-AI सहयोग में ठोस आवश्यकताओं के परिशोधन और समग्र लक्ष्य-आकार देने में महत्वपूर्ण रूप से प्रभाव डालते हैं, और यह प्रदर्शित करता है कि इन सूक्ष्म योगदानों को उजागर करना उपयोगकर्ताओं को उनके काम में AI की भूमिका के संबंध में उनके व्यवस्थित गलत अंुकूलन (miscalibration) को सुधारने में मदद करता है।

Eunsu Kim, Jessica R. Mindel, Kyungjin Kim, Sherry Tongshuang Wu2026-05-21
💬 NLP

Quantifying the cross-linguistic effects of syncretism on agreement attraction

यह अध्ययन यह प्रदर्शित करने के लिए बड़े भाषा मॉडलों से सरप्राइज़ल (surprisal) और अटेंशन एंट्रॉपी (attention entropy) का उपयोग करता है कि रूपात्मक सिनक्रेटिज्म (morphological syncretism) अंग्रेजी और जर्मन में एग्रीमेंट अट्रैक्शन त्रुटियों (agreement attraction errors) को नियंत्रित करता है लेकिन तुर्की में नहीं, जो इस घटना में क्रॉस-भाषाई विविधताओं पर एक कम्प्यूटेशनल परिप्रेक्ष्य प्रस्तुत करता है।

Utku Turk, Eva Neu2026-05-21
💬 NLP

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

यह शोधपत्र RELEX को प्रस्तुत करता है, जो एक कंप्यूट-कुशल विधि है जो इस खोज का लाभ उठाती है कि RLVR वेट प्रक्षेपवक्र (weight trajectories) अत्यधिक पूर्वानुमेय और लो-रैंक होते हैं, ताकि भविष्य के मॉडल चेकपॉइंट्स का लीनियर रिग्रेशन के माध्यम से अनुमान लगाया जा सके, जिससे स्टोकेस्टिक ऑप्टिमाइज़ेशन शोर को फ़िल्टर करके केवल कुछ ही चरणों में पूर्ण प्रशिक्षण के तुलनीय या उससे बेहतर प्रदर्शन प्राप्त किया जा सके।

Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng2026-05-21
💬 NLP

Retrieval-Augmented Generation for Natural Language Processing: A Survey

यह शोध पत्र प्राकृतिक भाषा प्रसंस्करण के लिए रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) का एक व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जिसमें रिट्रीवल फ्यूजन विधियों का एक नवीन वर्गीकरण पेश किया गया है, अनुप्रयोगों और मूल्यांकन की चुनौतियों का विश्लेषण किया गया है, और औद्योगिक परिनियोजन के लिए भविष्य की दिशाओं को रेखांकित किया गया है।

Shangyu Wu, Ying Xiong, Yufei Cui, Haolun Wu, Can Chen, Ye Yuan, Lianming Huang, Xue Liu, Tei-Wei Kuo, Nan Guan, Chun Ja (…)2026-05-20
💬 NLP

HALvest-Contrastive: Retrieval-Like Authorship Attribution with Patch-Level Late Interaction

यह शोध पत्र HALvest, जो विद्वत्तापूर्ण शोध पत्रों का एक विशाल बहुभाषी संग्रह है, और एक नवीन पैच-लेवल लेट इंटरेक्शन (PLI) रिट्रीवल फ्रेमवर्क प्रस्तुत करता है जो दस्तावेजों को एकल वेक्टर्स में संकुचित करने के बजाय टोकन पैचेस के अनुक्रमों की तुलना करके लेखकत्व निर्धारण (authorship attribution) की सटीकता में महत्वपूर्ण सुधार करता है, जिससे विषयगत भ्रम (topical confounds) को प्रभावी ढंग से कम किया जा सके।

Francis Kulumba, Wissam Antoun, Guillaume Vimont, Laurent Romary, Florian Cafiero2026-05-20