💬 NLP

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

यह शोध पत्र डायनेमिक वेरिएंस-एडेप्टिव एडवांटेज ऑप्टिमाइज़ेशन (DVAO) का प्रस्ताव करता है, जो एक नवीन विधि है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन में मानक स्केलर केशन की प्रशिक्षण अस्थिरता और स्थिर सीमाओं को दूर करने के लिए अनुभवजन्य वेरिएंस के आधार पर मल्टी-रिवॉर्ड कॉम्बिनेशन वेट्स को गतिशील रूप से समायोजित करती है, जिससे कई उद्देश्यों के साथ बड़े भाषा मॉडलों को संरेखित करने में बेहतर प्रदर्शन और स्थिरता प्राप्त होती है।

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang2026-05-26
💬 NLP

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

यह शोध पत्र प्रकट करता है कि 'वीक-टू-स्ट्रॉन्ग प्रेफरेंस लर्निंग' अक्सर वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के दौरान रिप्रेजेंटेशनल ड्रिफ्ट के कारण विफल हो जाता है, और प्रीट्रेन मॉडल के स्पेस से अत्यधिक विचलन को नियंत्रित करने के लिए एक "रिप्रेजेंटेशन एंकरिंग" रेगुलराइज़र का प्रस्ताव करता है, जिससे इन-डिस्ट्रीब्यूशन प्रदर्शन को बनाए रखते हुए आउट-ऑफ-डिस्ट्रीब्यूशन ट्रांसफर में सुधार होता है।

Khoi Le, Tri Cao, Phong Nguyen, Cong-Duy Nguyen, Anh Tuan Luu, Miao Chunyan, See-Kiong Ng, Thong Nguyen2026-05-26
💬 NLP

Iterate Until Retrieved: Factual Nugget Optimization for Discoverable Continual Corrections in Agentic RAG

यह शोध पत्र इटरेटिव नगेट ऑप्टिमाइज़ेशन (INO) का परिचय देता है, जो एक इंडेक्स-टाइम विधि है जो मुक्त-रूप तथ्यात्मक सुधारों को उत्पादन RAG एजेंट परीक्षण के माध्यम से पुनरावृत्त रूप से परिष्कृत करके अनुकूलित "तथ्यात्मक नगेट्स" में परिवर्तित करती है ताकि B2B ज्ञान-सहायता प्रणालियों में उनकी खोज क्षमता और प्रभावी उपयोग सुनिश्चित किया जा सके।

Moshe Hazoom, Gal Patel, Alon Talmor, Tom Hope2026-05-26
💬 NLP

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

यह अध्ययन प्रकट करता है कि जहाँ स्पष्ट रूब्रिक्स वाले थाई बार-परीक्षा निबंधों पर एलएलएम (LLM) निर्णायक और मानव परीक्षक अभिसरित होते हैं, वहीं एलएलएम अस्पष्ट मामलों में अल्पसंख्यक मानव व्याख्या को पुनरुत्पादित करने में व्यवस्थित रूप से विफल रहते हैं, बल्कि इसके बजाय वे समान रूप से बहुमत मानव दृष्टिकोण के साथ संरेखित हो जाते हैं और इस प्रकार विशेषज्ञ असहमति के पूर्ण स्पेक्ट्रम को पकड़ने की अपनी अक्षमता को छिपा देते हैं।

Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong2026-05-26
💬 NLP

Llamion Technical Report

यह शोध पत्र Llamion को प्रस्तुत करता है, जो 14B-पैरामीटर वाले ओपन-वेट मॉडल्स का एक परिवार है जो KEPT नामक एक नवीन रेसिपी का उपयोग करके Orion-14B आर्किटेक्चर को सफलतापूर्वक Llama फॉर्मेट में परिवर्तित करता है, जिससे KoMMLU जैसे बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और न्यूनतम प्रशिक्षण संसाधनों के साथ लॉन्ग-कॉन्टेक्स्ट हैंडलिंग जैसी उन्नत क्षमताओं को संरक्षित किया जाता है।

Kisu Yang, Yoonna Jang, Hyeonseok Moon, Hwanseok Jang, Taewoo Lee, Hyungjin Lee, Jeseung Lee, Juhyoung Park, Heuiseok Li (…)2026-05-26
💬 NLP

Simulating Human Memory with Language Models

यह शोध पत्र प्रदर्शित करता है कि जहाँ आउट-ऑफ-द-बॉक्स भाषा मॉडल मनुष्यों की तुलना में अवास्तविक रूप से विश्वसनीय स्मृति रखते हैं, वहीं विशिष्ट प्रॉम्प्टिंग रणनीतियों और मेमोरी कॉम्पैक्टर को लागू करने से मानव-समान विस्मृति (भूलने की प्रक्रिया) उत्पन्न की जा सकती है, जिससे शैक्षिक संदर्भों में उपयोगकर्ता सिम्युलेटर के रूप में उनकी प्रभावशीलता में सुधार होता है।

Qihan Wang, Nicholas Tomlin, Michael Hu, Brian Dillon, Tal Linzen2026-05-26
💬 NLP

Neural Router: Semantic Content Matching for Agentic AI

यह शोध पत्र "न्यूरल राउटर" (Neural Router) का प्रस्ताव करता है, जो एज-क्लाउड वातावरण में एजेंटिक एआई के लिए सिमेंटिक-मैचिंग इंजन के रूप में लार्ज लैंग्वेज मॉडल्स का लाभ उठाने वाला एक सिस्टम है, जो मल्टी-डेटासेट विश्लेषण के माध्यम से यह प्रदर्शित करता है कि बैकएंड मॉडल चयन, पाइपलाइन कॉन्फ़िगरेशन की तुलना में अधिक महत्वपूर्ण है और उन विशिष्ट सटीकता एवं लागत थ्रेशोल्ड्स की पहचान करता है जहाँ कंप्रेशन तकनीकें और फ्रंटियर-स्केल मॉडल्स आवश्यक हो जाते हैं।

Lauri Lovén, Abhishek Kumar, Alexander Engelhardt, Alaa Saleh, Roberto Morabito, Xiaoli Liu, Naser Hossein Motlagh, Sasu (…)2026-05-26
💬 NLP

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP एक पैरामीटर-कुशल फ्रेमवर्क पेश करता है जो मल्टी-डोमेन टास्क-इन्क्रीमेंटल लर्निंग के लिए CLIP के अनएक्सप्लॉइटेड टेक्स्ट एम्बेडिंग स्पेस का लाभ उठाकर मजबूत टास्क रूटिंग, कॉन्फिडेंस एस्टीमेशन और एनकोडर अडैप्टेशन प्राप्त करता है, जिससे बिना किसी बाहरी डेटा या टास्क आइडेंटिटी जानकारी के MTIL बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन हासिल होता है।

Sriram Mandalika2026-05-26
📊 statistics

Efficient Benchmarking Is Just Feature Selection and Multiple Regression

यह शोध पत्र यह प्रदर्शित करता है कि भविष्यवाणियों के लिए कर्नेल रिज रिग्रेशन (kernel ridge regression) के साथ मल्टीपल रिग्रेशन और इष्टतम प्रश्न उपसमुच्चयों (question subsets) के चयन के लिए mRMR एल्गोरिदम के रूप में समस्या को पुनर्गठित करके कुशल LLM बेंचमार्किंग में महत्वपूर्ण सुधार किया जा सकता है, जिसके परिणामस्वरूप मौजूदा विधियों की तुलना में कम भविष्यवाणी त्रुटियां, उच्च रैंकिंग सहसंबंध और तेज़, अधिक स्थिर प्रदर्शन प्राप्त होता है।

Sam Bowyer, Acyr Locatelli, Kris Cao2026-05-26
💬 NLP

Double Triangle Annotation: A Scalable Human-in-the-Loop Framework for High-Precision Historical Document Annotation

यह शोध पत्र "डबल ट्राएंगल एनोटेशन" (Double Triangle Annotation) प्रस्तुत करता है, जो एक स्केलेबल ह्यूमन-इन-द-लूप फ्रेमवर्क है जो ऐतिहासिक दस्तावेज़ एनोटेशन कार्यों के 85% से अधिक को स्वचालित करने के लिए दो स्वतंत्र मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के बीच क्रॉस-मॉडल कंसेंसस का लाभ उठाता है, जबकि फ्रांसीसी मेडिकल "गाइड्स रोसेनवाल्ड" (Guides Rosenwald) कॉर्पस पर 0.003 का उच्च-परिशुद्धता वर्ड एरर रेट (Word Error Rate) प्राप्त करता है।

Yi Ren2026-05-26