💬 NLP

Foresight Optimization for Strategic Reasoning in Large Language Models

यह शोध पत्र फॉरसाइट पॉलिसी ऑप्टिमाइज़ेशन (FoPO) को प्रस्तुत करता है, जो मल्टी-एजेंट वातावरण के भीतर लार्ज लैंग्वेज मॉडल्स में रणनीतिक तर्क और निर्णय लेने की क्षमता को बढ़ाने के लिए पॉलिसी ऑप्टिमाइज़ेशन में अपोनेंट मॉडलिंग को एकीकृत करने वाली एक नवीन विधि है, जो विविध मॉडल्स और परिदृश्यों में महत्वपूर्ण प्रदर्शन सुधार और मजबूत सामान्यीकरण प्रदर्शित करता है।

Jiashuo Wang, Jiawen Duan, Jian Wang, Kaitao Song, Chunpu Xu, Johnny K. W. Ho, Fenggang Yu, Wenjie Li, Johan F. Hoorn2026-04-16
💬 NLP

C2: Scalable Rubric-Augmented Reward Modeling from Binary Preferences

यह शोध पत्र C2 का प्रस्ताव करता है, जो एक स्केलेबल फ्रेमवर्क है जो केवल बाइनरी प्रेफरेंस (binary preferences) से प्राप्त रूब्रिक जनरेटर के साथ आलोचनात्मक रूप से सहयोग करने के लिए एक रिवॉर्ड मॉडल को प्रशिक्षित करता है, जिससे भ्रामक रूब्रिक्स को प्रभावी ढंग से फ़िल्टर किया जा सके और महंगी बाहरी एनोटेशन के बिना बेहतर प्रदर्शन प्राप्त किया जा सके।

Akira Kawabata, Saku Sugawara2026-04-16
💬 NLP

Syn-TurnTurk: A Synthetic Dataset for Turn-Taking Prediction in Turkish Dialogues

यह शोधपत्र Syn-TurnTurk को प्रस्तुत करता है, जो टर्न-टेकिंग प्रेडिक्शन (बारी लेने के पूर्वानुमान) के लिए संसाधनों की कमी को दूर करने हेतु Qwen LLMs द्वारा निर्मित एक सिंथेटिक तुर्की संवाद डेटासेट है, जो यह प्रदर्शित करता है कि इस डेटा पर प्रशिक्षित उन्नत मॉडल प्राकृतिक संवाद समय प्रबंधन और व्यवधानों को कम करने में उच्च सटीकता प्राप्त करते हैं।

Ahmet Tuğrul Bayrak, Mustafa Sertaç Türkel, Fatma Nur Korkmaz2026-04-16
🤖 machine learning

(How) Learning Rates Regulate Catastrophic Overtraining

यह शोध पत्र सुपरवाइज्ड फाइन-ट्यूनिंग के दौरान एलएलएम (LLMs) में होने वाले विनाशकारी ओवरट्रेनिंग (catastrophic overtraining) की जांच करता है, जो यह प्रकट करता है कि लर्निंग रेट डिके (learning rate decay) मॉडल की शार्पनेस (sharpness) को बढ़ाता है और विनाशकारी विस्मृति (catastrophic forgetting) को बदतर बनाता है, जिससे यह प्रदर्शित होता है कि कैसे लर्निंग रेट्स अनुकूलन गतिकी (optimization dynamics) को नियंत्रित करते हुए गुणात्मक रूप से भिन्न मॉडल उत्पन्न करते हैं।

Mark Rofin, Aditya Varre, Nicolas Flammarion2026-04-16
💬 NLP

Calibrated Speculative Decoding: Frequency-Guided Candidate Selection for Efficient Inference

यह शोध पत्र कैलिब्रेटेड स्पेकुलेटिव डिकोडिंग (CSD) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो फ्रीक्वेंसी-गाइडेड कैंडिडेट सिलेक्शन और प्रोबेबिलिटी-गार्डेड एक्सेप्टेंस के माध्यम से वैध लेकिन लेक्सिकल रूप से भिन्न टोकन को पुनः प्राप्त करके इन्फरेंस दक्षता को बढ़ाता है, जिससे मॉडल की सटीकता को बनाए रखते हुए 2.33x तक थ्रूपुट स्पीडअप प्राप्त होता है।

Xuwen Zhou, Fangxin Liu, Chao Wang, Xiao Zheng, Hao Zheng, Min He, Li Jiang, Haibing Guan2026-04-16
💬 NLP

Beyond Arrow's Impossibility: Fairness as an Emergent Property of Multi-Agent Collaboration

यह शोध पत्र यह प्रस्तावित करता है कि लार्ज लैंग्वेज मॉडल्स में निष्पक्षता व्यक्तिगत अनुकूलन से नहीं, बल्कि बहु-एजेंट सहयोग के एक प्रक्रियात्मक गुण के रूप में उभरती है, जो एक अस्पताल ट्राइएज सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि संरेखित और पक्षपाती एजेंटों के बीच प्रतिकूल बातचीत उन नैतिक रूप से पर्याप्त परिणामों को उत्पन्न कर सकती है जिन्हें अकेले उनमें से कोई भी प्राप्त नहीं कर सकता था, जिससे वे एरो के इम्पॉसिबिलिटी थ्योरम (Arrow's Impossibility Theorem) की बाधाओं को पार करने में सक्षम होते हैं।

Sayan Kumar Chaki, Antoine Gourru, Julien Velcin2026-04-16
💬 NLP

Co-FactChecker: A Framework for Human-AI Collaborative Claim Verification Using Large Reasoning Models

यह शोध पत्र Co-FactChecker को पेश करता है, जो दावा सत्यापन के लिए एक मानव-एआई सहयोगात्मक ढांचा है जो विशेषज्ञ फीडबैक को मॉडल के थिंकिंग ट्रेस (सोचने की प्रक्रिया) के प्रत्यक्ष संशोधनों में अनुवादित करके लार्ज रीजनिंग मॉडल्स को उन्नत करता है, जिससे यह तर्क की गुणवत्ता और व्याख्यात्मकता में पारंपरिक मल्टी-टर्न संवाद दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Dhruv Sahnan, Subhabrata Dutta, Tanmoy Chakraborty, Preslav Nakov, Iryna Gurevych2026-04-16
💬 NLP

Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

Doc-V* एक मल्टी-पेज डॉक्यूमेंट VQA के लिए एक OCR-मुक्त एजेंटिक फ्रेमवर्क है जो थंबनेल ओवरव्यू को सक्रिय सिमेंटिक रिट्रीवल और स्ट्रक्चर्ड मेमोरी एग्रीगेशन के साथ जोड़ते हुए एक कोर्स-टू-फाइन इंटरैक्टिव रीजनिंग रणनीति का उपयोग करता है, ताकि मौजूदा बेसलाइन्स की तुलना में बेहतर सटीकता और दक्षता प्राप्त की जा सके।

Yuanlei Zheng, Pei Fu, Hang Li, Ziyang Wang, Yuyi Zhang, Wenyu Ruan, Xiaojin Zhang, Zhongyu Wei, Zhenbo Luo, Jian Luan (…)2026-04-16
💬 NLP

Who Gets Flagged? The Pluralistic Evaluation Gap in AI Content Watermarking

यह शोध पत्र तर्क देता है कि वर्तमान एआई (AI) सामग्री वॉटरमार्किंग प्रणालियाँ एक "बहुलवादी मूल्यांकन अंतराल" (pluralistic evaluation gap) प्रदर्शित करती हैं क्योंकि वे इस बात का लेखा-जोखा रखने में विफल रहती हैं कि भाषाओं, संस्कृतियों और जनसांख्यिकी के बीच सामग्री की विविधता पहचान प्रदर्शन को कैसे प्रभावित करती है, जिससे न्यायसंगत शासन सुनिश्चित करने के लिए तैनाती से पहले नए बेंचमार्किंग मानकों और निष्पक्षता ऑडिट की आवश्यकता होती है।

Alexander Nemecek, Osama Zafar, Yuqiao Xu, Wenbiao Li, Erman Ayday2026-04-16
💬 NLP

From Anchors to Supervision: Memory-Graph Guided Corpus-Free Unlearning for Large Language Models

यह शोध पत्र MAGE का प्रस्ताव करता है, जो एक कॉर्पस-मुक्त अनलर्निंग फ्रेमवर्क है जो हल्के उपयोगकर्ता एंकर्स (user anchors) का उपयोग करके लक्षित स्मृति (target memorization) को स्वचालित रूप से रिकवर और व्यवस्थित करने के लिए एक मेमोरी ग्राफ में बदल देता है, जिससे मूल प्रशिक्षण डेटा तक पहुंच की आवश्यकता के बिना बड़े भाषा मॉडलों से संवेदनशील सामग्री को प्रभावी ढंग से मिटाने के लिए स्कोप्ड सुपरविजन (scoped supervision) उत्पन्न किया जा सके।

Wenxuan Li, Zhenfei Zhang, Mi Zhang, Geng Hong, Mi Wen, Xiaoyu You, Min Yang2026-04-16