💬 NLP

Multi-Agent Causal Discovery Using Large Language Models

यह शोध पत्र MAC को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो स्वायत्त सांख्यिकीय एल्गोरिदम चयन को मेटाडेटा पर एक प्रतिकूल LLM बहस के साथ जोड़कर कॉज़ल डिस्कवरी (कारण खोज) को बढ़ाता है, और मौजूदा सांख्यिकीय एवं सिंगल-एजेंट LLM विधियों की तुलना में विविध बेंचमार्क पर बेहतर प्रदर्शन और मजबूती प्राप्त करता है।

Hao Duong Le, Xin Xia, Haijie Xu, Chen Zhang2026-05-27
💬 NLP

TFD: A Comprehensive Structured Tibetan Foundation Dataset for Low-Resource Language Processing and Large-Scale Modeling

यह शोध पत्र TFD को प्रस्तुत करता है, जो तिब्बती लार्ज लैंग्वेज मॉडल विकास के सभी चरणों को कवर करने वाला पहला व्यापक, संरचित और विशेषज्ञ-क्यूरेटेड डेटासेट है, जो सन-शाइन (Sun-Shine) परिवार के मॉडलों के निर्माण को सक्षम बनाता है जो समझ, सुरक्षा, तर्क और सृजन में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करते हैं।

Cheng Huang, Fan Gao, Nyima Tashi, Yutong Liu, Yadi Liu, Wenbin Wei, Xiangxiang Wang, Yongbin Yu2026-05-27
💬 NLP

PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark

यह शोध पत्र 20,785 विशेषज्ञ-सत्यापित फारसी चिकित्सा परीक्षा प्रश्नों के एक बड़े पैमाने के द्विभाषी डेटासेट, PersianMedQA को प्रस्तुत करता है, ताकि 41 अत्याधुनिक LLMs का मूल्यांकन किया जा सके और यह प्रकट किया जा सके कि जबकि क्लोज्ड-वेट सामान्य मॉडल विशिष्ट फारसी मॉडलों से बेहतर प्रदर्शन करते हैं, सटीक चिकित्सा तर्क के लिए मूल भाषा में सांस्कृतिक और नैदानिक सूक्ष्मताएं महत्वपूर्ण बनी हुई हैं।

Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili (…)2026-05-27
💬 NLP

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

AlignEvoSkill एक नवीन ढांचा है जो ज्ञान कवरेज और कार्य संरेखण के संयुक्त अनुकूलन के माध्यम से पुन: प्रयोज्य कौशल विकसित करके LLM-आधारित एजेंट के प्रदर्शन को बढ़ाता है, जिससे कम कम्प्यूटेशनल लागत के साथ अत्याधुनिक परिणाम प्राप्त होते हैं।

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng2026-05-27
💬 NLP

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

PICACO एक नवीन इन-कॉन्टेक्स्ट अलाइनमेंट विधि है जो टोटल कोरिलेशन मैक्सिमाइजेशन के माध्यम से एक मेटा-इंस्ट्रक्शन को अनुकूलित करके बहुलवादी मानवीय मूल्यों को संभालने में निर्देश बाधा (इंस्ट्रक्शन बॉटलनैक) को संबोधित करती है, जिससे बड़े भाषा मॉडल बिना फाइन-ट्यूनिंग के कई परस्पर विरोधी मूल्यों को प्रभावी ढंग से संतुलित करने में सक्षम होते हैं।

Han Jiang, Dongyao Zhu, Zhihua Wei, Xiaoyuan Yi, Ziang Xiao, Xing Xie2026-05-27
💬 NLP

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

यह शोध पत्र SONAR-LLM को प्रस्तुत करता है, जो एक डिकोडर-ओनली ट्रांसफॉर्मर है जो SONAR स्पेस के भीतर निरंतर वाक्य एम्बेडिंग (continuous sentence embeddings) की भविष्यवाणी करके टेक्स्ट उत्पन्न करता है और साथ ही टोकन-लेवल क्रॉस-एन्ट्रॉपी ऑब्जेक्टिव के माध्यम से प्रशिक्षित होता है, जिससे यह लार्ज कॉन्सेप्ट मॉडल्स के सिमेंटिक एब्स्ट्रैक्शन को ऑटोरेग्रेसिव टोकन प्रेडिक्शन की दक्षता और लाइकलीहुड-आधारित प्रशिक्षण के साथ जोड़ता है।

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Ku (…)2026-05-27
💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

यह शोध पत्र GUI-Cursor को प्रस्तुत करता है, जो एक ऐसा मॉडल है जो GUI ग्राउंडिंग को रेंडर किए गए कर्सर से प्राप्त विजुअल फीडबैक और विजन लैंग्वेज मॉडल्स की कोऑर्डिनेट प्रेडिक्शन सीमाओं को दूर करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करके एक इंटरैक्टिव सर्च टास्क के रूप में पुनर्गठित करता है, जिससे कम प्रशिक्षण डेटा के साथ स्थानिक तर्क (spatial reasoning) और एजेंटिक कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasq (…)2026-05-27
💬 NLP

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

यह शोध पत्र प्रकट करता है कि LLMs द्वारा निर्मित और मूल्यांकित स्वचालित बेंचमार्क एक मौलिक आत्म-पक्षपात (self-bias) से ग्रस्त होते हैं जहाँ मॉडल परीक्षण सेट निर्माण और मूल्यांकन दोनों में योगात्मक शैलीगत प्रवृत्तियों के कारण व्यवस्थित रूप से अपने स्वयं के आउटपुट का पक्ष लेते हैं, जिससे अक्सर वे स्वयं को साथियों की तुलना में श्रेष्ठ के रूप में गलत तरीके से रैंक करते हैं।

Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch2026-05-27
💬 NLP

HiSpec: Hierarchical Speculative Decoding for LLMs

HiSpec एक हाई-थ्रूपुट स्पेकुलेटिव डिकोडिंग फ्रेमवर्क है जो कम-ओवरहेड इंटरमीडिएट वेरिफिकेशन के लिए अर्ली-एग्जिट मॉडल्स का लाभ उठाता है और सटीकता से समझौता किए बिना LLM इन्फरेंस को महत्वपूर्ण रूप से तेज करने के लिए ड्राफ्ट, वेरिफायर और टारगेट मॉडल्स के बीच कम्प्यूटेशनल स्टेट्स को पुनः उपयोग करता है।

Avinash Kumar, Sujay Sanghavi, Poulami Das2026-05-27
💬 NLP

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

यह शोध पत्र PTA-GRPO का प्रस्ताव करता है, जो एक दो-चरणीय ढांचा है जो उच्च-स्तरीय योजना मार्गदर्शन के लिए सुपरवाइज्ड फाइन-ट्यूनिंग को गाइडेंस-अवेयर रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है ताकि विविध गणितीय और वैज्ञानिक बेंचमार्क पर लार्ज लैंग्वेज मॉडल्स की वैश्विक तर्क क्षमताओं को महत्वपूर्ण रूप से बढ़ाया जा सके।

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang (…)2026-05-27