💬 NLP

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

यह शोध पत्र खमेर-भाषा के टेलीकॉम दस्तावेजों के लिए एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) प्रणाली का तुलनात्मक अध्ययन प्रस्तुत करता है, जिसमें BGE-M3 को बेहतर रिट्रिवर के रूप में पहचाना गया है और यह प्रदर्शित किया गया है कि हालांकि कोई भी एकल जनरेटर मॉडल सभी प्रदर्शन मेट्रिक्स में हावी नहीं है, विभिन्न मॉडल विशिष्ट क्षेत्रों जैसे कि निष्ठा (faithfulness), तथ्यात्मक शुद्धता, या अर्थ संबंधी समानता में उत्कृष्ट हैं।

Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn2026-05-22
💬 NLP

Cross-Lingual Consensus: Aligning Multilingual Cultural Knowledge via Multilingual Self-Consistency

यह शोधपत्र एक नवीन स्व-पर्यवेक्षित ढांचे का प्रस्ताव करता है जो क्रॉस-लिंगुअल ज्ञान अंतराल को पाटने के लिए बहुभाषी स्व-संगति और स्व-आलोचना का लाभ उठाता है, जिससे बाहरी डेटा पर निर्भर रहे बिना स्थानीय भाषाओं से अंग्रेजी में अंतर्निहित सांस्कृतिक ज्ञान को उजागर और स्थानांतरित करके एलएलएम (LLMs) में सांस्कृतिक संरेखण में महत्वपूर्ण सुधार होता है।

Andrew Ivan Soegeng, Patrick Sutanto, Tan Sang Nguyen2026-05-22
💬 NLP

Efficient Agentic Reasoning Through Self-Regulated Simulative Planning

यह शोध पत्र SR2^2AM का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो निर्णय लेने को सिमुलेटिव प्लानिंग (simulative planning), रिएक्टिव एक्जीक्यूशन (reactive execution) और एक सीखे हुए सेल्फ-रेगुलेशन मैकेनिज्म (self-regulation mechanism) में विभाजित करके एजेंटिक रीजनिंग की दक्षता को बढ़ाता है, जो यह गतिशील रूप से निर्धारित करता है कि कब और कितनी गहराई से योजना बनानी है, जिससे बड़े मॉडलों की तुलना में काफी कम रीजनिंग टोकन के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।

Mingkai Deng, Jinyu Hou, Lara Sá Neves, Varad Pimpalkhute, Taylor W. Killian, Zhengzhong Liu, Eric P. Xing2026-05-22
💬 NLP

IdioLink: Retrieving Meaning Beyond Words Across Idiomatic and Literal Expressions

यह शोधपत्र IdioLink प्रस्तुत करता है, जो एक बड़े पैमाने का रिट्रीवल बेंचमार्क है जिसमें 10,000 से अधिक दस्तावेज़ और 2,000 क्वेरी शामिल हैं, जिसे वर्तमान एम्बेडिंग मॉडलों की उन सीमाओं को उजागर करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है जहाँ वे मुहावरेदार अभिव्यक्तियों को उनके वैचारिक रूप से समान शाब्दिक या पैराफ्रेज़्ड अर्थों से जोड़ने में विफल रहते हैं।

Kai Golan Hashiloni, Daniel Fadlon, Lior Livyatan, Ofri Hefetz, Jiahuan Pei, Kfir Bar2026-05-22
💬 NLP

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

यह शोध पत्र TransitLM प्रस्तुत करता है, जो 13 मिलियन से अधिक ट्रांजिट रिकॉर्ड वाला एक बड़े पैमाने का डेटासेट और बेंचमार्क है, जो लार्ज लैंग्वेज मॉडल्स को पारंपरिक मैप इंफ्रास्ट्रक्चर पर निर्भर हुए बिना, ओरिजिन-डेस्टिनेशन जानकारी से सीधे संरचनात्मक रूप से वैध, मैप-मुक्त सार्वजनिक पारगमन मार्ग उत्पन्न करने में सक्षम बनाता है।

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu2026-05-22
💬 NLP

Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning

यह शोध पत्र यह प्रदर्शित करता है कि अवसाद और व्यामोह जैसे कुअनुकूलित व्यवहार संबंधी पैटर्न का प्रतिनिधित्व करने वाले सिंथेटिक डेटासेट पर लार्ज लैंग्वेज मॉडल्स को फाइन-ट्यून करना, उनके जनरेटिव वितरणों और एक्शन सिलेक्शन में स्थिर, संदर्भ-सामान्य बदलाव उत्पन्न करता है, जिससे एलएलएम (LLMs) व्यवहार संबंधी बाधाओं और उभरते संज्ञानात्मक निरूपणों के बीच संबंध के अध्ययन के लिए नियंत्रणीय नीति-आधारित प्रणालियों के रूप में मान्य होते हैं।

Nicola Milano, Davide Marocco2026-05-22
💬 NLP

Boundary-targeted Membership Inference Attacks on Safety Classifiers

यह शोध पत्र एक सीमा-लक्षित सदस्यता अनुमान हमले (boundary-targeted membership inference attack) की रणनीति प्रस्तुत करता है जो सुरक्षा क्लासिफायर से संवेदनशील प्रशिक्षण डेटा की रिकवरी में महत्वपूर्ण सुधार करने के लिए कम-आत्मविश्वास वाले भविष्यवाणियों का लाभ उठाता है, यह प्रदर्शित करते हुए कि ऐसे मॉडल सामग्री-आधारित फ़िल्टरिंग के बावजूद गोपनीयता उल्लंघन के प्रति संवेदनशील हैं, हालांकि मौजूदा शोर रणनीतियाँ (noise strategies) इस जोखिम को प्रभावी ढंग से कम कर सकती हैं।

Anthony Hughes, Alexander Goldberg, Prince Jha, Adam Perer, Nikolaos Aletras, Niloofar Mireshghallah2026-05-22
💬 NLP

Multi-Stage Training for Abusive Comment Detection in Indic Languages

यह शोध पत्र अभिव्यक्ति की स्वतंत्रता को बनाए रखने के लिए गलत सकारात्मक परिणामों (फॉल्स पॉजिटिव) को कम करते हुए, भारतीय भाषाओं में अपमानजनक टिप्पणियों का पता लगाने के लिए भाषा-आधारित प्रीप्रोसेसिंग और मॉडलों के एक समूह (एन्सेम्बल) को संयोजित करने वाले एक बहु-चरणीय प्रशिक्षण पाइपलाइन का प्रस्ताव करता है।

Pranshu Rastogi, Madhav Mathur, Ramaneswaran S, Kshitij Mohan2026-05-22
💬 NLP

Unified Data Selection for LLM Reasoning

यह शोध पत्र हाई-एंट्रॉपी सम (HES) को प्रस्तुत करता है, जो एक ट्रेनिंग-मुक्त मीट्रिक है जो टॉप टोकन के एंट्रॉपी को जोड़कर उच्च-गुणवत्ता वाले रीजनिंग डेटा की कुशलतापूर्वक पहचान करता है, जिससे कंप्यूटेशनल लागत को कम करते हुए सुपरवाइज्ड फाइन-ट्यूनिंग, रिजेक्शन फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग प्रतिमानों में लार्ज लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xiaoyuan Li, Yubo Ma, Chengpeng Li, Fengbin Zhu, Yiyao Yu, Keqin Bao, Wenjie Wang, Fuli Feng, Dayiheng Liu2026-05-22
💬 NLP

Epicure: Navigating the Emergent Geometry of Food Ingredient Embeddings

यह शोध पत्र एपिक्योर (Epicure) प्रस्तुत करता है, जो 4.14 मिलियन व्यंजनों पर प्रशिक्षित बहुभाषी सामग्री एम्बेडिंग का एक परिवार है, जो सामग्री सह-उपस्थिति और रासायनिक स्वाद यौगिकों के एक हाइब्रिड ग्राफ में नेविगेट करने के लिए विशिष्ट रैंडम-वॉक स्कीमा का उपयोग करता है, जिससे मॉडल को रेसिपी संदर्भ और रासायनिक संरचना के बीच एक स्पेक्ट्रम के विभिन्न बिंदुओं पर स्थित किया जा सके।

Jakub Radzikowski, Josef Chen2026-05-22