💬 NLP

Vavanagi: a Community-run Platform for Documentation of the Hula Language in Papua New Guinea

यह शोध पत्र 'ववनगी' (Vavanagi) प्रस्तुत करता है, जो पापुआ न्यू गिनी की हुला भाषा के लिए एक समुदाय-नेतृत्व वाला मंच है, जो एक महत्वपूर्ण समानांतर संग्रह (parallel corpus) उत्पन्न करने के लिए क्राउडसोर्स अनुवाद और बुजुर्गों के नेतृत्व वाले पुनरावलोकन का उपयोग करता है और साथ ही पूर्णतः समुदाय-शासित भाषा प्रौद्योगिकी के लिए एक लेवल 5 फ्रेमवर्क स्थापित करता है।

Bri Olewale, Raphael Merx, Ekaterina Vylomova2026-03-17
💬 NLP

Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective

यह शोध पत्र LAPDOG जैसे रिट्रीवल-ऑगमेंटेड पर्सनलाइज्ड डायलॉग सिस्टम्स के मूल्यांकन के लिए सतही स्तर के लेक्सिकल मेट्रिक्स (lexical metrics) पर निर्भरता की आलोचना करता है, और मानव एवं एलएलएम-आधारित विश्लेषण के माध्यम से यह प्रदर्शित करता है कि ऐसे मेट्रिक्स आवश्यक संज्ञानात्मक और भाषाई गुणों को पकड़ने में विफल रहते हैं, जिससे वे सामंजस्य (coherence), निरंतरता (consistency) और साझा समझ (shared understanding) पर आधारित मूल्यांकन ढांचों की वकालत करते हैं।

Tianyi Zhang, David Traum2026-03-17
🤖 AI

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

यह शोध पत्र उच्च-स्तरीय योजना (high-level planning), निम्न-स्तरीय निष्पादन (low-level execution) और पुन: योजना (replanning) परतों के माध्यम से LLM वेब एजेंट की विफलताओं का निदान करने के लिए एक पदानुक्रमित नियोजन ढांचे (hierarchical planning framework) को प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि संरचित PDDL योजनाएं रणनीति निर्माण में सुधार करती हैं, फिर भी निम्न-स्तरीय निष्पादन और बोध संबंधी ग्राउंडिंग (perceptual grounding) मानव-स्तर की विश्वसनीयता प्राप्त करने में प्राथमिक बाधाएं बनी हुई हैं।

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao2026-03-17
💬 NLP

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

यह शोध पत्र MedPriv-Bench को प्रस्तुत करता है, जो यथार्थवादी गोपनीयता खतरों को संश्लेषित करने और नैदानिक सटीकता एवं रोगी डेटा सुरक्षा के बीच एक व्यापक तनाव को प्रदर्शित करके मेडिकल लार्ज लैंग्वेज मॉडल्स में गोपनीयता-उपयोगिता (privacy-utility) के संतुलन का संयुक्त रूप से मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है।

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui2026-03-17
💬 NLP

SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging

SemantiCache एक नवीन KV कैश संपीड़न ढांचा (framework) है जो कैश को सुसंगत चंक्स में विभाजित करके और ग्रीडी क्लस्टरिंग (greedy clustering) एवं आनुपातिक अटेंशन (proportional attention) के माध्यम से टोकन को मर्ज करके सिमेंटिक अखंडता को बनाए रखता है, जिससे मॉडल के प्रदर्शन से समझौता किए बिना 2.61x तक तेज़ डिकोडिंग और कम मेमोरी उपयोग प्राप्त होता है।

Shunlong Wu, Hai Lin, Shaoshen Chen, Tingwei Lu, Yongqin Zeng, Shaoxiong Zhan, Hai-Tao Zheng, Hong-Gee Kim2026-03-17
💬 NLP

ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretation

यह शोध पत्र ECG-Reasoning-Benchmark को प्रस्तुत करता है, जो एक मल्टी-टर्न मूल्यांकन ढांचा है जो यह प्रकट करता है कि हालांकि अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के पास चिकित्सा ज्ञान है, वे ECG संकेतों की व्याख्या करते समय वास्तविक चरण-दर-चरण दृश्य तर्क करने में गंभीर रूप से विफल रहते हैं, और अक्सर वास्तविक दृश्य साक्ष्यों के आधार पर निदान करने के बजाय सतही संकेतों पर निर्भर रहते हैं।

Jungwoo Oh, Hyunseung Chung, Junhee Lee, Min-Gyu Kim, Hangyul Yoon, Ki Seong Lee, Youngchae Lee, Muhan Yeo, Edward Choi2026-03-17
💬 NLP

Motivation in Large Language Models

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल सुसंगत, मानव-समान प्रेरणा संबंधी गतिकी (motivational dynamics) प्रदर्शित करते हैं जहाँ स्व-रिपोर्ट की गई प्रेरणा, व्यवहारिक हस्ताक्षरों, कार्य प्रदर्शन और बाहरी हेरफेर के प्रति प्रतिक्रियाशीलता के साथ व्यवस्थित रूप से सह-संबंधित होती है, जो यह सुझाव देता है कि प्रेरणा LLM व्यवहार को समझने के लिए एक वैध संगठित संरचना (organizing construct) है।

Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart2026-03-17
💬 NLP

Exposing Long-Tail Safety Failures in Large Language Models through Efficient Diverse Response Sampling

यह कार्य प्रस्तावित करता है और प्रदर्शित करता है कि प्रोग्रेसिव डाइवर्स पॉपुलेशन सैंपलिंग (PDPS), एक ऐसी विधि जो इनपुट को फिर से लिखने के बजाय उच्च गुणवत्ता वाले विविध मॉडल आउटपुट को व्यवस्थित रूप से और कुशलतापूर्वक नमूना लेने पर ध्यान केंद्रित करके छिपी हुई कमजोरियों को उजागर करती है, पारंपरिक तरीकों की तुलना में काफी कम कम्प्यूटेशनल लागत पर एलएलएम (LLMs) में दबी हुई असुरक्षित जानकारी की एक विस्तृत श्रृंखला को उजागर कर सकती है।

Suvadeep Hajra, Palash Nandi, Tanmoy Chakraborty2026-03-17✓ Author reviewed
💬 NLP

Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domains

यह शोध पत्र बाइनरी व्याकरणिक निर्णय के स्थान पर ऑर्डिनल-स्केल्ड वर्गीकरण कार्यों का उपयोग करते हुए, सूचना-सैद्धांतिक सरप्राइज़ल वक्रों (surprisal curves) और एंट्रॉपी के माध्यम से विविध डोमेन में मॉडल की प्राथमिकताओं और अनिश्चितता का आकलन करने के लिए, महंगे टेक्स्ट जनरेशन पर निर्भर रहे बिना, भाषा मॉडलों के मूल्यांकन हेतु मिनिमल पेयर्स प्रतिमान (minimal pairs paradigm) का विस्तार करता है।

Andrew Katz2026-03-17
💬 NLP

Questionnaire Responses Do not Capture the Safety of AI Agents

यह शोध पत्र तर्क देता है कि मानक प्रश्नावली-आधारित मूल्यांकन वास्तविक दुनिया के एआई एजेंटों की सुरक्षा का सटीक मूल्यांकन करने में विफल रहते हैं क्योंकि वे अनऑगमेंटेड (unaugmented) एलएलएम (LLM) के काल्पनिक स्व-रिपोर्टों पर निर्भर करते हैं, जिनमें निर्माण वैधता (construct validity) का अभाव होता है और जो तैनात एजेंटों के वास्तविक व्यवहार, पर्यावरणीय अंतःक्रियाओं और उनसे उत्पन्न जोखिमों को प्रतिबिंबित नहीं करते हैं।

Max Hellrigel-Holderbaum, Edward James Young2026-03-17