💬 NLP

Towards Scalable Oversight via Partitioned Human Supervision

यह शोध पत्र एक स्केलेबल ओवरसाइट फ्रेमवर्क प्रस्तावित करता है जो विभाजित मानव पर्यवेक्षण का लाभ उठाता है, जहाँ डोमेन विशेषज्ञ सही उत्तरों के बजाय गलत विकल्पों को इंगित करने वाले "पूरक लेबल" (complementary labels) प्रदान करते हैं, ताकि ग्राउंड ट्रुथ डेटा की आवश्यकता के बिना फ्रंटियर एआई प्रणालियों के मूल्यांकन और आत्म-सुधार को सक्षम बनाया जा सके।

Ren Yin, Takashi Ishida, Masashi Sugiyama2026-02-25
💬 NLP

A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding

यह शोध पत्र XMPIE को प्रस्तुत करता है, जो 34 भाषाओं में 10,000 से अधिक संभावित मुहावरेदार अभिव्यक्तियों वाला एक उच्च-गुणवत्ता वाला समानांतर बहुभाषी और बहुविध (multimodal) बेंचमार्क है, जिसे विभिन्न भाषाओं और टेक्स्ट-इमेज मोडैलिटीज़ में मुहावरेदारता को समझने की एनएलपी (NLP) प्रणालियों की क्षमताओं का मूल्यांकन और तुलना करने के लिए डिज़ाइन किया गया है।

Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Ali (…)2026-02-25
💬 NLP

FROST: Filtering Reasoning Outliers with Attention for Efficient Reasoning

FROST एक अटेंशन-अवेयर विधि है जो अनक्रिटिकल पथों को छाँटने के लिए रीजनिंग आउटलेर्स को फ़िल्टर करती है, जिससे कई बेंचमार्क में रीजनिंग मॉडल्स की दक्षता (69.68% टोकन कमी) और सटीकता (26.70% लाभ) दोनों में महत्वपूर्ण सुधार होता है।

Haozheng Luo, Zhuolin Jiang, Md Zahid Hasan, Yan Chen, Soumalya Sarkar2026-02-25
💬 NLP

The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems

यह शोध पत्र "सिंगल-मल्टी इवोल्यूशन लूप" का परिचय देता है, जो एक स्व-सुधार ढांचा है जो कई भाषा मॉडलों से सहयोगात्मक पैटर्न को एक एकल कुशल मॉडल में संकुचित (distill) करता है, जो फिर विविध कार्यों में प्रदर्शन को सामूहिक रूप से बढ़ाने के साथ-साथ कम्प्यूटेशनल लागत को कम करने के लिए सहयोग चक्र में पुन: प्रवेश करता है।

Shangbin Feng, Kishan Panaganti, Yulia Tsvetkov, Wenhao Yu2026-02-25
💬 NLP

Context Shapes LLMs Retrieval-Augmented Fact-Checking Effectiveness

यह अध्ययन प्रदर्शित करता है कि जबकि LLMs के पास अंतर्निहित तथ्यात्मक ज्ञान होता है, उनकी रिट्रीवल-ऑगमेंटेड फैक्ट-चेकिंग सटीकता संदर्भ की लंबाई बढ़ने के साथ काफी घट जाती है और साक्ष्य के स्थान पर महत्वपूर्ण रूप से निर्भर करती है, जिसमें प्रदर्शन तब गिर जाता है जब प्रासंगिक जानकारी प्रॉम्प्ट के मध्य में दिखाई देती है।

Pietro Bernardelle, Stefano Civelli, Kevin Roitero, Gianluca Demartini2026-02-25
💬 NLP

MCPShield: A Security Cognition Layer for Adaptive Trust Calibration in Model Context Protocol Agents

यह शोध पत्र MCPShield को प्रस्तुत करता है, जो एक प्लग-इन सुरक्षा संज्ञान परत (security cognition layer) है जो मेटाडेटा-निर्देशित जांच (metadata-guided probing) और आह्वान-पश्चात प्रतिबिंब (post-invocation reflection) का उपयोग करके विभिन्न LLMs में कम ओवरहेड और उच्च सामान्यीकरण बनाए रखते हुए विविध हमलों के विरुद्ध मजबूती से बचाव करने और मॉडल कॉन्टेक्स्ट प्रोटोकॉल (MCP) एजेंटों में विश्वास मिसअलाइनमेंट (trust misalignment) को कम करने का कार्य करता है।

Zhenhong Zhou, Yuanhe Zhang, Hongwei Cai, Moayad Aloqaily, Ouns Bouachir, Linsey Pang, Prakhar Mehrotra, Kun Wang, Qings (…)2026-02-25
💬 NLP

GLM-5: from Vibe Coding to Agentic Engineering

GLM-5 एक अगली पीढ़ी का फाउंडेशन मॉडल है जो लागत दक्षता के लिए DSA का लाभ उठाकर और जटिल, एंड-टू-एंड सॉफ्टवेयर इंजीनियरिंग कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए नवीन एसिंक्रोनस रीइन्फोर्समेंट लर्निंग का उपयोग करके "वाइब कोडिंग" से "एजेंटिक इंजीनियरिंग" की ओर संक्रमण करता है।

GLM-5-Team, :, Aohan Zeng, Xin Lv, Zhenyu Hou, Zhengxiao Du, Qinkai Zheng, Bin Chen, Da Yin, Chendi Ge, Chenghua Huang (…)2026-02-25
💬 NLP

Games That Teach, Chats That Convince: Comparing Interactive and Static Formats for Persuasive Learning

यह अध्ययन संवादात्मक स्थिरता शिक्षण के लिए स्थिर निबंधों, चैटबॉट्स और टेक्स्ट-आधारित खेलों की तुलना करता है, जो यह प्रकट करता है कि जहाँ चैटबॉट्स कथित महत्व को बढ़ाने में सबसे प्रभावी होते हैं, वहीं टेक्स्ट-आधारित खेल कम व्यक्तिपरक शिक्षण रेटिंग के बावजूद बेहतर दीर्घकालिक ज्ञान प्रतिधारण प्रदान करते हैं, जो उपयोगकर्ता जुड़ाव और वास्तविक सीखने के परिणामों के बीच एक महत्वपूर्ण अलगाव को उजागर करता है।

Seyed Hossein Alavi, Zining Wang, Shruthi Chockkalingam, Raymond T. Ng, Vered Shwartz2026-02-25
💬 NLP

INSURE-Dial: A Phase-Aware Conversational Dataset & Benchmark for Compliance Verification and Phase Detection

यह शोध पत्र INSURE-Dial प्रस्तुत करता है, जो वास्तविक और सिंथेटिक बीमा सत्यापन कॉल्स से बना पहला सार्वजनिक बेंचमार्क है, जिसमें कॉल चरणों (phases) का पता लगाने और सूचना एवं प्रक्रियात्मक अनुपालन को सत्यापित करने में वॉइस एजेंटों के मूल्यांकन और सुधार के लिए चरण-संरचित अनुपालन डेटा को एनोटेट किया गया है।

Shubham Kulkarni, Alexander Lyzhov, Preetam Joshi, Shiva Chaitanya2026-02-25
💬 NLP

BabyLM Turns 4 and Goes Multilingual: Call for Papers for the 2026 BabyLM Workshop

बेबीएलएम वर्कशॉप 2026 ने अपने चौथे चुनौती संस्करण की घोषणा की है, जिसमें मानक अंग्रेजी-मात्र ट्रैक के साथ अंग्रेजी, डच और चीनी के लिए एक नया बहुभाषी ट्रैक पेश किया गया है, और संज्ञानात्मक मॉडलिंग, प्रशिक्षण दक्षता और लघु-स्तरीय भाषा मॉडल विकास पर शोध पत्रों को आमंत्रित किया गया है।

Leshem Choshen, Ryan Cotterell, Mustafa Omer Gul, Jaap Jumelet, Tal Linzen, Aaron Mueller, Suchir Salhan, Raj Sanjay Sha (…)2026-02-25