💬 NLP

Differentially Private De-identification of Dutch Clinical Notes: A Comparative Evaluation

यह शोध पत्र डच क्लिनिकल नोट्स को वि-पहचानित (de-identifying) करने के लिए डिफरेंशियल प्राइवेसी, नेम्ड एंटिटी रिकग्निशन और लार्ज लैंग्वेज मॉडल्स का पहला तुलनात्मक अध्ययन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि जबकि केवल डिफरेंशियल प्राइवेसी डेटा उपयोगिता को महत्वपूर्ण रूप से कम कर देती है, इसे LLM-आधारित प्रीप्रोसेसिंग के साथ संयोजित करने वाले हाइब्रिड दृष्टिकोण एक बेहतर गोपनीयता-उपयोगिता संतुलन प्राप्त करते हैं।

Michele Miranda, Xinlan Yan, Nishant Mishra, Rachel Murphy, Ameen Abu-Hanna, Sébastien Bratières, Iacer Calixto2026-04-24
💬 NLP

Decoupled DiLoCo for Resilient Distributed Pre-training

यह शोध पत्र Decoupled DiLoCo को प्रस्तुत करता है, जो एक एसिंक्रोनस (asynchronous) वितरित प्रशिक्षण ढांचा है जो स्वतंत्र शिक्षार्थियों (learners) के बीच गणना को विभाजित करता है और ग्लोबल सिंक्रोनाइज़ेशन स्टॉल्स (global synchronization stalls) को समाप्त करने के लिए कोरम-आधारित एकत्रीकरण (quorum-based aggregation) का उपयोग करता है, जिससे प्रतिस्पर्धी मॉडल प्रदर्शन बनाए रखते हुए विफलता-प्रवण वातावरण में शून्य वैश्विक डाउनटाइम और बेहतर दक्षता प्राप्त होती है।

Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Wood (…)2026-04-24
💬 NLP

AI-Gram: When Visual Agents Interact in a Social Network

यह शोध पत्र AI-Gram का परिचय देता है, जो एक लाइव प्लेटफॉर्म है जहाँ LLM-संचालित एजेंट छवियों के माध्यम से परस्पर क्रिया करते हैं, जिससे यह पता चलता है कि जबकि ये एजेंट स्वतः ही समृद्ध दृश्य संचार संरचनाएँ बनाते हैं, वे साथ ही व्यक्तिगत सौंदर्य संप्रभुता बनाए रखते हैं और शैलीगत अभिसरण का विरोध करते हैं।

Andrew Shin2026-04-24
💬 NLP

Reasoning Primitives in Hybrid and Non-Hybrid LLMs

यह अध्ययन सुझाव देता है कि जबकि तर्क संवर्धन (reasoning augmentation) बड़े भाषा मॉडलों की प्रभावी परिचालन सीमा का महत्वपूर्ण विस्तार करता है, अटेंशन-आधारित रिट्रीवल के साथ आवर्ती अवस्था अपडेट (recurrent state updates) को संयोजित करने वाले हाइब्रिड आर्किटेक्चर, जटिल अनुक्रमिक अवस्था-ट्रैकिंग और रिकॉल की आवश्यकता वाले कार्यों में केवल अटेंशन वाले ट्रांसफॉर्मर की तुलना में बेहतर मजबूती बनाए रखते हैं।

Shivam Rawat, Lucie Flek, Florian Mai, Nicholas Kluge Corrêa2026-04-24
💬 NLP

Cross-Domain Data Selection and Augmentation for Automatic Compliance Detection

यह शोध पत्र इस बात की जांच करता है कि कैसे लक्षित डेटा चयन रणनीतियाँ—विशेष रूप से रैंडम सैंपलिंग, क्रॉस-एन्ट्रॉपी डिफरेंस, इम्पोर्टेंस वेटिंग और एम्बेडिंग-आधारित रिट्रीवल—विविध कानूनी डोमेन में स्वचालित नियामक अनुपालन पहचान मॉडल के नकारात्मक हस्तांतरण (नेगेटिव ट्रांसफर) को कम कर सकती हैं और उनके सामान्यीकरण (जनरलाइजेशन) में सुधार कर सकती हैं।

Fariz Ikhwantri, Dusica Marijan2026-04-24
💬 NLP

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

यह शोध पत्र 10 भारतीय भाषाओं में बहुभाषी टेक्स्ट-टू-स्पीच (TTS) प्रणालियों के लिए एक नियंत्रित, बहुआयामी युग्म-मूल्यांकन ढांचे को प्रस्तुत करता है, जो एक विश्वसनीय लीडरबोर्ड बनाने, प्रत्यक्ष बोध संबंधी समझौतों का विश्लेषण करने और ब्रैडली-टेरी मॉडलिंग एवं SHAP विश्लेषण के माध्यम से मॉडल प्राथमिकताओं की व्याख्या करने के लिए 120,000 से अधिक मानव तुलनाओं का उपयोग करता है।

Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandy (…)2026-04-24
🤖 machine learning

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

यह शोधपत्र TaNOS को प्रस्तुत करता है, जो एक निरंतर प्री-ट्रेनिंग फ्रेमवर्क है जो हेडर अनायनाइज़ेशन (header anonymization), ऑपरेशन स्केचेस (operation sketches) और प्रोग्राम-फर्स्ट सेल्फ-सुपरवाइज्ड लर्निंग को संयोजित करके विशेषज्ञ-डोमेन तालिकाओं में संख्यात्मक तर्क की मजबूती और हस्तांतरणीयता को बढ़ाता है, ताकि सुपरवाइज्ड फाइन-ट्यूनिंग और डोमेन शिफ्ट की सीमाओं को दूर किया जा सके।

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee2026-04-24
💬 NLP

From Tokens to Concepts: Leveraging SAE for SPLADE

यह शोध पत्र SAE-SPLADE का प्रस्ताव करता है, जो एक नवीन रिट्रीवल मॉडल है जो शब्दावली की सीमाओं को दूर करने के लिए पारंपरिक शब्दावली को स्पार्स ऑटो-एनकोडर के माध्यम से सीखे गए सिमेंटिक कॉन्सेप्ट्स (semantic concepts) से बदलता है, जबकि तुलनीय प्रदर्शन बनाए रखते हुए दक्षता में सुधार करता है।

Yuxuan Zong, Mathias Vast, Basile Van Cooten, Laure Soulier, Benjamin Piwowarski2026-04-24
💬 NLP

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

यह शोध पत्र इमेज-टू-टेक्स्ट और टेक्स्ट-टू-इमेज कार्यों के लिए मूल्यांकनकर्ता के रूप में उपयोग किए जाने वाले विजन-लैंग्वेज मॉडल्स की विश्वसनीयता का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि वे महत्वपूर्ण ब्लाइंड स्पॉट्स प्रदर्शित करते हैं—विशेष रूप से मतिभ्रम (hallucinations), स्थानिक त्रुटियों और तथ्यात्मक विसंगतियों का पता लगाने में—और अक्सर 50% से अधिक मामलों में गुणवत्ता कम करने वाले व्यवधानों को पहचानने में विफल रहते हैं।

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra2026-04-24
💬 NLP

UKP_Psycontrol at SemEval-2026 Task 2: Modeling Valence and Arousal Dynamics from Text

UKP_Psycontrol प्रणाली, जो LLM प्रॉम्प्टिंग, एक पेयरवाइज़ मैक्सिमम एंट्रॉपी मॉडल और यूजर एम्बेडिंग्स के साथ एक न्यूरल रिग्रेशन दृष्टिकोण को जोड़ती है, ने स्थिर भावनात्मक संकेतों को प्रभावी ढंग से मॉडल करते हुए और यह प्रदर्शित करते हुए कि अल्पकालिक भावनात्मक परिवर्तनों की भविष्यवाणी पाठ्य अर्थों (textual semantics) की तुलना में हालिया संख्यात्मक अवस्था प्रक्षेपवक्रों (numeric state trajectories) द्वारा बेहतर तरीके से की जाती है, SemEval-2026 टास्क 2 में प्रथम स्थान प्राप्त किया।

Darya Hryhoryeva, Amaia Zurinaga, Hamidreza Jamalabadi, Iryna Gurevych2026-04-24