💬 NLP

Coding-Free and Privacy-Preserving MCP Framework for Clinical Agentic Research Intelligence System

यह शोध पत्र CARIS को प्रस्तुत करता है, जो एक कोडिंग-मुक्त और गोपनीयता-संरक्षण वाला एजेंटिक AI फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स और मॉडल कॉन्टेक्स्ट प्रोटोकॉल का लाभ उठाकर अध्ययन डिजाइन और कोहोर्ट निर्माण से लेकर मॉडल विकास और रिपोर्टिंग तक संपूर्ण क्लिनिकल रिसर्च वर्कफ़्लो को स्वचालित करता है—बिना उपयोगकर्ताओं के कच्चे रोगी डेटा तक पहुँच या प्रोग्रामिंग कौशल की आवश्यकता के।

Taehun Kim, Hyeryun Park, Hyeonhoon Lee, Yushin Lee, Kyungsang Kim, Hyung-Chul Lee2026-04-15
💬 NLP

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

यह शोधपत्र SpreadsheetAgent को प्रस्तुत करता है, जो एक दो-चरणीय मल्टी-एजेंट फ्रेमवर्क है जो स्प्रेडशीट को सादे टेक्स्ट के रूप में मानने और विशाल पैमाने को संभालने की सीमाओं को पार करता है, जो मल्टी-मोडल रीजनिंग और वेरिफिकेशन के माध्यम से स्थानीयकृत क्षेत्रों (localized regions) की क्रमिक व्याख्या करके स्प्रेडशीट बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li2026-04-15
💬 NLP

The Enforcement and Feasibility of Hate Speech Moderation on Twitter

ट्विटर के एक वैश्विक ऑडिट से पता चलता है कि मानव-एआई मॉडरेशन पाइपलाइनों के माध्यम से घृणास्पद भाषण (हेट स्पीच) को महत्वपूर्ण रूप से कम करने की तकनीकी और आर्थिक व्यवहार्यता के बावजूद, प्लेटफॉर्म का वर्तमान प्रवर्तन तकनीकी सीमाओं के बजाय संस्थागत संसाधन आवंटन संबंधी विकल्पों के कारण काफी अप्रभावी है।

Manuel Tonneau, Dylan Thurgood, Diyi Liu, Niyati Malhotra, Victor Orozco-Olvera, Ralph Schroeder, Scott A. Hale, Manoel (…)2026-04-15
🤖 AI

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

यह शोधपत्र Frontier-Eng को प्रस्तुत करता है, जो एक मानव-सत्यापित बेंचमार्क है जिसमें 47 औद्योगिक-स्तर के इंजीनियरिंग कार्य शामिल हैं जो निरंतर फीडबैक और कठिन बाधाओं के माध्यम से प्रपोज़-एग्जीक्यूट-इवैल्यूएट लूप्स के जरिए डिज़ाइनों को पुनरावृत्तीय रूप से अनुकूलित करने की फ्रंटियर भाषा मॉडलों की क्षमता का मूल्यांकन करते हैं, जिससे यह खुलासा होता है कि हालांकि Claude 4.6 Opus अग्रणी है, फिर भी महत्वपूर्ण चुनौतियां बनी हुई हैं और सुधार दोनों आवृत्ति और परिमाण में एक दोहरे पावर-लॉ डिके (dual power-law decay) का अनुसरण करता है।

Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang, Boshi Zhang, Zhe Cao, Xiaoyan Fan, Bingxiang He, Han Hao (…)2026-04-15
💬 NLP

CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems

यह शोध पत्र CompliBench प्रस्तुत करता है, जो एक नया बेंचमार्क और स्वचालित डेटा जनरेशन पाइपलाइन है जिसे एंटरप्राइज डायलॉग सिस्टम में अनुपालन उल्लंघन (compliance violations) का पता लगाने और उन्हें स्थानीयकृत करने की LLM जजों की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल इस कार्य में संघर्ष करते हैं जबकि यह भी प्रदर्शित करता है कि सिंथेसाइज्ड डेटा पर फाइन-ट्यून किए गए छोटे पैमाने के मॉडल बेहतर प्रदर्शन और सामान्यीकरण (generalization) प्राप्त करते हैं।

Jingbo Yang, Guanyu Yao, Bairu Hou, Xinghan Yang, Nikolai Glushnev, Iwona Bialynicka-Birula, Duo Ding, Shiyu Chang2026-04-15
💬 NLP

Masked by Consensus: Disentangling Privileged Knowledge in LLM Correctness

यह शोध पत्र इस बात की जांच करता है कि क्या बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) के पास उत्तर की शुद्धता के बारे में विशेषाधिकार प्राप्त आंतरिक ज्ञान होता है, जो यह प्रकट करता है कि जबकि उच्च अंतर-मॉडल सहमति के कारण मानक बेंचमार्क पर स्व-प्रतिनिधित्व (सेल्फ-रिप्रजेंटेशन) कोई लाभ नहीं देते हैं, वे गणितीय तर्क के विपरीत, असहमति उपसमुच्चयों (डिसेग्रीमेंट सबसेट्स) पर मूल्यांकित किए जाने पर समकक्ष मॉडलों की तुलना में तथ्यात्मक कार्यों में एक डोमेन-विशिष्ट बढ़त प्रदान करते हैं।

Tomer Ashuach, Liat Ein-Dor, Shai Gretz, Yoav Katz, Yonatan Belinkov2026-04-15
🤖 machine learning

Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

नेमोट्रॉन 3 सुपर (Nemotron 3 Super) एक ओपन-सोर्स, 120-बिलियन-पैरामीटर हाइब्रिड मांबा-ट्रांसफॉर्मर मिक्स्चर-ऑफ-एक्सपर्ट्स (Mamba-Transformer Mixture-of-Experts) मॉडल है जिसे NVFP4 में लेटेंटएमओई (LatentMoE) और एमटीपी (MTP) परतों के साथ प्री-ट्रेन किया गया है, जो अग्रणी मॉडलों की सटीकता से मेल खाते हुए उच्च थ्रूपुट और 1M कॉन्टेक्स्ट सपोर्ट प्राप्त करता है।

NVIDIA, :, Aakshita Chandiramani, Aaron Blakeman, Abdullahi Olaoye, Abhibha Gupta, Abhilash Somasamudramath, Abhinav Kh (…)2026-04-15
💬 NLP

Cooperative Memory Paging with Keyword Bookmarks for Long-Horizon LLM Conversations

यह शोध पत्र "कोऑपरेटिव पेजिंग" (cooperative paging) का प्रस्ताव करता है, जो लंबी अवधि की एलएलएम (LLM) बातचीत के लिए एक मेमोरी प्रबंधन रणनीति है जो हटाए गए कंटेंट को न्यूनतम कीवर्ड बुकमार्क और एक रिकॉल टूल से बदल देती है, जिससे लोकोमो (LoCoMo) बेंचमार्क पर अत्याधुनिक उत्तर गुणवत्ता प्राप्त होती है और यह भी पता चलता है कि प्रभावी रिट्रीवल के लिए मोटे निश्चित-आकार के पेज और विशिष्ट बुकमार्क विशिष्टता महत्वपूर्ण हैं।

Ziyang Liu2026-04-15
💬 NLP

SCRIPT: A Subcharacter Compositional Representation Injection Module for Korean Pre-Trained Language Models

यह शोध पत्र SCRIPT को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) मॉड्यूल है जो कोरियाई पूर्व-प्रशिक्षित भाषा मॉडलों में उप-वर्ण (जामो) संरचनात्मक ज्ञान को इंजेक्ट करता है ताकि बिना किसी स्थापत्य परिवर्तन या अतिरिक्त पूर्व-प्रशिक्षण के NLU और NLG कार्यों पर उनके प्रदर्शन को बढ़ाने के साथ-साथ व्याकरणिक और अर्थ संबंधी नियमितताओं को बेहतर ढंग से कैप्चर किया जा सके।

SungHo Kim, Juhyeong Park, Eda Atalay, SangKeun Lee2026-04-15
💬 NLP

Latent-Condensed Transformer for Efficient Long Context Modeling

यह शोध पत्र लेटेंट-कंडेंस्ड अटेंशन (LCA) प्रस्तुत करता है, जो एक आर्किटेक्चर-अज्ञेय (architecture-agnostic) विधि है जो क्वेरी-अवेयर पूलिंग और एंकर सिलेक्शन के माध्यम से मल्टी-हेड लेटेंट अटेंशन (MLA) के लेटेंट स्पेस के भीतर सीधे संदर्भ को सघन (condense) करके लॉन्ग-कॉन्टेक्स्ट मॉडलिंग के लिए कम्प्यूटेशनल दक्षता और KV कैश न्यूनीकरण को संयुक्त रूप से अनुकूलित करती है, जिससे प्रदर्शन से समझौता किए बिना महत्वपूर्ण गति और मेमोरी की बचत प्राप्त होती है।

Zeng You, Yaofo Chen, Qiuwu Chen, Ying Sun, Shuhai Zhang, Yingjian Li, Yaowei Wang, Mingkui Tan2026-04-15