💬 NLP

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

अल्ट्राएक्स (UltraX) एक फंक्शन-कॉलिंग फ्रेमवर्क है जो इंसर्शन (insertion), डिलीशन (deletion) और मॉडिफिकेशन (modification) क्षमताओं के साथ एडेप्टिव प्रोग्राममैटिक एडिटिंग को पेश करके बड़े पैमाने पर प्री-ट्रेनिंग डेटा रिफाइनमेंट को बढ़ाता है, जिससे मौजूदा नियम-आधारित और एलएलएम-आधारित (LLM-based) दृष्टिकोणों की दक्षता और विश्वसनीयता की सीमाओं को पार करते हुए बेहतर डेटा दक्षता और मॉडल प्रदर्शन प्राप्त किया जा सके।

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudon (…)2026-07-10
💬 NLP

Do You Need a Frontier Model as a Citation Verifier? Benchmarking Rubric LLMs for Deep-Research Source Attribution

यह शोध पत्र यह प्रदर्शित करता है कि डीप-रिसर्च सिस्टम में साइटेशन गुणवत्ता के लिए एलएलएम (LLM) जजों को कैलिब्रेट करना विश्वसनीय सुदृढीकरण अधिगम (reinforcement learning) के लिए एक पूर्व शर्त है, जो यह प्रकट करता है कि सस्ते मॉडल तथ्यात्मक समर्थन पर फ्रंटियर मॉडलों के समान प्रदर्शन कर सकते हैं और प्रतिस्पर्धी स्रोत-प्रासंगिकता का पता लगाने की क्षमता भी रखते हैं, हालांकि वे उन दिशात्मक पूर्वाग्रहों में महत्वपूर्ण रूप से भिन्न होते हैं जिन्हें एफ1 (F1) जैसे स्केलर मेट्रिक्स पकड़ने में विफल रहते हैं।

Ethan Leung, Elias Lumer, Corey Feld, Austin Huber, Vamse Kumar Subbiah, Kevin Paul2026-07-10
💬 NLP

Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents

यह शोध पत्र एक सक्रिय स्मृति एजेंट (proactive memory agent) प्रस्तुत करता है जो दीर्घकालिक कार्यों में "व्यवहार संबंधी अवस्था क्षय" (behavioral state decay) को रोकने के लिए निर्णय-प्रासंगिक जानकारी को सक्रिय रूप से प्रबंधित और इंजेक्ट करता है, जो चयनात्मक हस्तक्षेप और ओपन-वेट पॉलिसी प्रशिक्षण के माध्यम से विभिन्न बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao2026-07-10
💬 NLP

Validity of LLMs as data annotators: AMALIA on authority

यह शोध पत्र यह प्रदर्शित करता है कि जबकि पुर्तगाल के राष्ट्रीय भाषा मॉडल AMALIA ने अधिकार के नैतिक आधार पर मानव कोडर्स के साथ उच्च सहमति प्राप्त की है, लेकिन इसमें निर्माण वैधता (construct validity) का अभाव है क्योंकि यह सैद्धांतिक तर्क के बजाय सतही स्तर के शॉर्टकट पर निर्भर करता है, जो केवल सहमति से परे मॉडल के प्रदर्शन के साक्ष्य संबंधी आधार का मूल्यांकन करने के लिए राष्ट्रीय LLM बेंचमार्क की आवश्यकता को रेखांकित करता है।

Manuel Pita2026-07-10
💬 NLP

Monitoring Transformative Technological Convergence Through LLM-Extracted Semantic Entity Triple Graphs

यह शोध पत्र एक नवीन, डेटा-संचालित पाइपलाइन का प्रस्ताव करता है जो वैज्ञानिक और पेटेंट ग्रंथों से सिमेंटिक एंटिटी ट्रिपल्स (semantic entity triples) निकालने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे पैटर्न डिटेक्शन और ट्रेंड विश्लेषण के माध्यम से परिवर्तनकारी तकनीकी अभिसरण (technological convergence) की निगरानी और पूर्वानुमान लगाने के लिए एक गतिशील ग्राफ का निर्माण किया जाता है।

Alexander Sternfeld, Andrei Kucharavy, Dimitri Percia David, Alain Mermoud, Julian Jang-Jaccard, Nathan Monnet2026-07-09
💬 NLP

Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems

यह शोध पत्र सिमुलस्ट्रीम (Simulstream) को प्रस्तुत करता है, जो स्ट्रीमिंग स्पीच-टू-टेक्स्ट ट्रांसलेशन सिस्टम के मूल्यांकन और संवादात्मक प्रदर्शन को एकीकृत करने के लिए डिज़ाइन किया गया पहला ओपन-सोर्स फ्रेमवर्क है, जो लंबे प्रारूप वाली स्पीच पर इनक्रीमेंटल (incremental) और री-ट्रांसलेशन (re-translation) डिकोडिंग दोनों का समर्थन करता है और सिमुलइवल (SimulEval) जैसे मौजूदा उपकरणों की विखंडन और सीमाओं को संबोधित करता है।

Marco Gaido, Sara Papi, Mauro Cettolo, Matteo Negri, Luisa Bentivogli2026-07-09
💬 NLP

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE एक न्यूरो-सिंबोलिक दृष्टिकोण है जो न्यूनतम विवरण लंबाई (Minimum Description Length) उद्देश्य के माध्यम से विफलता ट्रैसेस (failure traces) से संकलित संक्षिप्त, व्याख्या योग्य नियमों को गतिशील रूप से इंजेक्ट करके डोमेन-विशिष्ट सेटिंग्स में लार्ज लैंग्वेज मॉडल्स की टूल-उपयोग विश्वसनीयता को बढ़ाता है, जिससे मॉडल वेट्स को संशोधित किए बिना देखे गए और अनदेखे टूल्स में सटीकता में सुधार होता है।

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das2026-07-09
💬 NLP

Towards Understanding Steering Strength

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स में स्टीयरिंग स्ट्रेंथ (steering strength) का पहला सैद्धांतिक विश्लेषण प्रस्तुत करता है, जो मॉडल व्यवहार पर इसके गैर-एकदिष्ट (non-monotonic) प्रभावों को नियंत्रित करने वाले सटीक नियमों को व्युत्पन्न करता है और ग्यारह अलग-अलग आर्किटेक्चर में इन भविष्यवाणियों को अनुभवजन्य रूप से मान्य करता है।

Magamed Taimeskhanov, Samuel Vaiter, Damien Garreau2026-07-09
💬 NLP

Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study

यह शोध पत्र CLUES प्रस्तुत करता है, जो क्लिनिकल Text-to-SQL में इनपुट अस्पष्टता को मॉडल अस्थिरता से अलग करने के लिए सिमेंटिक अनिश्चितता को विशिष्ट स्कोर में विभाजित करता है, जिससे मौजूदा विधियों की तुलना में लक्षित हस्तक्षेपों और अधिक कुशल त्रुटि ट्राइएज (error triage) को सक्षम बनाया जा सके।

Angelo Ziletti, Leonardo D'Ambrosi2026-07-09
💬 NLP

MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese

यह शोध पत्र MTEB-BR को प्रस्तुत करता है, जो अनुवाद पर निर्भर रहने के बिना टेक्स्ट एम्बेडिंग मॉडल का मूल्यांकन करने के लिए 22 मूल ब्राज़ीलियाई-पुर्तगाली कार्यों वाला पहला समर्पित बेंचमार्क है, जो यह प्रकट करता है कि ओपन-सोर्स मॉडल के साथ शीर्ष-स्तरीय प्रदर्शन प्राप्त करना संभव है और यह प्रदर्शित करता है कि वैश्विक बहुभाषी रैंकिंग केवल पुर्तगाली-विशिष्ट प्रभावशीलता की मध्यम रूप से भविष्यवाणी करती है।

Tardelli Ronan Coelho Stekel2026-07-09