💬 NLP

CurateEvo: Data-Curation Evolving for Agentic Post-Training

CurateEvo एक विफलता-संचालित गतिशील विकास ढांचा (failure-driven dynamic evolution framework) है जो डेटा क्यूरेशन को निष्पादन योग्य कोड के रूप में प्रस्तुत करता है और बड़े भाषा मॉडल एजेंटों के लिए पोस्ट-ट्रेनिंग डेटा की प्रभावशीलता और दक्षता दोनों को अनुकूलित करने के लिए एजेंट विफलता प्रक्षेप पथों (agent failure trajectories) का उपयोग करके इसे पुनरावर्ती रूप से फिर से लिखता है।

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che2026-07-08
💬 NLP

When Does Tool Use Increase the Expressive Power of Finite-Precision Recurrent Models?

यह शोध पत्र एक स्पष्ट द्वंद्व स्थापित करता है जो यह दर्शाता है कि जहाँ परिमित-अवस्था (finite-state) उपकरण परिमित-परिशुद्धता वाले आवर्ती मॉडलों (finite-precision recurrent models) में नगण्य कम्प्यूटेशनल शक्ति जोड़ते हैं, वहीं एक एकल लघुतम अनंत-अवस्था उपकरण (एक रीड-राइट टेप) उन्हें ट्यूरिंग पूर्ण (Turing complete) बना देता है, एक ऐसी क्षमता जिसे चयनात्मक एफाइन स्टेट-स्पेस मॉडलों (selective affine state-space models) द्वारा मूर्त रूप से साकार किया गया है।

Nikola Zubić, Qian Li, Yuyi Wang, Davide Scaramuzza2026-07-08
💬 NLP

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

यह शोध पत्र आंशिक रूप से दृश्यमान संयुक्त निर्णय लेने वाले कार्यों में विचारशील (deliberative) LLM एजेंटों के लिए एक स्केलेबल बेंचमार्क और मूल्यांकन ढांचा प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि वर्तमान मॉडल जटिल संरेखण और तर्क करने में संघर्ष करते हैं, विचार प्रक्रिया स्वयं आत्मचिंतन और त्रुटि सुधार के अवसर प्रदान कर सकती है जो कभी-कभी केंद्रीकृत बेसलाइन से बेहतर प्रदर्शन करती है।

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu2026-07-08
💬 NLP

Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

यह शोध पत्र प्रदर्शित करता है कि सुदृढीकरण सीखना (Reinforcement Learning) LLM-जनित BPMN प्रक्रिया मॉडलों की गुणवत्ता को महत्वपूर्ण रूप से बढ़ाता है, जो यह प्रकट करता है कि बहु-आयामी गुणवत्ता मेट्रिक्स का समान भार देना लक्षित दृष्टिकोणों की तुलना में बेहतर प्रदर्शन करता है और इष्टतम रिवॉर्ड फंक्शन डिज़ाइन विशिष्ट मॉडल आर्किटेक्चर पर अत्यधिक निर्भर है।

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev2026-07-08
💬 NLP

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

यह शोध पत्र Spider 2.0-AIFunc को प्रस्तुत करता है, जो 125 वास्तविक दुनिया के डेटाबेस में 465 सत्यापित इंस्टेंस का एक नया बेंचमार्क है जिसे स्नोफ्लेक (Snowflake) प्लेटफॉर्म पर AI-नेटिव SQL क्वेरी उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि शीर्ष प्रोप्रायटरी मॉडल 67-70% सटीकता प्राप्त करते हैं, पारंपरिक टेक्स्ट-टू-SQL कार्यों के लिए अनुकूलित वर्तमान एजेंट फ्रेमवर्क इस उभरते परिवेश में प्रभावी रूप से स्थानांतरित नहीं होते हैं।

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He2026-07-08
🤖 AI

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

यह शोध पत्र एक ऐसे मूल मेटा-आर्किटेक्चर में संज्ञानात्मक प्रोटोकॉल को समाहित करके विषम एआई पारिस्थितिक तंत्रों के विकास के लिए एक सैद्धांतिक रूपरेखा प्रस्तावित करता है जो सख्त शासन अपरिवर्तनीयताओं (governance invariants) को बनाए रखते हुए स्व-सुसंगत, पथ-आश्रित टोपोलॉजिकल विकास को संचालित करने के लिए संरचनात्मक तनाव, ऑफलाइन आवर्ती लूप और अनुमान-समय प्लास्टिसिटी का उपयोग करता है।

Heting Mao2026-07-08
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

रुबेंच (Rubench) एक रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग बेंचमार्क है जिसमें लाइव ओपन-सोर्स प्रोजेक्ट्स से मूल रूप से तैयार की गई 25 रूसी कार्य विशिष्टताएँ शामिल हैं, जिसे वास्तविक रखरखाव कार्यों पर उत्पाद-ग्रेड कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि डेटा संदूषण प्रतिरोध सुनिश्चित करना और कठोर सांख्यिकीय विश्लेषण एवं प्रक्षेपवक्र ऑडिटिंग के माध्यम से तैनात सिस्टम व्यवहारों में महत्वपूर्ण अंतर्दृष्टि को प्रकट करना भी इसका उद्देश्य है।

Evgeny Shilov (Independent Researcher)2026-07-08
🤖 AI

Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory

यह शोध पत्र डैनस (Danus) का परिचय देता है, जो एक ओपन-सोर्स ऑर्केस्ट्रेशन सिस्टम है जो कई समानांतर प्रूफ-सर्च एजेंटों और एक स्टेटलेस वेरीफायर को समन्वित करने के लिए एक साझा फैक्ट-ग्राफ मेमोरी का लाभ उठाता है, जिससे बीजगणितीय ज्यामिति (algebraic geometry) और कॉम्बिनेटरिक्स (combinatorics) जैसे क्षेत्रों की शोध-स्तरीय समस्याओं के लिए लंबी, जटिल गणितीय प्रमेयों के सफल निर्माण को सक्षम बनाया जा सके।

Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Z (…)2026-07-08
💬 NLP

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

यह शोध पत्र BioASQ 14b टास्क B के लिए एक प्रश्न-प्रकार-जागरूक (question-type-aware) लार्ज लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो प्रतिस्पर्धी प्रदर्शन प्राप्त करने और बैच 4 के फैक्टॉइड सबटास्क में प्रथम स्थान प्राप्त करने के लिए अनुकूलित इन्फरेंस रणनीतियों—जैसे कि हाँ/नहीं वाले प्रश्नों के लिए स्निपेट शफलिंग, फैक्टॉइड्स के लिए चेन-ऑफ-थॉट, और सूचियों के लिए मल्टी-एजेंट सहयोग—का उपयोग करता है।

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang2026-07-08
⚡ electrical engineering

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

यह शोधपत्र WordVoice प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो एक विशाल, पांच-आयामी रूप से एनोटेटेड डेटासेट और एक नवीन बाउंड-टोकन तंत्र का लाभ उठाकर LLM-आधारित TTS की कोर्स-ग्रेन्ड नियंत्रण सीमाओं को संबोधित करता है ताकि अवधि, पिच और ऊर्जा जैसे ध्वनिक गुणों के स्पष्ट, पृथक और सटीक शब्द-स्तरीय हेरफेर को सक्षम किया जा सके।

Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu2026-07-08