🤖 machine learning

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

यह शोध पत्र LifeSkill का प्रस्ताव करता है, जो एक दो-चरणीय सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ऑनलाइन आजीवन सीखने वाले एजेंटों को सत्यापनकर्ता-निर्देशित कौशल निष्कर्षण (verifier-guided skill extraction) और ऑनलाइन कौशल आंतरिककरण (online skill internalization) के माध्यम से परीक्षण-समय फीडबैक को निरंतर अपने मापदंडों में आत्मसात करने में सक्षम बनाता है, जिससे स्थिर पुनर्प्राप्ति-आधारित दृष्टिकोणों की सीमाओं को दूर किया जा सके और दीर्घ-क्षित कार्यों (long-horizon tasks) पर प्रदर्शन में महत्वपूर्ण सुधार किया जा सके।

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He2026-06-04
🤖 machine learning

Uncertainty-Aware End-to-End Co-Design of Neural Network Processors: From Training and Mapping to Fabrication

यह शोध पत्र एक एकीकृत, अनिश्चितता-जागरूक सह-डिज़ाइन ढांचे को प्रस्तुत करता है जो न्यूरल नेटवर्क प्रशिक्षण, हार्डवेयर मैपिंग और फैब्रिकेशन को इंटरऑपरेबल ब्लॉक्स में एकीकृत करता है, जिसमें "कॉन्फिडेंस" (विश्वास) को एक स्पष्ट अनुकूलन योग्य संसाधन के रूप में पेश किया गया है ताकि मॉड्यूलर सुधारों को सक्षम किया जा सके और संपूर्ण डिज़ाइन पाइपलाइन में स्वचालित रूप से वैश्विक पारेटो-इष्टतम समाधानों को प्रसारित किया जा सके।

Yuyang Du, Yujun Huang, Gioele Zardini2026-06-04
🤖 AI

AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

यह शोध पत्र AICompanionBench प्रस्तुत करता है, जो 2,123 एनोटेटेड मानव-AI साथी (human-AI companion) बातचीत का पहला सार्वजनिक रूप से उपलब्ध बेंचमार्क डेटासेट है, और इसका उपयोग 20 अत्याधुनिक LLMs को जज के रूप में मूल्यांकन करने के लिए करता है, जिससे यह पता चलता है कि जबकि मॉडल स्पष्ट नुकसान का प्रभावी ढंग से पता लगाते हैं, वे हेरफेर (manipulation) और फॉल्स पॉजिटिव जैसे सूक्ष्म जोखिमों के साथ संघर्ष करते हैं।

Yanjing Ren, Reza Ebrahimi, TengTeng Ma2026-06-04
🤖 AI

DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance

यह शोधपत्र DiverAge का प्रस्ताव करता है, जो डिफ्यूजन ऑटोएनकोडिंग पर आधारित एक पदानुक्रमित बहुलवादी (hierarchical pluralistic) फेस एजिंग फ्रेमवर्क है, जो एक नवीन क्रॉस-एज आइडेंटिटी रिलेशन रेगुलेटर (CARR) का उपयोग करता है ताकि बिना किसी अतिरिक्त प्रशिक्षण मापदंडों के उपस्थिति-स्तर की विविधता और अनुक्रम-स्तर की क्रमिक विश्वसनीयता को एक साथ सुनिश्चित किया जा सके।

Yueying Zou, Peipei Li, Qianrui Teng, Dianyan Xu, Zekun Li2026-06-04
🤖 AI

Provably Auditable and Safe LLM Agents from Human-Authored Ontologies

यह शोध पत्र एजेंटिक रेडक्स (Agentic Redux) को प्रस्तुत करता है, जो टाइपड लैम्ब्डा कैलकुलस (typed lambda calculus) और मानव-लिखित ऑन्टोलॉजी पर आधारित एक प्रमाणित रूप से सही और ऑडिट योग्य एलएलएम (LLM) एजेंट आर्किटेक्चर है, जो स्वास्थ्य देखभाल बिलिंग अनुपालन और सुरक्षा भेद्यता प्रकटीकरण में इसके अनुप्रयोग को प्रदर्शित करता है।

Aaron Sterling2026-06-04
💬 NLP

'Your AI Text is not Mine': Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions

यह शोध पत्र हानिकारक एआई टेक्स्ट उपयोग पर आम सहमति की कमी को संबोधित करने के लिए AITDNA को पेश करता है, जो विस्तृत इंटरैक्शन इतिहास के साथ मानव-मशीन सह-निर्मित टेक्स्ट का एक नया बेंचमार्क है, ताकि यह प्रदर्शित किया जा सके कि वर्तमान डिटेक्टर अक्सर व्यापक समाधान के रूप में विफल हो जाते हैं और केवल एआई-जनित सामग्री की विशिष्ट परिभाषाओं के लिए ही अच्छा प्रदर्शन करते हैं।

Nils Dycke, Marina Sakharova, Nico Daheim, Iryna Gurevych2026-06-04
📊 statistics

AdaKoop: Efficient Modeling of Nonlinear Dynamics from Nonstationary Data Streams with Koopman Operator Regression

AdaKoop एक कुशल स्ट्रीमिंग एल्गोरिदम है जो गैर-स्थिर डेटा स्ट्रीम्स में गैर-रेखीय गतिकी (nonlinear dynamics) को अनुकूल रूप से मॉडल करने और पूर्वानुमान लगाने के लिए एक संभाव्य ढांचे के भीतर कूपमैन ऑपरेटर सिद्धांत (Koopman operator theory) का लाभ उठाता है, जिससे यह अत्याधुनिक तरीकों की तुलना में बेहतर सटीकता और कम्प्यूटेशनल दक्षता प्राप्त करता है।

Naoki Chihara, Ren Fujiwara, Yasuko Matsubara, Yasushi Sakurai2026-06-04
🤖 AI

From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents

यह शोध पत्र छह उभरते हुए एआई सॉफ्टवेयर विकास ढांचों का तुलनात्मक रूप से आकलन करने के लिए एक छह-आयामी प्रक्रिया वर्गीकरण और स्कोरिंग रूब्रिक प्रस्तुत करता है, जो निरंतर आर्टिफैक्ट्स और मानव समीक्षा की ओर अभिसरण को प्रकट करते हुए प्रक्रिया की गहराई और पोर्टेबिलिटी के बीच एक संरचनात्मक समझौते के साथ-साथ स्पेसिफिकेशन ड्रिफ्ट और प्लेटफॉर्म निर्भरता जैसे महत्वपूर्ण जोखिमों को उजागर करता है।

Sanderson Oliveira de Macedo2026-06-04
💬 NLP

DeliChess: A Multi-party Dialogue Dataset for Deliberation in Chess Puzzle Solving

यह शोध पत्र DeliChess को प्रस्तुत करता है, जो बहु-पक्षीय संवादों का एक नवीन डेटासेट है जहाँ प्रतिभागी सहयोगात्मक रूप से शतरंज की पहेलियों को हल करते हैं, जो यह प्रदर्शित करता है कि समूह विचार-विमर्श सामूहिक सटीकता में महत्वपूर्ण सुधार करता है और जटिल तर्क एवं संवाद गतिशीलता के अध्ययन के लिए एक समृद्ध परीक्षण स्थल प्रदान करता है।

Xiaochen Zhu, Georgi Karadzhov, Tom Stafford, Andreas Vlachos2026-06-04
🤖 AI

SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models

यह शोधपत्र SharedRequest का प्रस्ताव करता है, जो एक मॉडल-अज्ञेय (model-agnostic) ढांचा है जो अर्थपूर्ण रूप से समान प्रश्नों के मिश्रण और बैचिंग के माध्यम से संवेदनशील प्रॉम्प्ट्स को अस्पष्ट करके गोपनीयता-संरक्षण वाले LLM इन्फरेंस को बढ़ाता है, जिससे बिना किसी मॉडल संशोधन के बेहतर उपयोगिता और 5 गुना तक लागत में कमी प्राप्त होती है।

Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang2026-06-04