💻 computer science

Sequential Behavioral Watermarking for LLM Agents

यह शोध पत्र SeqWM को प्रस्तुत करता है, जो एक अनुक्रमिक व्यवहार संबंधी वॉटरमार्किंग फ्रेमवर्क है जो स्वामित्व संकेतों को इतिहास-सशर्त एजेंट ट्रांज़िशन पैटर्न में एम्बेड करता है ताकि एजेंट उपयोगिता को संरक्षित करते हुए मजबूत, स्थिति-अज्ञेय (position-agnostic) प्रक्षेपवक्र सत्यापन सक्षम किया जा सके, जो मौजूदा विधियों की भंगुरता पर विजय प्राप्त करता है जो कार्यों को स्वतंत्र परीक्षणों के रूप में मानती हैं।

Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han2026-05-13
💻 computer science

Read, Extract, Classify: A Tool for Smarter Requirements Engineering

यह शोध पत्र ReXCL को प्रस्तुत करता है, जो एक स्वचालित उपकरण है जो अर्ध-संरचित दस्तावेजों से डेटा निकालने और प्रेडिक्टिव मॉडलिंग एवं एडेप्टिव फाइन-ट्यूनिंग का उपयोग करके आवश्यकताओं को वर्गीकृत करके आवश्यकताओं के इंजीनियरिंग (requirements engineering) को बढ़ाता है, जिससे सॉफ्टवेयर विकास जीवन चक्र में दक्षता और सटीकता में महत्वपूर्ण सुधार होता है।

Paheli Bhattacharya, Manojit Chakraborty, Santhosh Kumar Arumugam, Rishabh Gupta2026-05-13
💻 computer science

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw

यह शोध पत्र डीपट्रैप (DeepTrap) को प्रस्तुत करता है, जो एक स्वचालित ढांचा है जो परिवर्तनीय निष्पादन संदर्भों (mutable execution contexts) के प्रतिकूल हेरफेर को अनुकूलित करके एजेंटिक एआई प्रणालियों में सुरक्षा संबंधी कमजोरियों की पहचान करता है, यह प्रदर्शित करते हुए कि ऐसे प्रासंगिक समझौते कार्य पूर्णता को बनाए रखते हुए असुरक्षित व्यवहार उत्पन्न कर सकते हैं और पारंपरिक केवल-प्रतिक्रिया मूल्यांकन की अपर्याप्तता को रेखांकित करते हैं।

Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang2026-05-13
🤖 machine learning

ASD-Bench: A Four-Axis Comprehensive Benchmark of AI Models for Autism Spectrum Disorder

यह शोध पत्र ASD-Bench प्रस्तुत करता है, जो तीन आयु समूहों के बीच 4,068 AQ-10 रिकॉर्ड्स के एक क्यूरेटेड डेटासेट पर विविध मशीन लर्निंग और फाउंडेशन मॉडल्स का मूल्यांकन करने वाला एक व्यापक चार-अक्षीय बेंचमार्क है, ताकि विशिष्ट आयु-विशिष्ट नैदानिक पैटर्न, एकल-मीट्रिक मूल्यांकन की सीमाओं, और ऑटोमेटेड ऑटिज्म स्पेक्ट्रम डिसऑर्डर स्क्रीनिंग में कोहॉर्ट-अनुकूलित परिनियोजन रणनीतियों की आवश्यकता को उजागर किया जा सके।

Shubhankit Singh, Hassan Shaikh, Kuldeep Raghuwanshi, Keshav Bulia2026-05-13
💻 computer science

Birds of a Feather Flock Together: Background-Invariant Representations via Linear Structure in VLMs

यह शोध पत्र एक प्री-ट्रेनिंग पद्धति प्रस्तुत करता है जो विजन-लैंग्वेज मॉडल एम्बेडिंग स्पेस के रैखिक योज्यता (linear additivity) गुण का लाभ उठाकर दृश्य निरूपणों को फोरग्राउंड और बैकग्राउंड घटकों में विभाजित करती है, जिससे बैकग्राउंड-इनवेरिएंट निरूपणों का निर्माण संभव होता है जो वास्तविक दुनिया के डिबायस्ड डेटा की आवश्यकता के बिना वॉटरबर्ड्स डेटासेट पर रिकॉर्ड-तोड़ वर्स्ट-ग्रुप सटीकता प्राप्त करते हैं।

Youssef Zaazou, Mark Thomas2026-05-13
🤖 AI

A Cascaded Generative Approach for e-Commerce Recommendations

यह शोध पत्र एक कैस्केडेड जनरेटिव फ्रेमवर्क पेश करता है जो वैयक्तिकरण और सिमेंटिक सामंजस्य को बढ़ाने के लिए कठोर ई-कॉमर्स स्टोरफ्रंट घटकों को डायनेमिक थीम और कीवर्ड जनरेशन से बदलता है, जो स्केलेबल टीचर-स्टूडेंट फाइन-ट्यूनिंग और पारंपरिक रैंकिंग मॉडल के साथ हाइब्रिड एकीकरण के माध्यम से कार्ट एड्स में 2.7% की वृद्धि प्राप्त करता है।

Moein Hasani, Hamidreza Shahidi, Trace Levinson, Yuan Zhong, Guanghua Shu, Vinesh Gudla, Tejaswi Tenneti2026-05-13
💬 NLP

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

यह शोध पत्र ClinicalBench को प्रस्तुत करता है, जो क्रॉस-एडमिशन क्लिनिकल QA में एसर्शन-अवेयर रिट्रीवल (assertion-aware retrieval) के लिए एक स्ट्रेस-टेस्टिंग फ्रेमवर्क और डेटासेट है, जो यह प्रदर्शित करता है कि एक इंटेंट-अवेयर नॉलेज ग्राफ रिट्रीवल सिस्टम कई LLMs पर डेंस बेसलाइन्स की तुलना में रिट्रीवल सटीकता में महत्वपूर्ण सुधार करता है और क्लिनिकल QA बेंचमार्क को मान्य करने के लिए चिकित्सक अधिनिर्णय (physician adjudication) की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Alex Stinard2026-05-13
🤖 AI

RankQ: Offline-to-Online Reinforcement Learning via Self-Supervised Action Ranking

RankQ एक ऑफलाइन-टू-ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो संरचित क्रिया वरीयताओं (structured action preferences) को सीखने के लिए समान निराशावाद (uniform pessimism) को एक स्व-पर्यवेक्षित बहु-पद रैंकिंग हानि (self-supervised multi-term ranking loss) से प्रतिस्थापित करके नमूना दक्षता और नीति प्रदर्शन में सुधार करती है, जो स्पार्स रिवॉर्ड बेंचमार्क पर उत्कृष्ट परिणाम और विजन-आधारित रोबोट लर्निंग में महत्वपूर्ण सिम-टू-रियल ट्रांसफर लाभ प्रदर्शित करती है।

Andrew Choi, Wei Xu2026-05-13
🔭 astrophysics

Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

यह शोध पत्र बड़े भाषा मॉडलों (Large Language Models) का उपयोग करते हुए एक सूचना-सैद्धांतिक ढांचे को प्रस्तुत करता है जो खगोलीय पद्धतियों की पुनर्निर्माण क्षमता (reconstructability) को परिमाणित करता है, यह प्रकट करते हुए कि यद्यपि पाठ्य विवरण एल्गोरिदम की संरचनाओं को स्पष्ट करते हैं, फिर भी वे लुप्त अंतर्निहित विशेषज्ञ ज्ञान के कारण कार्यान्वयन भिन्नता को समाप्त करने में विफल रहते हैं, जिससे पद्धतिगत पारदर्शिता के ऑडिटिंग के लिए एक नए नैदानिक उपकरण की स्थापना होती है।

Hsing Wen Lin, Zong-Fu Sie2026-05-13
🤖 machine learning

Interpretability Can Be Actionable

यह स्थिति पत्र तर्क देता है कि व्याख्यात्मकता (interpretability) के क्षेत्र को नए तरीकों को विकसित करने के बजाय "कार्रवाई योग्य" (actionable) मूल्यांकन मानदंड स्थापित करने की ओर स्थानांतरित होना चाहिए, जिन्हें स्पष्टता और सत्यापन द्वारा परिभाषित किया गया हो, ताकि यह सुनिश्चित किया जा सके कि अंतर्दृष्टि ठोस वास्तविक दुनिया के निर्णयों और हस्तक्षेपों की ओर ले जाए।

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegr (…)2026-05-13