💻 computer science

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

यह शोध पत्र SAFEdit प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो निर्देशित कोड संपादन को प्लानिंग, लिटरल मॉडिफिकेशन और वेरिफिकेशन भूमिकाओं में विभाजित करता है जिसे एक फेलियर एब्स्ट्रैक्शन लेयर द्वारा उन्नत किया गया है, जिससे EditBench बेंचमार्क पर 68.6% टास्क सक्सेस रेट प्राप्त होता है और यह सिंगल-मॉडल और ReAct सिंगल-एजेंट बेसलाइन्स दोनों से काफी बेहतर प्रदर्शन करता है।

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani2026-04-29
💻 computer science

Can Code Evaluation Metrics Detect Code Plagiarism?

यह शोध पत्र अनुभवजन्य रूप से प्रदर्शित करता है कि कोड मूल्यांकन मेट्रिक्स, विशेष रूप से क्रिस्टलब्लू (CrystalBLEU), विभिन्न संशोधन स्तरों में सोर्स कोड प्लेजरिज्म (साहित्यिक चोरी) का प्रभावी ढंग से पता लगा सकते हैं और अक्सर प्रीप्रोसेसिंग लागू होने पर डोलोस (Dolos) और जेप्लैग (JPlag) जैसे समर्पित प्लेजरिज्म डिटेक्शन टूल्स से बेहतर या उनके बराबर प्रदर्शन करते हैं।

Fahad Ebrahim (The University of Warwick), Mike Joy (The University of Warwick)2026-04-29
🤖 machine learning

Sustained Gradient Alignment Mediates Subliminal Learning in a Multi-Step Setting: Evidence from MNIST Auxiliary Logit Distillation Experiment

यह शोध पत्र यह प्रदर्शित करता है कि निरंतर, दुर्बल रूप से सकारात्मक ग्रेडिएंट संरेखण (gradient alignment), मल्टी-स्टेप MNIST ऑक्जिलरी लॉजिट डिस्टिलेशन में अवचेतन अधिगम (subliminal learning) को मध्यस्थता प्रदान करता है, जो यह प्रकट करता है कि लिमिनल ट्रेनिंग (liminal training) जैसी शमन रणनीतियाँ अनपेक्षित लक्षण प्राप्ति को दबाने में विफल हो सकती हैं जब प्रथम-क्रम के ग्रेडिएंट चालक (first-order gradient drives) प्रभावी होते हैं।

Chayanon Kitkana, Shivam Arora2026-04-29
💻 computer science

At the Edge of the Heart: ULP FPGA-Based CNN for On-Device Cardiac Feature Extraction in Smart Health Sensors for Astronauts

यह शोध पत्र एक अल्ट्रा-लो-पावर FPGA-आधारित समाधान प्रस्तुत करता है जो एक क्वांटाइज्ड CNN का उपयोग करके रियल-टाइम सीस्मोंकार्डियोग्राफी फीचर क्लासिफिकेशन में 98% सटीकता प्राप्त करता है, जो संसाधन-सीमित अंतरिक्ष मिशनों पर अंतरिक्ष यात्रियों के लिए ऊर्जा-कुशल, स्वायत्त हृदय निगरानी को सक्षम बनाता है।

Kazi Mohammad Abidur Rahman, Davis Rakhshan, Philipp Lütke, Laura Harms, Ulf Kulau2026-04-29
💻 computer science

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

यह शोध पत्र TrialCalibre प्रस्तुत करता है, जो एक पूर्णतः स्वचालित मल्टी-एजेंट सिस्टम है जिसे रैंडमाइज्ड कंट्रोल्ड ट्रायल्स के विरुद्ध ऑब्जर्वेशनल रियल-वर्ल्ड एविडेंस अध्ययनों के बेंचमार्किंग और कैलिब्रेशन के लिए संसाधन-गहन BenchExCal फ्रेमवर्क को स्केल और सुव्यवस्थित करने के लिए डिज़ाइन किया गया है ताकि कॉज़ल इफ़ेक्ट एस्टीमेशन (कारण प्रभाव अनुमान) में सुधार किया जा सके।

Amir Habibdoust, Xing Song2026-04-29
💻 computer science

Action-Aware Generative Sequence Modeling for Short Video Recommendation

यह शोध पत्र एक्शन-अवेयर जेनेरेटिव सीक्वेंस नेटवर्क (A2Gen) का प्रस्ताव करता है, जो एक नवीन मॉडल है जो शॉर्ट वीडियो अनुशंसा में पारंपरिक बाइनरी क्लासिफिकेशन की सीमाओं को दूर करने के लिए उपयोगकर्ता क्रियाओं के टेम्पोरल पैटर्न का लाभ उठाता है, और कुआईशौ (Kuaishou) पर व्यापक ऑफलाइन और बड़े पैमाने पर ऑनलाइन ए/बी टेस्टिंग के माध्यम से वॉच टाइम, इंटरेक्शन रेट और यूजर रिटेंशन में महत्वपूर्ण सुधार प्राप्त करता है।

Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li2026-04-29
💬 NLP

PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators

यह शोध पत्र PSI-Bench प्रस्तुत करता है, जो एक नैदानिक रूप से आधारित और व्याख्या योग्य स्वचालित मूल्यांकन ढांचा है जो वर्तमान अवसाद रोगी सिम्युलेटरों की महत्वपूर्ण सीमाओं—जैसे कि कम व्यवहार संबंधी विविधता और अत्यधिक समान भावनात्मक प्रक्षेपवक्र—को उजागर करता है, साथ ही विशेषज्ञ मानव निर्णयों के साथ मजबूत संरेखण प्रदर्शित करता है।

Nguyen Khoi Hoang, Shuhaib Mehri, Tse-An Hsu, Yi-Jyun Sun, Quynh Xuan Nguyen Truong, Khoa D Doan, Dilek Hakkani-Tür2026-04-29
💬 NLP

G-Loss: Graph-Guided Fine-Tuning of Language Models

यह शोधपत्र G-Loss प्रस्तुत करता है, जो एक ग्राफ-निर्देशित लॉस फंक्शन है जो वैश्विक अर्थ संबंधी संरचनाओं (global semantic structures) को पकड़ने के लिए दस्तावेज़-समानता ग्राफ पर अर्ध-पर्यवेक्षित लेबल प्रसार (semi-supervised label propagation) का लाभ उठाता है, जिससे भाषा मॉडल अधिक विभेदक एम्बेडिंग (discriminative embeddings) सीखने में सक्षम होते हैं और पारंपरिक फाइन-ट्यूनिंग विधियों की तुलना में बेहतर वर्गीकरण सटीकता प्राप्त करते हैं।

Sharma Aditya, Agarwal Vinti, Kumar Rajesh2026-04-29
🤖 machine learning

Investigation into In-Context Learning Capabilities of Transformers

यह शोध पत्र गॉसियन-मिश्रण बाइनरी वर्गीकरण (Gaussian-mixture binary classification) के लिए ट्रांसफॉर्मर में इन-कॉन्टेक्स्ट लर्निंग का एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह पहचानता है कि इनपुट आयामीता (dimensionality), इन-कॉन्टेक्स्ट उदाहरणों की संख्या, और प्री-ट्रेनिंग कार्य की विविधता किस प्रकार सफलता दरों और बेनाइन ओवरफिटिंग (benign overfitting) के उद्भव को नियंत्रित करती है।

Rushil Chandrupatla, Leo Bangayan, Sebastian Leng, Arya Mazumdar2026-04-29
💻 computer science

RESTestBench: A Benchmark for Evaluating the Effectiveness of LLM-Generated REST API Test Cases from NL Requirements

यह शोधपत्र RESTestBench प्रस्तुत करता है, जो एक नया बेंचमार्क है जिसमें सटीक और अस्पष्ट प्राकृतिक भाषा संबंधी आवश्यकताओं वाले REST सेवाएँ शामिल हैं ताकि एक नए आवश्यकता-आधारित उत्परिवर्तन मीट्रिक (mutation metric) का उपयोग करके LLM-जनित परीक्षण मामलों का मूल्यांकन किया जा सके, जो यह प्रकट करता है कि दोषपूर्ण सिस्टम कार्यान्वयन द्वारा निर्देशित परिशोधन (refinement), विशेष रूप से अस्पष्ट आवश्यकताओं के लिए, परीक्षण प्रभावशीलता को महत्वपूर्ण रूप से कम कर सकता है।

Leon Kogler, Stefan Hangler, Maximilian Ehrhart, Benedikt Dornauer, Roland Wuersching, Peter Schrammel2026-04-29