💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

यह शोधपत्र ClassEval-Pro को प्रस्तुत करता है, जो एक LLM एन्सेम्बल और उच्च-कवरेज टेस्ट सूट्स द्वारा सत्यापित 300 क्लास-लेवल कोड जनरेशन कार्यों का एक कठोर, क्रॉस-डोमेन बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान फ्रंटियर LLMs लॉजिक और डिपेंडेंसी त्रुटियों के कारण कंपोजिशनल कोड क्रिएशन में संघर्ष करते हैं, और केवल 45.6% का सर्वश्रेष्ठ Pass@1 प्राप्त करते हैं।

Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu2026-04-30
🤖 machine learning

Reinforcement Learning for Testing Interdependent Requirements in Autonomous Vehicles: An Empirical Study

यह अनुभवजन्य अध्ययन स्वायत्त वाहनों में परस्पर निर्भर आवश्यकताओं के परीक्षण के लिए सिंगल-ऑब्जेक्टिव और मल्टी-ऑब्जेक्टिव सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) की तुलना करता है, जिसमें यह पाया गया है कि जबकि दोनों दृष्टिकोण तुलनीय प्रभावशीलता प्रदर्शित करते हैं, मल्टी-ऑब्जेक्टिव आरएल (RL) बेहतर परिदृश्य विविधता और कवरेज प्रदान करता है जबकि सिंगल-ऑब्जेक्टिव आरएल (RL) उच्च-गंभीरता वाले उल्लंघन उत्पन्न करने की ओर प्रवृत्त होता है।

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali2026-04-29
💻 computer science

FRIENDS GUI: A graphical user interface for data collection and visualization of vaping behavior from a passive vaping monitor

यह शोध पत्र FRIENDS GUI को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन-आधारित ग्राफिकल इंटरफेस है जो अनुसंधान और नियामक उद्देश्यों के लिए इलेक्ट्रॉनिक निकोटीन डिलीवरी सिस्टम के उपयोग की सुलभता और व्याख्या को बढ़ाने हेतु FRIENDS पैसिव वेपिंग मॉनिटर से 24-घंटे के पफिंग टोपोग्राफी डेटा को निकालता है, डिकोड करता है और विज़ुअलाइज़ करता है।

Shehan Irteza Pranto, Brett Fassler, Md Rafi Islam, Ashley Schenkel, Larry W. Hawk, Edward Sazonov2026-04-29
💬 NLP

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

यह शोध पत्र TimeMachine-bench प्रस्तुत करता है, जो वास्तविक दुनिया के रिपॉजिटरी-स्तरीय सॉफ्टवेयर माइग्रेशन कार्यों पर LLMs का मूल्यांकन करने के लिए एक स्वचालित और लाइव-अपडेट होने वाला बेंचमार्क है, जो यह प्रकट करता है कि हालांकि मॉडल आशाजनक दिखते हैं, वे वर्तमान में स्प्यूरियस (spurious) समाधानों और उप-इष्टतम टूल उपयोग जैसी विश्वसनीयता संबंधी समस्याओं के साथ संघर्ष करते हैं।

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki2026-04-29
💬 NLP

CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि सोर्स कोड को छवियों के रूप में निरूपित करने से विजन लैंग्वेज मॉडल्स (Vision Language Models) विभिन्न कोड समझ संबंधी कार्यों पर प्रदर्शन को बनाए रखते हुए या यहाँ तक कि सुधारते हुए उच्च संपीड़न अनुपातों (compression ratios) के माध्यम से महत्वपूर्ण कम्प्यूटेशनल दक्षता प्राप्त करने में सक्षम होते हैं।

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, X (…)2026-04-29
🤖 machine learning

Pimp My LLM: Leveraging Variability Modeling to Tune Inference Hyperparameters

यह शोध पत्र लार्ज लैंग्वेज मॉडल (LLM) इन्फरेंस के विशाल कॉन्फ़िगरेशन स्पेस को व्यवस्थित रूप से प्रबंधित और अनुकूलित करने के लिए वेरिएबिलिटी मॉडलिंग तकनीकों का लाभ उठाने का प्रस्ताव करता है, जिससे सीमित अनुभवजन्य मापों के साथ हाइपरपैरामीटर ट्रेड-ऑफ का कुशल विश्लेषण और ऊर्जा खपत एवं लेटेंसी जैसे प्रदर्शन मेट्रिक्स की भविष्यवाणी सक्षम होती है।

Nada Zine, Clément Quinton, Romain Rouvoy2026-04-29
💻 computer science

A systematic literature Review for Transformer-based Software Vulnerability detection

यह व्यवस्थित साहित्य समीक्षा (सिस्टमैटिक लिटरेचर रिव्यू) सॉफ्टवेयर भेद्यता का पता लगाने में ट्रांसफार्मर-आधारित मॉडलों के अनुप्रयोग का मूल्यांकन करने, आर्किटेक्चर को वर्गीकृत करने, विभिन्न संदर्भों में प्रदर्शन का आकलन करने और भविष्य के अनुसंधान को निर्देशित करने के लिए डेटा असंतुलन और व्याख्यात्मकता जैसी प्रमुख चुनौतियों की पहचान करने हेतु 2021 से 2025 तक के 80 अध्येशनों का आलोचनात्मक विश्लेषण करती है।

Fiza Naseer, Javed Ali Khan, Muhammad Yaqoob, Alexios Mylonas, Ishaya Gambo2026-04-29
💬 NLP

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

यह शोधपत्र बेंचगार्ड (BenchGuard) को प्रस्तुत करता है, जो एक स्वचालित ऑडिटिंग फ्रेमवर्क है जो टास्क-ओरिएंटेड एजेंट बेंचमार्क में दोषों को व्यवस्थित रूप से पहचानने और उन्हें मान्य करने के लिए फ्रंटियर एलएलएम (LLM) का लाभ उठाता है, जो कम लागत पर मानवीय समीक्षा द्वारा छूट जाने वाली महत्वपूर्ण त्रुटियों का पता लगाने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi2026-04-29
💬 NLP

Dont Stop Early: Scalable Enterprise Deep Research with Controlled Information Flow and Evidence-Aware Termination

यह शोध पत्र एक स्केलेबल एंटरप्राइज डीप रिसर्च (EDR) आर्किटेक्चर प्रस्तावित करता है जो असमान कवरेज और समयपूर्व रुकने की समस्याओं को दूर करने के लिए रिफ्लेक्शन के साथ आउटलाइन जनरेशन, डिपेंडेंसी-गाइडेड कॉन्टेक्स्ट लोकलाइजेशन और एविडेंस-बेस्ड टर्मिनेशन क्राइटेरिया का उपयोग करता है, जो आंतरिक सेल्स इनेबलमेंट कार्यों और सार्वजनिक बेंचमार्क दोनों पर बेहतर प्रदर्शन प्रदर्शित करता है।

Prafulla Kumar Choubey, Kung-Hsiang Huang, Pranav Narayanan Venkit, Jiaxin Zhang, Vaibhav Vats, Yu Li, Xiangyu Peng, Chi (…)2026-04-29
💻 computer science

What If We Work Together? Fostering Reflections on Designer Inclusion in Open Source Software Through Speculative Design

यह शोधपत्र दो काल्पनिक समाजों के माध्यम से स्पेक्युलेटिव डिज़ाइन (speculative design) का उपयोग करता है ताकि ओपन सोर्स सॉफ़्टवेयर अभ्यासकर्ताओं के बीच आलोचनात्मक चिंतन को प्रेरित किया जा सके, जिसका उद्देश्य समुदाय की डेवलपर-केंद्रित मानसिकता को संबोधित करना और डिजाइनरों के लिए एक अधिक समावेशी वातावरण को बढ़ावा देना है।

Rozhan Hozhabri Nezhad, Jin L. C. Guo, Jinghui Cheng2026-04-29