🧬 biology

Agentic AI-assisted coding offers a unique opportunity to instill epistemic grounding during software development

यह शोध पत्र "GROUNDED.md" का प्रस्ताव करता है, जो एक समुदाय-शासित दस्तावेज़ है जो गैर-परक्राम्य वैज्ञानिक बाधाओं और परंपराओं को कूटबद्ध करता है ताकि यह सुनिश्चित किया जा सके कि एजेंटिक AI-सहायता प्राप्त कोडिंग वैध, सर्वोत्तम-अभ्यास वाला सॉफ़्टवेयर उत्पन्न करे, भले ही इसका उपयोग गैर-डोमेन विशेषज्ञों द्वारा किया गया हो।

Magnus Palmblad, Jared M. Ragland, Benjamin A. Neely2026-04-24
💻 computer science

Less Is More: Measuring How LLM Involvement affects Chatbot Accuracy in Static Analysis

यह शोध पत्र यह प्रदर्शित करता है कि स्टैटिक एनालिसिस (static analysis) में, प्राकृतिक भाषा को क्वेरी कोड में अनुवादित करने के लिए स्कीमा-प्रतिबंधित (schema-constrained) JSON मध्यवर्ती प्रतिनिधित्व का उपयोग करना, सीधे जनरेशन और टूल-संवर्धित एजेंटिक दृष्टिकोणों दोनों की तुलना में काफी बेहतर प्रदर्शन करता है, विशेष रूप से बड़े भाषा मॉडलों के लिए, क्योंकि यह बढ़े हुए टोकन उपभोग के बजाय संरचित बाधाओं को प्राथमिकता देता है।

Krishna Narasimhan2026-04-24
🤖 machine learning

PrismaDV: Automated Task-Aware Data Unit Test Generation

PrismaDV एक कंपाउंड AI सिस्टम है जो डाउनस्ट्रीम कोड और डेटासेट प्रोफाइल्स का विश्लेषण करके टास्क-अवेयर एक्जीक्यूटेबल डेटा यूनिट टेस्ट जेनरेट करता है, जिसे SIFTA नामक एक प्रॉम्प्ट-ऑप्टिमाइज़ेशन फ्रेमवर्क द्वारा और अधिक उन्नत बनाया गया है जो विशिष्ट डेटासेट्स और टास्क के अनुकूल होता है, और अंततः एंड-टू-एंड डेटा विश्वसनीयता को मान्य करने में मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

Hao Chen, Arnab Phani, Sebastian Schelter2026-04-24
💬 NLP

MathDuels: Evaluating LLMs as Problem Posers and Solvers

यह शोध पत्र MathDuels का परिचय देता है, जो एक गतिशील स्व-खेल (self-play) बेंचमार्क है जहाँ अत्याधुनिक भाषा मॉडल (frontier language models) एक साथ प्रतिपक्षी समस्या लेखक और समाधानकर्ता के रूप में कार्य करते हैं, जो पृथक क्षमताओं को प्रकट करने और एक सह-विकसित कठिनाई वक्र (co-evolving difficulty curve) के माध्यम से मूल्यांकन संतृप्ति (evaluation saturation) को रोकने के लिए राश (Rasch) मॉडल का उपयोग करते हैं।

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik2026-04-24
💻 computer science

CrossCommitVuln-Bench: A Dataset of Multi-Commit Python Vulnerabilities Invisible to Per-Commit Static Analysis

यह शोध पत्र CrossCommitVuln-Bench प्रस्तुत करता है, जो 15 वास्तविक-विश्व पायथन कमजोरियों का एक डेटासेट है जो प्रति-कमिट (per-commit) स्टैटिक एनालिसिस से बच निकलती हैं क्योंकि उनकी शोषण योग्य स्थितियाँ कई बेनाइन कमिट्स में फैली होती हैं, जिससे यह पता चलता है कि वर्तमान SAST टूल्स पूरे कोडबेस का विश्लेषण करने के बाद भी ऐसे 87% क्रॉस-कमिट कमजोरियों को मिस कर देते हैं।

Arunabh Majumdar2026-04-24
💻 computer science

SweRank: Software Issue Localization with Code Ranking

यह शोध पत्र SweRank को प्रस्तुत करता है, जो सॉफ़्टवेयर इश्यू लोकलाइजेशन के लिए एक कुशल रिट्रीव-एंड-रीरैंक फ्रेमवर्क है, जो बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए नव-निर्मित SweLoc डेटासेट का लाभ उठाता है और साथ ही क्लोज्ड-सोर्स LLM एजेंट-आधारित दृष्टिकोणों की लागत और विलंबता (लेटेंसी) को भी पीछे छोड़ देता है।

Revanth Gangi Reddy, Tarun Suresh, JaeHyeok Doo, Ye Liu, Xuan Phi Nguyen, Yingbo Zhou, Semih Yavuz, Caiming Xiong, Heng (…)2026-04-23
💻 computer science

Quo Vadis, Code Review? Exploring the Future of Code Review

यह अध्ययन अगले पांच वर्षों में कोड समीक्षा के भविष्य के संबंध में पेशेवर डेवलपर्स की अपेक्षाओं की जांच करता है, जो यह प्रकट करता है कि जहाँ अभ्यासकर्ता व्यापक आर्टिफ़ेक्ट्स (artifacts) के साथ स्थिर या बढ़ी हुई भागीदारी का अनुमान लगाते हैं, वहीं वे एआई (AI) और एलएलएम (LLMs) द्वारा संचालित महत्वपूर्ण स्वचालन की भी भविष्यवाणी करते हैं जो समझ, जवाबदेही और विश्वास के इर्द-गिर्द उभरते तनावों को पेश करता है।

Michael Dorner, Andreas Bauer, Darja Šmite, Lukas Thode, Daniel Mendez, Ricardo Britto, Stephan Lukasczyk, Ehsan Zabarda (…)2026-04-23
💻 computer science

The OpenHands Software Agent SDK: A Composable and Extensible Foundation for Production Agents

यह शोध पत्र OpenHands सॉफ्टवेयर एजेंट SDK प्रस्तुत करता है, जो एक पुनर्गठित टूलकिट है जो लचीले कार्यान्वयन, सुरक्षित सैंडबॉक्स्ड निष्पादन और विविध मानव संपर्क इंटरफेस को एकीकृत करके उत्पादन-तैयार सॉफ्टवेयर विकास एजेंटों के निर्माण के लिए एक संयोजनीय और विस्तार योग्य आधार प्रदान करता है।

Xingyao Wang, Simon Rosenberg, Juan Michelini, Calvin Smith, Hoang Tran, Engel Nyst, Rohit Malhotra, Xuhui Zhou, Valerie (…)2026-04-23
🤖 AI

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

यह शोध पत्र PlotlyChain को प्रस्तुत करता है, जो एक नियतात्मक (deterministic), जनरेटर-आधारित बेंचमार्क है जिसमें सटीक ग्राउंड ट्रुथ और इंटरमीडिएट चेकपॉइंट्स के साथ 450 इंजीनियरिंग प्लॉट्स शामिल हैं, जो यह प्रकट करता है कि जहाँ शीर्ष मल्टीमॉडल LLMs मानक प्लॉट्स को पढ़ने में लगभग 80% सटीकता प्राप्त करते हैं, वहीं वे FFT और बैंडपास रिस्पॉन्स जैसे फ्रीक्वेंसी-डोमेन कार्यों के साथ काफी संघर्ष करते हैं।

Mayank Ravishankara2026-04-23
🤖 AI

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

यह शोध पत्र CircuChain पेश करता है, जो इलेक्ट्रिकल सर्किट विश्लेषण के लिए एक नैदानिक बेंचमार्क है जो एक "अनुपालन-क्षमता विचलन" (Compliance-Competence Divergence) को प्रकट करता है जहाँ उन्नत LLMs अक्सर स्पष्ट उपयोगकर्ता बाधाओं के बजाय प्राकृतिक प्रशिक्षण पूर्वग्रहों (training priors) को प्राथमिकता देते हैं, यह प्रदर्शित करते हुए कि बढ़ी हुई मॉडल क्षमता गणितीय रूप से कठोर डोमेन में बेहतर निर्देश पालन की गारंटी नहीं देती है।

Mayank Ravishankara2026-04-23