🤖 AI

TDAD: Test-Driven Agentic Development - Reducing Code Regressions in AI Coding Agents via Graph-Based Impact Analysis

यह शोध पत्र TDAD को प्रस्तुत करता है, जो एक ओपन-सोर्स टूल है जो ग्राफ-आधारित प्रभाव विश्लेषण (graph-based impact analysis) का लाभ उठाकर AI कोडिंग एजेंटों को लक्षित परीक्षण संदर्भ (targeted test context) प्रदान करता है, जो बेसलाइन दृष्टिकोणों और प्रक्रियात्मक TDD निर्देशों दोनों की तुलना में कोड रिग्रेशन को काफी कम करता है और समस्या-समाधान दरों में सुधार करता है।

Pepe Alonso, Sergio Yovine, Victor A. Braberman2026-03-20
💬 NLP

BenchBrowser -- Collecting Evidence for Evaluating Benchmark Validity

लौकिक ब्राउज़र (Laukik Browser) एक रिट्रीवल टूल है जिसे अभ्यासकर्ताओं को उनके उपयोग के मामलों से संबंधित विशिष्ट परीक्षण मदों को सामने लाकर बेंचमार्क वैधता का मूल्यांकन करने में मदद करने के लिए डिज़ाइन किया गया है, जिससे संकीर्ण सामग्री कवरेज और अस्थिर रैंकिंग जैसी समस्याओं का निदान किया जा सके ताकि इच्छित लक्ष्यों और वास्तविक बेंचमार्क मापों के बीच के अंतर को पाटा जा सके।

Harshita Diddee, Gregory Yauney, Swabha Swayamdipta, Daphne Ippolito2026-03-20
💻 computer science

Circumventing Platform Defenses at Scale: Automated Content Replication from YouTube to Blockchain-Based Decentralized Storage

यह शोध पत्र YouTube-Synch प्रस्तुत करता है, जो एक उत्पादन प्रणाली है जो 3.5 वर्षों के अनुदैर्ध्य अध्ययन के दौरान युग्मित प्लेटफॉर्म सुरक्षा (coupled platform defenses), API बाधाओं और परिचालन विफलताओं को दूर करने के लिए तीन वास्तुशिल्प पीढ़ियों के माध्यम से विकसित होकर, निर्माता-अधिकृत YouTube सामग्री के विकेंद्रीकृत स्टोरेज पर विश्वसनीय, बड़े पैमाने पर स्वचालित प्रतिकृति (automated replication) को प्राप्त करता है।

Zeeshan Akram2026-03-20
💻 computer science

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

यह शोध पत्र SafeAudit प्रस्तुत करता है, जो एक मेटा-ऑडिट फ्रेमवर्क है जो टूल-कॉल वर्कफ़्लो को व्यवस्थित रूप से सूचीबद्ध करता है और नियम-प्रतिरोध (rule-resistance) को परिमाणित करता है ताकि मौजूदा LLM एजेंट सुरक्षा बेंचमार्क में महत्वपूर्ण पूर्णता अंतराल (completeness gaps) को उजागर किया जा सके, जिससे 20% से अधिक उन अवशिष्ट असुरक्षित व्यवहारों का पता चला है जिन्हें वर्तमान परीक्षण पकड़ने में विफल रहते हैं।

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang2026-03-20
🤖 machine learning

Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought

यह शोधपत्र VCoT-Lift प्रस्तुत करता है, जो एक ऐसा ढांचा है जो निम्न-स्तरीय सॉल्वर रीजनिंग को मानव-पठनीय वेरिफिकेशन चेन-ऑफ-थॉट (Verification Chain-of-Thought) चरणों में रूपांतरित करता है ताकि VCoT-Bench बनाया जा सके, जो एक व्यापक बेंचमार्क है और यह प्रकट करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स में कठोर रस्ट (Rust) प्रोग्राम वेरिफिकेशन के लिए ऑटोमेटेड थ्योरम प्रूवर्स जैसी सुदृढ़ रीजनिंग क्षमताओं का अभाव है।

Zichen Xie, Wenxi Wang2026-03-20
💻 computer science

TENSURE: Fuzzing Sparse Tensor Compilers (Registered Report)

यह शोध पत्र TENSURE को प्रस्तुत करता है, जो स्पार्स टेंसर कंपाइलर्स (Sparse Tensor Compilers) के लिए पहला ब्लैक-बॉक्स फज़िंग फ्रेमवर्क है जो आइंस्टीन समेशन नोटेशन (Einstein Summation notation) और एक नवीन बाधा-आधारित जनरेशन एल्गोरिदम का उपयोग करता है ताकि अर्थपूर्ण रूप से वैध टेस्ट केस तैयार किए जा सकें, जो प्रभावी रूप से TACO और Finch जैसे सिस्टमों में व्यापक शुद्धता संबंधी दोषों को उजागर करता है जिन्हें मौजूदा परीक्षण विधियाँ खोजने में विफल रहती हैं।

Kabilan Mahathevan, Yining Zhang, Muhammad Ali Gulzar, Kirshanthan Sundararajah2026-03-20
💻 computer science

Where are the Hidden Gems? Applying Transformer Models for Design Discussion Detection

यह शोध पत्र स्टैक ओवरफ्लो (Stack Overflow) पर फाइन-ट्यूनिंग करके और गिटहब (GitHub) आर्टिफैक्ट्स पर मूल्यांकन करके, सॉफ्टवेयर इंजीनियरिंग डोमेन में डिज़ाइन चर्चाओं का पता लगाने में BERT, RoBERTa, XLNet, LaMini-Flan-T5-77M और ChatGPT-4o-mini सहित विभिन्न ट्रांसफॉर्मर-आधारित मॉडलों की प्रभावशीलता की जांच करता है, जो यह प्रकट करता है कि जबकि ChatGPT-4o-mini उच्चतम रिकॉल (recall) प्राप्त करता है, विभिन्न मॉडल पारंपरिक तरीकों की तुलना में प्रिसिजन (precision) और रिकॉल के बीच विशिष्ट ट्रेड-ऑफ (trade-offs) प्रदान करते हैं।

Lawrence Arkoh, Daniel Feitosa, Wesley K. G. Assunção2026-03-20
💻 computer science

CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer

यह शोध पत्र क्रॉस-मॉडल न्यूरॉन ट्रांसफर (CNT) प्रस्तुत करता है, जो एक पोस्ट-हॉक विधि है जो डोनर मॉडल्स से न्यूरॉन्स के एक न्यूनतम उपसमूह को स्थानांतरित करके बड़े भाषा मॉडल्स को विकसित होते सुरक्षा संबंधी आवश्यकताओं के अनुकूल कुशलतापूर्वक बनाती है, जिससे न्यूनतम प्रदर्शन ह्रास के साथ लक्षित कार्यात्मकता पुन: उपयोग प्राप्त किया जा सके।

Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang2026-03-20
💻 computer science

SQL-Commenter: Aligning Large Language Models for SQL Comment Generation with Direct Preference Optimization

जटिल SQL सिंटैक्स और स्वचालित कमेंट जनरेशन में अपर्याप्त LLM समझ की चुनौतियों को संबोधित करने के लिए, लेखक SQL-Commenter का प्रस्ताव करते हैं, जो LLaMA-3.1-8B पर आधारित एक विधि है जो सटीक और स्वाभाविक SQL कमेंट्स उत्पन्न करने में अत्याधुनिक बेसलाइन्स से काफी बेहतर प्रदर्शन करने के लिए निरंतर प्री-ट्रेनिंग, सुपरवाइज्ड फाइन-ट्यूनिंग और मानव फीडबैक के साथ डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन (DPO) को जोड़ती है।

Lei Yu, Peng Wang, Jingyuan Zhang, Xin Wang, Jia Xu, Li Yang, Changzhi Deng, Jiajia Ma, Fengjun Zhang2026-03-20
💻 computer science

Green Architectural Tactics in ML-enabled Systems: An LLM-based Repository Mining Study

यह अध्ययन ज्ञात ग्रीन एआई (green AI) युक्तियों के वास्तविक दुनिया में अपनाव को मान्य करने और मशीन लर्निंग सिस्टम के पर्यावरणीय प्रभाव को कम करने के लिए नौ पूर्व में अज्ञात टिकाऊ प्रथाओं की खोज करने हेतु 205 गिटहब (GitHub) रिपॉजिटरी पर एक एलएलएम (LLM)-आधारित माइनिंग दृष्टिकोण का उपयोग करता है।

Vincenzo De Martino, Silverio Martínez-Fernández, Fabio Palomba2026-03-20