🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

यह शोध पत्र SciCodePile पेश करता है, जो एक विशाल 128GB का वैज्ञानिक कोड कॉर्पस और 200 कार्यों का एक निष्पादन योग्य बेंचमार्क है, यह प्रदर्शित करने के लिए कि वर्तमान बड़े भाषा मॉडल वैज्ञानिक कोड जनरेशन में काफी संघर्ष करते हैं, जबकि यह भी दर्शाता है कि इस डेटासेट पर प्रशिक्षण करने से उनके प्रदर्शन में पर्याप्त सुधार होता है।

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo2026-07-22
💻 computer science

EmbeddedKittens: An Evaluation of Code Embeddings for Scratch

यह शोध पत्र स्क्रैच (Scratch) प्रोग्रामों के लिए चार बड़े भाषा मॉडलों और पांच एम्बेडिंग दृष्टिकोणों का अनुभवजन्य मूल्यांकन करता है, जो यह प्रदर्शित करता है कि बड़े ओपन डेटासेट पर प्रशिक्षित मॉडल संरचनात्मक और अर्थ संबंधी जानकारी को प्रभावी ढंग से कैप्चर कर सकते हैं ताकि बिना किसी अतिरिक्त फाइन-ट्यूनिंग की आवश्यकता के छोटे कक्षा परिवेश में कार्यात्मक शुद्धता की भविष्यवाणी करने जैसे लर्निंग एनालिटिक्स कार्यों का समर्थन किया जा सके।

Benedikt Fein, Gordon Fraser2026-07-22
🤖 AI

Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes

यह शोधपत्र तीन निष्पादन योग्य व्यंजनों (रेसिपीज़) के माध्यम से जटिल, स्टेटफुल व्यावसायिक वर्कफ़्लो के लिए लैंगग्राफ (LangGraph) को लागू करने हेतु एक अभ्यासी मार्गदर्शिका के रूप में कार्य करता है, जो विश्वसनीयता और ऑडिटेबिलिटी के लिए इसकी संरचनात्मक विशेषताओं का लाभ उठाने का प्रदर्शन करता है, साथ ही यह स्पष्ट करता है कि इसे वर्कफ़्लो की जटिलता के आधार पर अपनाया जाना चाहिए न कि एक सार्वभौमिक डिफ़ॉल्ट के रूप में।

Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola2026-07-22
🤖 machine learning

Data Requirement Goal Modeling for Machine Learning Systems

यह शोध पत्र एक डेटा रिक्वायरमेंट गोल मॉडलिंग (DRGM) दृष्टिकोण प्रस्तावित करता है जो लक्ष्य मॉडलिंग और एक अनुकूलन तंत्र का उपयोग करता है ताकि गैर-विशेषज्ञों को मशीन लर्निंग प्रणालियों के लिए डेटा आवश्यकताओं की पहचान करने, उन्हें अनुकूलित करने और उनका मूल्यांकन करने में मार्गदर्शन किया जा सके, जिसे व्यावहारिक प्रभावशीलता सुनिश्चित करने के लिए वास्तविक दुनिया के उदाहरणों के माध्यम से मान्य किया गया है।

Asma Yamani, Nadeen AlAmoudi, Salma Albilali, Malak Baslyman, Jameleddine Hassine2026-07-21
💻 computer science

GPU-Accelerated Belief Propagation for Program Analysis

यह शोध पत्र FastLBP प्रस्तुत करता है, जो एक GPU-त्वरितित (GPU-accelerated) बिलीफ प्रोपेगेशन फ्रेमवर्क है जो लचीली अपडेट रणनीतियों और कुशल समानांतर निष्पादन के लिए एक एकीकृत प्रतिनिधित्व का उपयोग करता है ताकि बड़े पैमाने के प्रोग्राम विश्लेषण में मौजूदा CPU और GPU विधियों की सटीकता बनाए रखते हुए महत्वपूर्ण गति प्राप्त की जा सके।

Haoyu Feng, Xin Zhang2026-07-21
🤖 AI

CAM: A Causality-based Analysis Framework for Multi-Agent Code Generation Systems

यह शोध पत्र CAM को प्रस्तुत करता है, जो मल्टी-एजेंट कोड जनरेशन सिस्टम्स (MACGS) के लिए पहला कार्य-कारण-आधारित (causality-based) विश्लेषण ढांचा है, जो सिस्टम की शुद्धता में मध्यवर्ती आउटपुट के योगदान को मात्रात्मक रूप से मापता है ताकि संदर्भ-निर्भर फीचर इंटरैक्शन को प्रकट किया जा सके, हाइब्रिड बैकएंड आर्किटेक्चर को अनुकूलित किया जा सके, और विफलता सुधार (failure repair) एवं कुशल फीचर छंटनी (feature pruning) जैसे व्यावहारिक अनुप्रयोगों को सक्षम बनाया जा सके।

Zongyi Lyu, Zhenlan Ji, Songqiang Chen, Liwen Wang, Yuheng Huang, Shuai Wang, Shing-Chi Cheung2026-07-21
💻 computer science

Scaling Mobile Chaos Testing with AI-Driven Test Execution

यह शोध पत्र एक AI-संचालित मोबाइल चाओस टेस्टिंग सिस्टम प्रस्तुत करता है जो बड़े पैमाने पर लचीलेपन (resilience) को स्वचालित रूप से मान्य करने के लिए सर्विस-लेवल फॉल्ट इंजेक्शन के साथ LLM-आधारित टेस्ट निष्पादन को एकीकृत करता है, और सफलतापूर्वक उबर के मोबाइल अनुप्रयोगों में महत्वपूर्ण आर्किटेक्चरल जोखिमों की पहचान करते हुए डिबगिंग समय को कम करता है।

Juan Marcano, Ashish Samant, Kai Song, Lingchao Chen, Kaelan Mikowicz, Tim Smyth, Mengdie Zhang, Ali Zamani, Arturo Brav (…)2026-07-21
🤖 AI

RAIL Guard: Closing the Evaluation-to-Remediation Gap in Responsible AI for LLM Agents

यह शोध पत्र RAIL Guard को प्रस्तुत करता है, जो एक क्लोज्ड-लूप जिम्मेदार एआई पाइपलाइन है जो आठ आयामों में एलएलएम (LLM) एजेंट आउटपुट का पुनरावृत्ति रूप से मूल्यांकन और उपचार करती है, यह प्रदर्शित करते हुए कि फीडबैक-संचालित स्व-मरम्मत न्यूनतम उपयोगिता हानि के साथ उच्च अभिसरण प्राप्त करती है जबकि यह पहचानती है कि पारदर्शिता और जवाबदेही जैसे संरचनात्मक मुद्दों के लिए एल्गोरिदम के बजाय आर्किटेक्चरल समाधानों की आवश्यकता होती है।

Sumit Verma, Pritam Prasun, Pritish Kumar2026-07-21
💻 computer science

AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows

AEVAL एक CI-एकीकृत ढांचा है जो एजेंटिक कौशल के उपाख्यानात्मक, व्यक्तिपरक मूल्यांकन को एक नियतात्मक, पुनरुत्पादनीय परीक्षण पाइपलाइन से बदल देता है जिसमें स्व-सुधार पूर्वाग्रह को रोकने के लिए एक सख्त निष्पादक-ग्रेडर पृथक्करण है और जो स्वचालित वर्कफ़्लो सत्यापन के लिए ऑडिट योग्य, साक्ष्य-आधारित गुणवत्ता संकेत प्रदान करता है।

Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou2026-07-21
💻 computer science

AoA: Theorem Proving Agent over Abstract Syntax Tree of Redesigned Language

यह शोध पत्र AoA को प्रस्तुत करता है, जो एक नवीन इंटरैक्टिव थ्योरम प्रूविंग एजेंट है जो सीरियलाइज्ड सोर्स टेक्स्ट के बजाय एक पुनर्गठित भाषा (Minilang) के एब्स्ट्रैक्ट सिंटैक्स ट्री (AST) पर सीधे कार्य करता है, जिससे सत्यापन बेंचमार्क पर समाधान की गति और सफलता दर में सुधार करते हुए API लागत, टोकन उपयोग और टूल कॉल्स को काफी कम किया जाता है।

Qiyuan Xu, Joshua Ong Jun Leang, Renxi Wang, Wenda Li, Haonan Li, Luke Ong, Conrad Watt2026-07-21