💬 NLP

SuperCoder: Assembly Program Superoptimization with Large Language Models

यह शोधपत्र SuperCoder को प्रस्तुत करता है, जो असेंबली सुपरऑप्टिमाइज़ेशन के लिए एक लार्ज लैंग्वेज मॉडल-आधारित दृष्टिकोण है, जो एक नए बड़े पैमाने के बेंचमार्क के निर्माण और सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) फाइन-ट्यूनिंग के माध्यम से, 95% शुद्धता और उद्योग-मानक कंपाइलरों पर 1.46x की गति वृद्धि प्राप्त करता है, जो पारंपरिक ह्यूरिस्टिक्स से परे प्रोग्राम प्रदर्शन अनुकूलन के लिए एलएलएम (LLMs) की व्यवहार्यता को प्रदर्शित करता है।

Anjiang Wei, Tarun Suresh, Huanmi Tan, Yinglun Xu, Gagandeep Singh, Ke Wang, Alex Aiken2026-02-02
🤖 AI

TOM-SWE: User Mental Modeling For Software Engineering Agents

यह शोध पत्र ToM-SWE को प्रस्तुत करता है, जो एक डुअल-एजेंट आर्किटेक्चर है जो उपयोगकर्ता के इरादे को समझने और निरंतर मेमोरी बनाए रखने के लिए एक सॉफ्टवेयर इंजीनियरिंग एजेंट को थ्योरी-ऑफ-माइंड पार्टनर के साथ जोड़ता है, जिससे बेंचमार्क मूल्यांकन और पेशेवर डेवलपर्स के साथ एक वास्तविक अध्ययन दोनों में कार्य सफलता दर और उपयोगकर्ता संतुष्टि में उल्लेखनीय सुधार होता है।

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang2026-02-02
💻 computer science

CloudFix: Automated Policy Repair for Cloud Access Control Policies Using Large Language Models

यह शोधपत्र CloudFix को प्रस्तुत करता है, जो क्लाउड एक्सेस कंट्रोल पॉलिसियों में त्रुटियों को स्वचालित रूप से पहचानने और सुधारने के लिए औपचारिक फॉल्ट लोकलाइजेशन (formal fault localization) को लार्ज लैंग्वेज मॉडल्स और SMT सॉल्वर के साथ संयोजित करने वाला पहला फ्रेमवर्क है, जो वास्तविक दुनिया की AWS पॉलिसियों के एक क्यूरेटेड डेटासेट पर बेसलाइन की तुलना में बेहतर सटीकता प्रदर्शित करता है।

Bethel Hall, Owen Ungaro, William Eiers2026-02-02
💻 computer science

The Green Side of the Lua

यह शोध पत्र एक अनुभवजन्य अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि जस्ट-इन-टाइम (JIT) कंपाइलेशन Lua की ऊर्जा दक्षता और निष्पादन गति को महत्वपूर्ण रूप से बढ़ाता है, जिसमें सबसे अनुकूलित LuaJIT संस्करण मानक इंटरप्रेटरों की तुलना में सात गुना कम ऊर्जा की खपत करता है और सात गुना तेज़ चलता है, जबकि C के प्रदर्शन के करीब पहुँच जाता है।

André Brandão, Diogo Matos, Miguel Guimarães, Simão Cunha, João Saraiva2026-02-02
💻 computer science

Risk-based test framework for LLM features in regulated software

यह शोध पत्र विनियमित सॉफ़्टवेयर में लार्ज लैंग्वेज मॉडल (LLM) सुविधाओं के लिए एक जोखिम-आधारित परीक्षण ढांचे का प्रस्ताव करता है, जिसमें छह-श्रेणी वाला जोखिम वर्गीकरण और एक स्तरीय परीक्षण रणनीति शामिल है, जिसे क्लिनिकल रिसर्च प्लेटफॉर्म असिस्टेंट के एक केस स्टडी के माध्यम से सत्यापित किया गया है।

Zhiyin Zhou2026-02-02
🤖 AI

AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context

यह शोध पत्र AACR-Bench प्रस्तुत करता है, जो ऑटोमेटेड कोड रिव्यू के लिए एक व्यापक, बहुभाषी रिपॉजिटरी-स्तरीय बेंचमार्क है, जो डिफेक्ट कवरेज को महत्वपूर्ण रूप से विस्तारित करने और लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक अधिक कठोर मानक स्थापित करने के लिए एक AI-सहायता प्राप्त, विशेषज्ञ-सत्यापित एनोटेशन पाइपलाइन का उपयोग करता है।

Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong, Dong Shao, Haifeng Shen, Hongyu Kuang, Zheng (…)2026-02-02
🤖 machine learning

IDE-Bench: Evaluating Large Language Models as IDE Agents on Real-World Software Engineering Tasks

IDE-Bench एक व्यापक, डॉकरयुक्त (Dockerized) मूल्यांकन ढांचे को पेश करता है जिसमें आठ कभी न प्रकाशित हुए रिपॉजिटरीज़ के माध्यम से 80 कार्य शामिल हैं, जो एक संरचित, IDE-नेटिव टूल इंटरफ़ेस के माध्यम से वास्तविक दुनिया के, बहु-भाषा सॉफ्टवेयर इंजीनियरिंग कार्यों में AI IDE एजेंटों की क्षमताओं का आकलन करने के लिए है।

Spencer Mateega, Jeff Yang, Tiana Costello, Shaurya Jadhav, Nicole Tian, Agustin Garcinuño2026-02-02
💻 computer science

Stalled, Biased, and Confused: Uncovering Reasoning Failures in LLMs for Cloud-Based Root Cause Analysis

यह शोध पत्र क्लाउड-आधारित रूट कॉज एनालिसिस (मूल कारण विश्लेषण) में रीजनिंग विफलताओं को अलग करने और वर्गीकृत करने के लिए एक नियंत्रित ढांचे के भीतर छह एलएलएम (LLMs) का एक बड़े पैमाने पर अनुभवजन्य मूल्यांकन प्रस्तुत करता है, जो मल्टी-हॉप फॉल्ट प्रोपेगेशन (बहु-चरणीय दोष प्रसार) में विशिष्ट कमजोरियों को प्रकट करता है और स्वचालित सिस्टम डायग्नोसिस में भविष्य के सुधारों के मार्गदर्शन के लिए एक वर्गीकरण प्रदान करता है।

Evelien Riddell, James Riddell, Gengyi Sun, Michał Antkiewicz, Krzysztof Czarnecki2026-02-02
🤖 machine learning

FunPRM: Function-as-Step Process Reward Model with Meta Reward Correction for Code Generation

FunPRM मॉड्यूलर फंक्शन्स को प्रोसेस रिवॉर्ड मॉडल्स के लिए रीजनिंग स्टेप्स के रूप में मानकर और यूनिट-टेस्ट-आधारित अंतिम मूल्यांकनों का उपयोग करके शोर वाले आंशिक-समाधान रिवॉर्ड्स को ठीक करने के लिए एक मेटा-लर्निंग तंत्र को नियोजित करके कोड जनरेशन को बढ़ाता है, जिससे अत्याधुनिक प्रदर्शन और अधिक पठनीय कोड प्राप्त होता है।

Ruiyi Zhang, Peijia Qin, Qi Cao, Eric Xue, Pengtao Xie2026-02-02
💻 computer science

SPARK: Real-Time Monitoring of Multi-Faceted Programming Exercises

यह शोध पत्र SPARK को प्रस्तुत करता है, जो एक रियल-टाइम मॉनिटरिंग डैशबोर्ड है जो लचीले चेकपॉइंट ग्रुपिंग, स्वचालित टेस्ट सुझावों और मध्यवर्ती आउटपुट के विज़ुअलाइज़ेशन को सक्षम करके प्रशिक्षकों को जटिल, बहुआयामी प्रोग्रामिंग अभ्यासों पर छात्रों की प्रगति को ट्रैक करने में मदद करता है, जिसे कीस्ट्रोक डेटा के एक डेटासेट और 16 प्रशिक्षकों के साथ एक मूल्यांकन के माध्यम से मान्य किया गया है।

Yinuo Yang, Ashley Ge Zhang, Steve Oney, April Yi Wang2026-02-02