🤖 AI

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

यह शोध पत्र OpenEvolve का उपयोग करते हुए एक केस स्टडी प्रस्तुत करता है जो यह प्रदर्शित करता है कि कैसे वेरिफायर-गाइडेड (verifier-guided) LLM एजेंट टेंसर नेटवर्क कॉन्ट्रैक्शन ऑर्डर ऑप्टिमाइज़ेशन के लिए एल्गोरिदम को प्रभावी ढंग से विकसित और सुधार सकते हैं, जबकि मूल्यांकन, सत्यापन और व्याख्या में मानव वैज्ञानिकों की महत्वपूर्ण भूमिका पर जोर दिया गया है।

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges2026-06-02
💻 computer science

An Agentic Approach Towards Replication Package Quality Evaluation

यह शोध पत्र एक एजेंटिक दृष्टिकोण प्रस्तुत करता है जो ओपन-साइंस दिशानिर्देशों को मशीन-सत्यापन योग्य मानदंडों में अनुवादित करके प्रतिकृति पैकेज (रेप्लिकेशन पैकेज) गुणवत्ता मूल्यांकन को स्वचालित करता है, जो प्रारंभिक परीक्षणों में उच्च निरंतरता और शुद्धता प्रदर्शित करता है और गुणात्मक मूल्यांकनों के साथ वर्तमान सीमाओं के बावजूद शोधकर्ताओं को सहायता प्रदान करने की क्षमता को रेखांकित करता है।

Maximilian Alexander Amougou Mbida, Florian Angermeir2026-06-02
🤖 AI

Monitoring Agentic Systems Before They're Reliable

यह शोध पत्र एजेंटिक सिस्टम के लिए एक परिपक्वता-चरणबद्ध निगरानी ढांचे का प्रस्ताव करता है जो कार्य-स्तरीय त्रुटियों के बजाय संरचनात्मक दोषों का पता लगाने को प्राथमिकता देता है, जिसमें मूल्यांकन को विचरणात्मक (within-run), अंतर-विचरणात्मक (cross-run) और संरचनात्मक स्कोप के माध्यम से गुणवत्ता, उपयुक्तता और दक्षता आयामों में विभाजित किया गया है, तथा मानव ध्यान को सबसे महत्वपूर्ण एकीकरण अंतराल की ओर निर्देशित करने के लिए विचरण (variance) और FMEA-आधारित ट्राइएज का उपयोग किया गया है।

Marisa Ferrara Boston, Glen Hanson, Effi Georgala, JD Hudgens, Heather Frase2026-06-02
💬 NLP

LLMs Lean on Priors, Not Programming Language Semantics

यह शोध पत्र PLSemanticsBench को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि समकालीन लार्ज लैंग्वेज मॉडल्स मुख्य रूप से प्रदान की गई औपचारिक प्रोग्राम सिमेंटिक्स (program semantics) पर व्यवस्थित रूप से आधारित होने के बजाय पूर्व-प्रशिक्षित लेक्सिकल एसोसिएशंस (lexical associations) पर निर्भर करते हैं, जैसा कि सिमेंटिक म्यूटेशन (semantic mutations), नवीन प्रतीकों (novel symbols) और लंबे निष्पादन ट्रेसेस (execution traces) का सामना करने पर उनके प्रदर्शन में आई तीव्र गिरावट से सिद्ध होता है।

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric2026-06-01
🤖 AI

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs

यह शोध पत्र FEM-Bench प्रस्तुत करता है, जो कम्प्यूटेशनल मैकेनिक्स कार्यों पर आधारित एक संरचित बेंचमार्क है जिसे वैज्ञानिक रूप से वैध फाइनाइट एलीमेंट मेथड कोड उत्पन्न करने की बड़े भाषा मॉडलों (LLMs) की क्षमता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी इन गैर-तुच्छ समस्याओं को लगातार हल करने में संघर्ष करते हैं।

Saeed Mohammadzadeh, Erfan Hamdi, Joel Shor, Emma Lejeune2026-06-01✓ Author reviewed
💻 computer science

Beyond Strict Rules: Assessing the Effectiveness of Large Language Models for Code Smell Detection

यह शोध पत्र 30 जावा परियोजनाओं में नौ कोड स्मल्स (code smells) का पता लगाने में चार लार्ज लैंग्वेज मॉडल्स की प्रभावशीलता का मूल्यांकन करता है, जिससे यह पता चलता है कि जबकि वे संरचनात्मक रूप से सरल स्मल्स को पहचानने में उत्कृष्ट हैं, एलएलएम (LLMs) को स्टैटिक एनालिसिस टूल्स के साथ संयोजित करने वाली एक हाइब्रिड रणनीति अधिकांश स्मल्स के लिए बेहतर प्रदर्शन प्रदान करती है, हालांकि इष्टतम दृष्टिकोण अंततः इस पर निर्भर करता है कि प्रिसिजन (precision) को प्राथमिकता दी जा रही है या रिकॉल (recall) को।

Saymon Souza, Amanda Santana, Eduardo Figueiredo, Igor Muzetti, João Eduardo Montandon, Lionel Briand2026-06-01
💬 NLP

SERA: Soft-Verified Efficient Repository Agents

यह शोध पत्र SERA को प्रस्तुत करता है, जो सॉफ्ट वेरीफाइड जनरेशन का उपयोग करने वाली एक लागत प्रभावी विधि है, जिसका उपयोग निजी कोडबेस के लिए विशेष रूप से प्रशिक्षित ओपन-सोर्स कोडिंग एजेंटों को सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से प्रशिक्षित करने के लिए किया जाता है, जो सुदृढीकरण लर्निंग (reinforcement learning) या पिछले सिंथेटिक डेटा दृष्टिकोणों की तुलना में बहुत कम लागत पर अग्रणी ओपन-वेट मॉडल्स के समान प्रदर्शन प्राप्त करता है।

Ethan Shen, Daniel Tormoen, Saurabh Shah, Ali Farhadi, Tim Dettmers2026-06-01
💬 NLP

Pull Requests as a Training Signal for Repo-Level Code Editing

यह शोध पत्र Clean-PR को प्रस्तुत करता है, जो एक मिड-ट्रेनिंग प्रतिमान (paradigm) है जो पुनर्गठित (reconstructed) GitHub पुल रिक्वेस्ट के एक विशाल संग्रह का लाभ उठाता है ताकि मॉडल रिपॉजिटरी-स्तरीय कोड संपादन क्षमताओं को आत्मसात कर सकें, जो जटिल एजेंट स्कैफोल्डिंग पर निर्भर हुए बिना SWE-bench पर बेसलाइन से काफी बेहतर प्रदर्शन करता है।

Qinglin Zhu, Tianyu Chen, Shuai Lu, Lei Ji, Runcong Zhao, Murong Ma, Xiangxiang Dai, Yulan He, Lin Gui, Peng cheng, Yeyu (…)2026-06-01
💻 computer science

Neurodiversity in Agile Teams: Obstacles and Inclusion Barriers

यह अध्ययन प्रकट करता है कि जहाँ एजाइल (agile) पद्धतियाँ न्यूरोडायवर्स समावेश के लिए क्षमता प्रदान करती हैं, वहीं उनकी प्रभावशीलता वर्तमान में कठोर संगठनात्मक संरचनाओं, रूढ़ियों और अनुकूलित सहायता की कमी के कारण बाधित है, जिसके लिए व्यक्तिगत अनुकूलन से हटकर लचीले, मानकीकृत समायोजनों की ओर बढ़ने की आवश्यकता है।

Lars Struck, Christian Veenaas, Robert Wiedekind, Joshua Riechmann, Maria Rauschenberger, Philipp Diebold, Simone Dogu (…)2026-06-01
🤖 AI

Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents

यह शोध पत्र बाइनरी सोर्स कोड में अंतर्निहित प्रॉम्प्ट इंजेक्शन हमलों के प्रति एजेंटिक सॉफ्टवेयर रिवर्स इंजीनियरिंग सिस्टम की संवेदनशीलता की जांच करता है, और प्रोडक्शन-लेवल साइबर वर्कफ़्लो को सुरक्षित करने के लिए डीकंपाइलर आउटपुट में इन हमलों को अस्पष्ट (obfuscate) करने और उन्हें पहचानने दोनों के लिए विधियों का प्रस्ताव और मूल्यांकन करता है।

Brian Crawford, Patrick McClure2026-06-01