💬 NLP

FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback

यह शोध पत्र FronTalk प्रस्तुत करता है, जो मल्टी-मोडल फीडबैक को शामिल करने वाला संवादात्मक फ्रंट-एंड कोड जनरेशन के लिए एक बेंचमार्क और मूल्यांकन ढांचा है, जो फीचर फॉरगेटिंग (विशेषता विस्मृति) और विजुअल इंटरप्रिटेशन (दृश्य व्याख्या) जैसी महत्वपूर्ण चुनौतियों को उजागर करता है और यह प्रदर्शित करता है कि प्रस्तावित AceCoder विधि विस्मृति को काफी कम करती है और समग्र प्रदर्शन में सुधार करती है।

Xueqing Wu, Zihan Xue, Da Yin, Shuyan Zhou, Kai-Wei Chang, Nanyun Peng, Yeming Wen2026-06-11
💬 NLP

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

यह तकनीकी रिपोर्ट मिनिमम विएबल इवैल्यूएशन सूट (MVES) फ्रेमवर्क का परिचय देती है और स्थानीय एब्लेशन अध्ययनों के माध्यम से यह प्रदर्शित करती है कि सामान्य प्रॉम्प्ट सुधार विशिष्ट LLM एप्लिकेशन के प्रदर्शन को कम कर सकते हैं, जिससे तैनाती से पहले रिग्रेशन जोखिमों को कम करने के लिए मूल्यांकन-संचालित पुनरावृत्ति (इटरेशन) का समर्थन मिलता है।

Daniel Commey2026-06-11
💻 computer science

Evaluating LLM-Generated Code: A Benchmark and Developer Study

यह शोध पत्र एक व्यापक त्रि-आयामी (tree-fold) मूल्यांकन पद्धति प्रस्तुत करता है जो LLM-जनित कोड का आकलन करने के लिए शुद्धता बेंचमार्क, कोड गुणवत्ता सत्यापन और डेवलपर सर्वेक्षणों को संयोजित करती है, जो तीन मॉडलों के तुलनात्मक अध्ययन के माध्यम से यह प्रदर्शित करता है कि मानक शुद्धता मेट्रिक्स से परे उत्पादन-तैयार गुणवत्ता की पहचान करने के लिए मानवीय अंतर्दृष्टि आवश्यक है।

Joanna Szych, Anne Schwerk2026-06-11
🔬 physics

An Ocean Model Ported by a Large Language Model: Experience and Lessons from FESOM2 (Fortran to C to C++/Kokkos)

यह शोध पत्र प्रदर्शित करता है कि एक एजेंटिक लार्ज लैंग्वेज मॉडल ने, डोमेन विशेषज्ञों द्वारा निर्देशित एक सख्त दो-चरणीय अनुवाद और कठोर सत्यापन प्रक्रिया के माध्यम से, 74,000-लाइन वाले फोर्ट्रान (Fortran) FESOM2 महासागरीय मॉडल को इसके भौतिक विज्ञान (physics) को सुरक्षित रखते हुए और GPU पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करते हुए, C++/Kokkos में सफलतापूर्वक पोर्ट किया।

Nikolay V. Koldunov, Suvarchal K. Cheedela, Sergey Danilov, Dmitry Sidorenko, Sebastian Beyer, Thomas Jung2026-06-11
💻 computer science

Defeater Cards: Characterizing and Managing Safety Assurance Case Defeaters

यह शोध पत्र "डिफीटर कार्ड्स" (Defeater Cards) का प्रस्ताव करता है, जो 5W1H ढांचे पर आधारित एक संरचित दस्तावेजीकरण आर्टिफैक्ट है, ताकि सुरक्षा आश्वासन मामले के 'डिफीटर्स' (defeaters) को व्यवस्थित रूप से अभिलक्षणित, प्रबंधित और पुन: उपयोग किया जा सके, जिससे वर्तमान विसंगतियों को दूर करते हुए विभिन्न डोमेन में सुरक्षा तर्कों की ट्रैसेबिलिटी (traceability), ऑडिटेबिलिटी (auditability) और विकास में सुधार किया जा सके।

Usman Gohar, Michael C. Hunter, Salil Purandare, Jordan J. Rios, Myra B. Cohen, Robyn R. Lutz2026-06-11
💻 computer science

SentTrack: Sentiment-Driven Bottleneck Detection in GitHub Issue Repositories

यह शोध पत्र SentTrack को प्रस्तुत करता है, जो एक ड्यूल-लेंस फ्रेमवर्क है जो पारंपरिक तरीकों की तुलना में ठहराव और समाधान अंतराल की पहचान करके GitHub इश्यू रिपॉजिटरीज़ में सामाजिक-तकनीकी बाधाओं का पता लगाने के लिए लार्ज लैंग्वेज मॉडल्स और सेंटीमेंट एनालिसिस का लाभ उठाता है।

Xinyu Hu, Ali Behbahani, Daniel Moon, Yaren Dogan, Nasir U. Eisty2026-06-11
💻 computer science

How Requirements Quality Makes (or Breaks) Traceability Link Recovery

यह शोध पत्र इस बात के अनुभवजन्य प्रमाण प्रदान करता है कि आवश्यकताओं की गुणवत्ता स्वचालित ट्रैसेबिलिटी लिंक रिकवरी के प्रदर्शन को महत्वपूर्ण रूप से प्रभावित करती है, यह प्रदर्शित करते हुए कि विशिष्ट दोष उपयोग किए गए दृष्टिकोण के आधार पर रिकवरी में बाधा डाल सकते हैं या उसे बढ़ा सकते हैं।

Tobias Hey, Julian Frattini2026-06-11
🤖 AI

Exploration Structure in LLM Agents for Multi-File Change Localization

यह शोध पत्र सॉफ़्टवेयर रिपॉजिटरीज़ में मल्टी-फाइल परिवर्तनों को स्थानीयकृत करने के लिए एक नॉन-लीनियर, डोमेन-स्कोपड पैरेलल एजेंटिक एक्सप्लोरेशन फ्रेमवर्क प्रस्तावित और मूल्यांकित करता है, जो यह प्रदर्शित करता है कि यह लीनियर सीक्वेंशियल दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है और SWE-Bench Pro जैसे बेंचमार्क पर बहुत बड़े मॉडलों के मुकाबले प्रतिस्पर्धी परिणाम प्राप्त करता है।

Akeela Darryl Fattha, Kia Ying Chua, Lingxiao Jiang, Laura Wynter2026-06-11
🤖 AI

Rule Taxonomy and Evolution in AI IDEs: A Mining and Survey Study

यह शोध पत्र 83 ओपन-सोर्स प्रोजेक्ट्स से 7,310 नियमों को निकालने और AI IDE नियमों के लिए एक वर्गीकरण (टैक्सोनॉमी) स्थापित करने हेतु 99 पेशेवरों का सर्वेक्षण करने वाले एक मिश्रित-पद्धति अध्ययन को प्रस्तुत करता है, जो डेवलपर की प्राथमिकताओं और वास्तविक कॉन्फ़िगरेशन के बीच के अंतर को उजागर करता है और यह प्रदर्शित करता है कि नियमों का विकास सॉफ्टवेयर आर्टिफैक्ट अनुपालन में महत्वपूर्ण सुधार करता है।

Guangzong Cai, Ruiyin Li, Peng Liang, Zengyang Li, Mojtaba Shahin2026-06-11
💻 computer science

Using Gameplay Videos for Detecting Issues in Video Games

यह शोध पत्र GELID का प्रस्ताव और अनुभवजन्य मूल्यांकन करता है, जो गेमप्ले वीडियो से गेम संबंधी समस्याओं को स्वचालित रूप से पहचानने और वर्गीकृत करने का एक दृष्टिकोण है, जो विशिष्ट समस्याओं को खंडित करने और क्लस्टर करने में संतोषजनक परिणाम प्राप्त करता है लेकिन समस्या के प्रकारों को वर्गीकृत करने और गेम संदर्भ द्वारा क्लस्टर करने में सीमाएं प्रदर्शित करता है।

Emanuela Guglielmi, Simone Scalabrino, Gabriele Bavota, Rocco Oliveto2026-06-10