🤖 AI

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

यह शोध पत्र हार्नेस हैंडबुक (Harness Handbook) को प्रस्तुत करता है, जो एक व्यवहार-केंद्रित प्रतिनिधित्व और बिहेवियर-गाइडेड प्रोग्रेसिव डिस्क्लोजर (BGPD) विधि है जो उच्च-स्तरीय व्यवहार संबंधी आवश्यकताओं को विशिष्ट सोर्स कोड स्थानों पर स्वचालित रूप से मैप करती है, जिससे लोकलाइजेशन की बाधा दूर होती है और जटिल एआई एजेंट हार्नेस के विकास की दक्षता और गुणवत्ता में सुधार होता है।

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leowe (…)2026-07-16
🤖 AI

Faithful Autoformalization of Natural Language Assertions

यह शोध पत्र मोंटी (Monty) को प्रस्तुत करता है, जो एक ऑटोफॉर्मलाइजेशन फ्रेमवर्क है जो नवीन कन्फ़ॉर्मेंस (conformance) और वैलिडिटी (validity) स्कोर का उपयोग करके LLM-जनित आउटपुट को फ़िल्टर करके प्राकृतिक भाषा से निष्पादन योग्य एसेर्शन (assertions) के संश्लेषण की सटीकता में सुधार करता है, जिससे नेइव ट्रांसलेशन (naive translation) विधियों की तुलना में औसतन 20-पॉइंट तक की प्रिसिजन (precision) वृद्धि प्राप्त होती है।

Hongyi Liu, Madhusudan Parthasarathy, Adithya Murali2026-07-16
🤖 AI

Set-shifting Behavioral Test for Harnessed Agents

यह शोधपत्र एक सेट-शिफ्टिंग व्यवहारिक परीक्षण प्रस्तुत करता है जो यह मूल्यांकन करता है कि एलएलएम (LLM) एजेंट टूल विश्वसनीयता में छिपे हुए परिवर्तनों के प्रति कैसे अनुकूलित होते हैं, जिससे यह पता चलता है कि एजेंट विशिष्ट दिनचर्या पर दृढ़ता से टिके रहने की प्रवृत्ति रखते हैं जिनके विशिष्ट विफलता मोड होते हैं और जो इस बात से भी प्रभावित होते हैं कि टूलसेट को किस प्रकार फ्रेम किया गया है।

Ziwei Ye2026-07-16
🤖 AI

AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities

यह शोध पत्र AgentCompass को प्रस्तुत करता है, जो एक ओपन-सोर्स, हल्का और विस्तार योग्य मूल्यांकन बुनियादी ढांचा है जो स्वतंत्र घटकों के मॉड्यूलर डिज़ाइन, एक फॉल्ट-टॉलरेंट रनटाइम और विविध बेंचमार्क में पुनरुत्पादनीय अनुसंधान (reproducible research) का समर्थन करने के लिए व्यापक विश्लेषण उपकरणों के माध्यम से खंडित LLM एजेंट मूल्यांकन को एकीकृत करता है।

Zichen Ding, Jiaye Ge, Shufan Jiang, Kai Chen, Mo Li, Qingqiu Li, Zehao Li, Zonglin Li, Tiaohao Liang, Shudong Liu, Zeru (…)2026-07-16
💻 computer science

The Replication Assessment Problem in Software Engineering

यह शोधपत्र हाल के साहित्य की एक व्यवस्थित समीक्षा करके सॉफ्टवेयर इंजीनियरिंग में प्रतिकृति अध्ययनों (replication studies) के मूल्यांकन में मौजूद विसंगति और अस्पष्टता को संबोधित करता है ताकि पद्धतिगत दोषों की पहचान की जा सके और मूल्यांकन मानदंडों को मानकीकृत करने के लिए एक सिद्धांत-आधारित, सांख्यिकीय रूप से सुदृढ़ ढांचे का प्रस्ताव दिया जा सके।

Giuseppe Destefanis, Martin Shepperd, Leila Yousefi2026-07-16
💻 computer science

PROBE: Benchmarking Code Generation in Large Language Models

यह शोध पत्र PROBE को प्रस्तुत करता है, जो एक व्यापक बेंचमार्क फ्रेमवर्क है जो कार्यात्मक शुद्धता, समाधान निकटता और कोड गुणवत्ता के माध्यम से लार्ज लैंग्वेज मॉडल्स में कोड जनरेशन का मूल्यांकन करता है, और यह प्रकट करता है कि जहाँ मॉडल आशाजनक दिखते हैं, वहीं वे अक्सर जटिल समस्याओं, कम संसाधनों वाली भाषाओं और मौलिक त्रुटियों के साथ संघर्ष करते हैं।

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos2026-07-16
🤖 machine learning

Early Adoption of Agentic Coding Tools by GitHub Projects

यह अध्ययन 2,300 GitHub रिपॉजिटरीज़ में एजेंट-जनरेटेड 25,000 से अधिक पुल रिक्वेस्ट्स का विश्लेषण करता है ताकि यह प्रकट किया जा सके कि जहाँ एजेंटिक कोडिंग टूल्स का गहन उपयोग परियोजनाओं के एक छोटे उपसमुच्चय (subset) में केंद्रित बना हुआ है, वहीं सफल एकीकरण काफी हद तक एकल-मानव निरीक्षण मॉडलों पर निर्भर करता है और परियोजना के आकार एवं उत्पादकता के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Maliha Noushin Raida, Daqing Hou2026-07-16
💻 computer science

When Security Meets Usability: An Empirical Investigation of Post-Quantum Cryptography APIs

यह शोध पत्र पोस्ट-क्वांटम क्रिप्टोग्राफी (PQC) API की उपयोगिता का मूल्यांकन करने वाला एक अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि कैसे संज्ञानात्मक कारक और दस्तावेज़ीकरण अंतराल डेवलपर्स द्वारा इसे अपनाने में बाधा डालते हैं और कार्यान्वयन के दौरान सुरक्षा संबंधी खामियों को रोकने के लिए बेहतर मार्गदर्शन और शब्दावली की आवश्यकता पर प्रकाश डालता है।

Marthin Toruan, R. D. N. Shakya, Samuel Tseitkin, Raymond K. Zhao, Nalin Arachchilage2026-07-15
💻 computer science

What's Inside a GitHub Repository? An Empirical Study on the Contents of 10K Projects

यह शोध पत्र एक दशक के दौरान 10,000 गिटहब (GitHub) रिपॉजिटरीज़ का एक अनुभवजन्य विश्लेषण प्रस्तुत करता है, जो मुख्य आर्टिफ़ेक्ट्स के मानकीकरण, गिटहब एक्शन्स (GitHub Actions) के प्रभुत्व, कॉन्फ़िगरेशन स्वरूपों में बदलाव और जनरेटिव एआई (generative AI) से संबंधित सामग्री के उद्भव जैसे प्रमुख रुझानों को प्रकट करता है, साथ ही यह भी रेखांकित करता है कि कैसे गिटहब का पारिस्थितिकी तंत्र ओपन-सोर्स विकास को तेजी से निर्देशित कर रहा है।

Andre Hora, João Eduardo Montandon, Diego Elias Costa2026-07-15
💻 computer science

AI Policy, Disclosure, and Human in the Loop: How Are Contribution Guidelines Adapting to GenAI?

1,000 गिटहब (GitHub) रिपॉजिटरीज़ के इस अनुभवजन्य अध्ययन से पता चलता है कि जबकि अधिकांश ओपन सोर्स प्रोजेक्ट्स अब एआई-सहायता प्राप्त योगदानों की अनुमति देते हैं, उनमें से अधिकांश एआई उपयोग को प्रकट करने और विकास प्रक्रिया में मानवीय निरीक्षण बनाए रखने के लिए सख्त आवश्यकताओं को लागू करते हैं।

Andre Hora, Romain Robbes2026-07-15