⚛️ quantum physics

Qimax: Efficient quantum simulation via GPU-accelerated extended stabilizer formalism

यह शोध पत्र एक्सटेंडेड स्टेबलाइज़र फॉर्मलिज्म (extended stabilizer formalism) के एक समानांतर (parallelized), GPU-त्वरित संस्करण को प्रस्तुत करता है जो मौजूदा नियर-क्लिफ़ॉर्ड (near-Clifford) सर्किट सिम्युलेटर्स की अनुक्रमिक प्रदर्शन सीमाओं को दूर करता है, और विशिष्ट परिदृश्यों में Qiskit और Pennylane जैसे अत्याधुनिक उपकरणों की तुलना में बेहतर दक्षता प्रदर्शित करता है।

Vu Tuan Hai, Bui Cao Doanh, Le Vu Trung Duong, Pham Hoai Luan, Yasuhiko Nakashima2026-05-18
💻 computer science

Constrained Co-evolutionary Metamorphic Differential Testing for Autonomous Systems with an Interpretability Approach

यह शोधपत्र CoCoMagic प्रस्तुत करता है, जो एक नवीन स्वचालित परीक्षण ढांचा (automated testing framework) है, जो स्वायत्त प्रणालियों के संस्करणों के बीच व्यवहार संबंधी विचलन की पहचान करने और निदान करने के लिए यथार्थवादी परीक्षण मामले प्रभावी ढंग से उत्पन्न करने हेतु बाधित सह-विकासवादी खोज (constrained co-evolutionary search) और एक व्याख्यात्मकता दृष्टिकोण का उपयोग करता है।

Hossein Yousefizadeh, Shenghui Gu, Lionel C. Briand, Ali Nasr2026-05-18
🤖 AI

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith एक बाउंड्री-फर्स्ट कंपाइलर-रनटाइम फ्रेमवर्क है जो स्किल्स को न्यूनतम निष्पादन योग्य इंटरफेस में ऑफलाइन-कंपाइल करके LLM-आधारित एजेंट सिस्टम को अनुकूलित करता है, जिससे टोकन उपयोग, रीजनिंग इटरेशन और निष्पादन समय को महत्वपूर्ण रूप से कम किया जा सकता है और कुशल क्रॉस-मॉडल स्किल पुन: उपयोग को सक्षम किया जा सकता है।

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu2026-05-18
💻 computer science

Effective Harness Engineering for Algorithm Discovery with Coding Agents

यह शोध पत्र यह प्रदर्शित करता है कि कोडिंग एजेंटों के साथ एल्गोरिदम खोज के लिए प्रभावी हार्नेस इंजीनियरिंग, केवल मात्रा के बजाय गहन तर्क के साथ कम और उच्च-गुणवत्ता वाले एल्गोरिदम उत्पन्न करने को प्राथमिकता देती है, साथ ही मूल्यांकन हैक डिटेक्शन (evaluation hack detection) और सुरक्षित समानांतर निष्पादन (safe parallel execution) जैसी महत्वपूर्ण चुनौतियों का भी समाधान करती है।

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada2026-05-18
💻 computer science

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

यह शोध पत्र फीनिक्स-बेंच (Phoenix-bench) का परिचय देता है, जो एक व्यापक हार्डवेयर इंजीनियरिंग बेंचमार्क है जो यह प्रकट करता है कि एजेंटिक एआई (agentic AI) सिस्टम बग प्रसार (bug propagation) में मौलिक अंतर और प्रभावी डिबगिंग के लिए सरल फ़ाइल स्थानीयकरण (file localization) की तुलना में टेस्ट-केस फीडबैक के महत्वपूर्ण महत्व के कारण सॉफ्टवेयर से हार्डवेयर कार्यों में स्थानांतरित होने में संघर्ष करते हैं।

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong2026-05-18
💻 computer science

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

यह शोध पत्र PBT-Bench प्रस्तुत करता है, जो 40 पायथन लाइब्रेरीज़ के माध्यम से 100 क्यूरेटेड समस्याओं का एक बेंचमार्क है जिसे दस्तावेज़ीकरण से सिमेंटिक इनवेरिएंट्स (semantic invariants) निकालने और प्रॉपर्टी-बेस्ड टेस्टिंग के लिए लक्षित इनपुट-जेनरेशन रणनीतियों को निर्मित करने की AI एजेंटों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि स्पष्ट स्कैफोल्डिंग (scaffolding) मध्यम क्षमता वाले मॉडलों की सहायता करती है, फिर भी सबसे शक्तिशाली LLMs के लिए भी महत्वपूर्ण प्रदर्शन अंतराल और मॉडल-विशिष्ट विफलताएं बनी रहती हैं।

Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du2026-05-18
💻 computer science

Probing Privacy Leaks in LLM-based Code Generation via Test Generation

यह शोध पत्र एक परीक्षण-संचालित पाइपलाइन का प्रस्ताव करता है जो यथार्थवादी कोड जनरेशन परिदृश्यों को सिम्युलेट करने के लिए स्वचालित रूप से निर्मित गोपनीयता विशेषता लाइब्रेरी का उपयोग करता है, जिससे यह पांच बड़े भाषा मॉडलों में गोपनीयता रिसाव का पता लगाने में मौजूदा एड-हॉक प्रॉम्प्ट-आधारित विधियों से काफी बेहतर प्रदर्शन करता है।

Yifei Ge, Zhenpeng Chen, Weisong Sun, Yuchen Chen, Chunrong Fang, Juan Zhai, Xiaofang Zhang, Xia Feng, Yang Liu, Zhenyu (…)2026-05-18
🤖 machine learning

From I/O to Code with Discovery Agent

यह शोध पत्र DIO-Agent को प्रस्तुत करता है, जो एक खोज ढांचा (discovery framework) है जो प्रोग्राम संश्लेषण (program synthesis) को निष्पादन त्रुटियों (execution errors) और सरल परिकल्पनाओं को प्राथमिकता देने के लिए एक "ट्रांसफॉर्मेशन प्रायोरिटी प्रिमिस" (Transformation Priority Premise) द्वारा निर्देशित एक विकासवादी खोज (evolutionary search) के रूप में फ्रेम करके चुनौतीपूर्ण IO2Code समस्या को हल करता है, और एक नवनिर्मित IO2CodeBench पर मौजूदा विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang2026-05-18
🤖 AI

Runtime-Structured Task Decomposition for Agentic Coding Systems

यह शोध पत्र रनटाइम-स्ट्रक्चर्ड टास्क डिकंपोजिशन (runtime-structured task decomposition) प्रस्तुत करता है, जो एजेंटिक कोडिंग सिस्टम के लिए एक आर्किटेक्चरल दृष्टिकोण है जो मोनोलिथिक प्रॉम्प्ट्स के स्थान पर निष्पादन योग्य कंट्रोल लॉजिक का उपयोग करता है ताकि विफलताओं को अलग किया जा सके और केवल विफल उप-कार्यों को पुन: चलाया जा सके, जिससे स्टैटिक डिकंपोजिशन की तुलना में रिट्राय लागत में 73.2% तक और मोनोलिथिक बेसलाइन्स की तुलना में 51.7% तक की कमी आती है।

Shubhi Asthana, Bing Zhang, Chad DeLuca, Hima Patel, Ruchi Mahindru2026-05-18
🤖 AI

Detecting Privilege Escalation in Polyglot Microservices via Agentic Program Analysis

यह शोध पत्र नियो (Neo) को प्रस्तुत करता है, जो एक एजेंटिक प्रोग्राम विश्लेषण ढांचा है जो जटिल, पॉलीग्लॉट माइक्रोसर्विसेज आर्किटेक्चर में प्रिविलेज एस्केलेशन कमजोरियों का प्रभावी ढंग से पता लगाने के लिए लार्ज लैंग्वेज मॉडल्स को क्लासिक प्रोग्राम विश्लेषण के साथ जोड़ता है, जिसने 25 ओपन-सोर्स एप्लिकेशन्स में 24 ज़ीरो-डे खामियों को उच्च परिशुद्धता और रिकॉल के साथ सफलतापूर्वक पहचाना है।

Penghui Li, Hong Yau Chong, Yinzhi Cao, Junfeng Yang2026-05-18