🤖 AI

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

यह शोध पत्र प्राकृतिक भाषा से TLA+ विनिर्देश (specifications) उत्पन्न करने के लिए 30 LLMs का पहला व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ कुछ मॉडल सीमित वाक्यात्मक शुद्धता प्राप्त करते हैं, वहीं वे मतिभ्रम (hallucinations) और कोड प्रशिक्षण से होने वाले नकारात्मक हस्तांतरण (negative transfer) जैसी समस्याओं के कारण विशेषज्ञ पर्यवेक्षण के बिना मुख्य रूप से अर्थपूर्ण रूप से सही विनिर्देश उत्पन्न करने में विफल रहते हैं।

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer (…)2026-06-05
💬 NLP

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

यह शोध पत्र Asuka-Bench को पेश करता है, जो एक नया बेंचमार्क है जिसे वास्तविक दुनिया के मल्टी-राउंड रिफाइनमेंट चक्रों को सिम्युलेट करके वेब डेवलपमेंट कार्यों पर कोड एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जहाँ एजेंट स्वचालित UI टेस्टिंग और प्राकृतिक भाषा फीडबैक के आधार पर कम-निर्दिष्ट (underspecified) प्रोजेक्ट्स को बार-बार बेहतर बनाते हैं, जिससे वर्तमान मॉडलों के बीच प्रदर्शन के महत्वपूर्ण अंतर का पता चलता है।

Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng (…)2026-06-05
🤖 AI

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover एक 20-बिलियन-पैरामीटर वाला मॉडल है जो सुपरवाइज्ड फाइन-ट्यूनिंग को रिपेयर-आधारित पॉलिसी ऑप्टिमाइज़ेशन और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन के साथ जोड़कर वेरीफिएबल TLA+ स्पेसिफिकेशन के संश्लेषण में महत्वपूर्ण सुधार करता है, जो TLC मॉडल चेकर को एक प्रत्यक्ष रिवॉर्ड सिग्नल के रूप में उपयोग करके एक होल्ड-आउट बेंचमार्क पर 30% पास रेट प्राप्त करता है।

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer (…)2026-06-05
🤖 AI

Towards the Readability of LLM-Generated Codes through Multitask Representation Engineering

यह शोध पत्र मौजूदा एकल-कार्य नियंत्रण विधियों की सीमाओं को सैद्धांतिक विश्लेषण और व्यापक प्रयोगों के माध्यम से संबोधित करते हुए, शुद्धता बनाए रखते हुए LLM-जनित कोड की पठनीयता बढ़ाने के लिए एक मल्टीटास्क रिप्रेजेंटेशन इंजीनियरिंग फ्रेमवर्क प्रस्तावित करता है।

Huifan Gao, Liuhua He, Yinghui Pan, Shenbao Yu, Yifeng Zeng, Shengchao Qin, Weidi Sun2026-06-05
💻 computer science

From Failed Trajectories to Reliable LLM Agents: Diagnosing and Repairing Harness Flaws

यह शोध पत्र HarnessFix को प्रस्तुत करता है, जो एक ट्रेस-निर्देशित (trace-guided) फ्रेमवर्क है जो निष्पादन ट्रेसेस (execution traces) और हार्नेस कोड का विश्लेषण करके एजेंट की विफलताओं का निदान करता है ताकि लक्षित, सत्यापित पैच उत्पन्न किए जा सकें जो कई बेंचमार्क में LLM एजेंट की विश्वसनीयता में महत्वपूर्ण सुधार करते हैं।

Mengzhuo Chen, Junjie Wang, Zhe Liu, Yawen Wang, Qing Wang2026-06-05
💻 computer science

WildCode Revisited: A Comprehensive Empirical Study on the Security of LLM-Generated Code

यह अध्ययन अनुभवजन्य रूप से इस बात की पुष्टि करता है कि ChatGPT द्वारा जनरेट किया गया वास्तविक जीवन का कोड अक्सर सुरक्षा की कमी रखता है, जो सिंथेटिक प्रयोगों के पूर्व निष्कर्षों की पुष्टि करता है और यह भी प्रकट करता है कि उपयोगकर्ता कोड मांगते समय सुरक्षा संबंधी चिंताओं के बारे में शायद ही कभी पूछताछ करते हैं।

Kobra Khanmohammadi, Pooria Roy, Raphael Khoury, Abdelwahab Hamou-Lhadj, Wilfried Patrick Konan, Alexander Da Re, Nichol (…)2026-06-04
💻 computer science

Trustworthy AI Software Engineers

यह विजन पेपर विश्वासनीयता के प्रमुख आयामों को स्थापित करके और उनके मूल्यांकन को व्यवहार में संचालित करने के लिए एक साक्ष्य-केंद्रित निरीक्षण ढांचे का प्रस्ताव देकर, एआई सॉफ्टवेयर इंजीनियरों को मानव-एआई टीमों में विश्वसनीय प्रतिभागियों के रूप में पुनरपरिभाषित करता है।

Aldeida Aleti, Baishakhi Ray, Rashina Hoda, Simin Chen2026-06-04
💻 computer science

The Biomimetic Architecture of Software 4.0

यह मौलिक विजन पेपर "सॉफ्टवेयर 4.0" का प्रस्ताव करता है, जो "रेकग्निटिव" (Recognitive) प्लेटफॉर्म द्वारा उदाहरण स्वरूप एक नया प्रतिमान है, जो भंगुर, स्थिर कोड असेंबली को मानव और एआई बुद्धिमत्ता के एक स्व-नियामक, ऑटोपॉयटिक हेट्रार्की (heterarchy) से बदल देता है ताकि संभाव्य-प्रतीकात्मक विसंगति (probabilistic-symbolic mismatch) को मूल रूप से हल किया जा सके और गहन अर्थपूर्ण अन्वेषण को सक्षम बनाया जा सके।

Philip Sheldrake, Dirk Scheffler2026-06-04
💻 computer science

Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs

यह शोध पत्र प्रदर्शित करता है कि ओपन-वेट और फ्रंटियर एलएलएम (LLMs) अत्यधिक अप्रत्याशित, डोमेन-निर्भर सुरक्षा अनुपालन प्रदर्शित करते हैं—जो नैतिक श्रेणियों में 14.7% से 85.7% तक भिन्न है—जो अपारदर्शी तकनीकी फ्रेमिंग बायपास द्वारा संचालित है जो विश्वसनीय एआई परिनियोजन को कमजोर करता है।

Zacharie Bugaud2026-06-04
🤖 AI

Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification

यह शोध पत्र एंटरप्राइज एआई एजेंटों के प्री-डिप्लॉयमेंट आश्वासन के लिए एक ऑन्टोलॉजी-ग्राउंडेड सत्यापन ढांचे का प्रस्ताव करता है, जो नियामक और प्रतिकूल परीक्षण परिदृश्यों को स्वचालित रूप से उत्पन्न करने के लिए औपचारिक परिचालन लिफाफों (ऑपरेशनल एनवेलप्स) का उपयोग करता है, जो चार विनियमित उद्योगों में पर्सोना-आधारित बेसलाइन की तुलना में काफी बेहतर कवरेज और डोमेन विशिष्टता प्रदर्शित करता है।

Thanh Luong Tuan, Abhijit Sanyal2026-06-04