🤖 AI

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

यह अध्ययन प्रदर्शित करता है कि एक ही वंश (lineage) के बड़े भाषा मॉडलों के भीतर, रिफ्यूज़ल तंत्र (अब्लेशन) को हटाने से उनके संरेखित (aligned) समकक्षों की तुलना में सॉफ्टवेयर भेद्यता विश्लेषण कार्यों—जैसे पैच सत्यापन और कोड स्थानीयकरण—के लिए उनकी व्यावहारिक उपयोगिता में महत्वपूर्ण वृद्धि होती है, जो यह रेखांकित करता है कि सुरक्षा मूल्यांकनों को प्रतिक्रिया की इच्छा, शुद्धता और कार्यक्षमता का संयुक्त रूप से आकलन करने की आवश्यकता है।

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng2026-07-08
💻 computer science

Hidden Amplifiers: Cross-Level Risk in Software Supply Chains

यह शोध पत्र एक क्रॉस-लेवल रिस्क प्रोपेगेशन फ्रेमवर्क पेश करता है जो इकोसिस्टम-लेवल डिपेंडेंसी ग्राफ और कोड-लेवल स्टैटिक एनालिसिस के बीच सेतु बनाता है ताकि "हिडन एम्प्लीफायर्स" की पहचान की जा सके—अर्थात वे सूक्ष्म-निर्भरताएं (micro-dependencies) जिनमें इकोसिस्टम एक्सपोजर अधिक लेकिन कोड कॉम्प्लेक्सिटी कम है जिन्हें वर्तमान सॉफ्टवेयर कंपोजिशन एनालिसिस टूल्स मिस कर देते हैं, जिससे सॉफ्टवेयर सप्लाई चेन सुरक्षा में महत्वपूर्ण ब्लाइंड स्पॉट्स का पता चलता है।

Rakesh Podder, Rafael Fabian Gonzalez Arellano, Indrajit Ray2026-07-08
🤖 machine learning

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

यह शोध पत्र LLM-जनित वेब API इनवोकेशन की शुद्धता में सुधार करने के लिए पूरक रणनीतियों के रूप में रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) और कंस्ट्रेंड डिकोडिंग (CD) का प्रस्ताव और मूल्यांकन करता है, जिसमें यह पाया गया है कि जबकि RAG फुल इनवोकेशन जनरेशन में मतिभ्रम (hallucinations) को प्रभावी ढंग से कम करता है, वहीं CD अवैध मापदंडों (parameters) को रोकने के लिए अधिक विश्वसनीय प्रावधान प्रदान करता है और विभिन्न परिदृश्यों में समग्र शुद्धता को महत्वपूर्ण रूप से बढ़ाता है।

Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini2026-07-08
💻 computer science

Collaborative Multi-Agent Testing for Emergent Failure Discovery in Autonomous Driving Systems

यह शोध पत्र CREAD को प्रस्तुत करता है, जो एक सहयोगात्मक मल्टी-एजेंट टेस्टिंग फ्रेमवर्क है जो एक साझा ब्लैकबोर्ड के माध्यम से व्यवधान जनरेशन (perturbation generation), व्यवहारिक सत्यापन (behavioral validation) और खोज अन्वेषण (search exploration) को समन्वित करता है ताकि सिंगल-एजेंट और गैर-सहयोगात्मक बेसलाइन की तुलना में ऑटोनॉमस ड्राइविंग सिस्टम्स में उभरती विफलताओं (emergent failures) की खोज में महत्वपूर्ण सुधार किया जा सके।

Ruizhen Gu, Konstantinos Koufos, Donghwan Shin, Vahid Garousi, Mehrdad Dianati2026-07-08
🤖 AI

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

यह शोध पत्र डार्ट (Dart) एओटी (AOT) बाइनरीज़ के न्यूरल डीकंपाइलेशन पर एक व्यवस्थित अनुभवजन्य अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि सूक्ष्म मेट्रिक लाभों के बावजूद फाइन-ट्यूनिंग अक्सर कार्यात्मक शुद्धता (pass@k) में सुधार करने में विफल रहती है, जबकि एक नया ह्यूमैनइवल-डार्ट (HumanEval-Dart) बेंचमार्क पेश करती है और यह प्रदर्शित करती है कि असेंबली अनुक्रम की लंबाई कार्य की कठिनाई का प्राथमिक भविष्यवक्ता है।

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal2026-07-08
💻 computer science

A Global Author-Identity Map for the World of Code:62.7M Developer Identities from 106.8M Author Strings over 5.87B Commits

यह शोध पत्र वर्ल्ड ऑफ कोड (V2604) के लिए एक क्यूरेटेड, उच्च-परिशुद्धता वाले वैश्विक लेखक-पहचान मानचित्र को प्रस्तुत करता है जो सरल रिकॉल के बजाय त्रुटिपूर्ण "क्लंपिंग" (clumping) को रोकने को प्राथमिकता देकर 5.87 बिलियन कमिट्स में 106.8 मिलियन लेखक स्ट्रिंग्स को 62.7 मिलियन कैनोनिकल पहचानों में हल करता है, जिससे बड़े पैमाने पर सॉफ्टवेयर रिपॉजिटरी विश्लेषण और विद्वत्तापूर्ण लेखक ग्राफ जॉइन्स की विश्वसनीयता में महत्वपूर्ण सुधार होता है।

Audris Mockus2026-07-08
💻 computer science

Claimed or Attested? A Commit-Signature Dataset and Identity Trust Tiers across the World of Code

यह शोध पत्र 'वर्ल्ड ऑफ कोड' के लिए पहले कमिट-सिग्नेचर डेटासेट को प्रस्तुत करता है, जो पहचान विश्वास स्तरों (identity trust tiers) के लिए एक परिशुद्धता एंकर स्थापित करने और 5.8 बिलियन से अधिक कमिट्स के संग्रह में उपनाम मैपिंग (alias mappings) को कैलिब्रेट करने के लिए दावा की गई और क्रिप्टोग्राफिक रूप से प्रमाणित डेवलपर पहचानों के बीच अंतर करता है।

Audris Mockus2026-07-08
🤖 AI

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

यह शोध पत्र UI2App को प्रस्तुत करता है, जो केवल स्थिर UI स्क्रीनशॉट से निष्पादन योग्य इंटरैक्शन व्यवहारों को अनुमानित करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो वर्तमान मॉडल्स की दृश्य पुनर्निर्माण क्षमताओं और जटिल, स्टेट-कोहेरेंट वेब एप्लिकेशन उत्पन्न करने की उनकी क्षमता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen2026-07-08
🤖 AI

Harnessing Code Agents for Automatic Software Verification

यह शोध पत्र यह प्रदर्शित करता है कि एक सामान्य-उद्देश्य वाले LLM कोड एजेंट को मानव-डिज़ाइन की गई निश्चित रणनीतियों के साथ सीमित करने के बजाय, उसे एक साउंडनेस-प्रवर्तक सत्यापन हार्नेस (soundness-enforcing verification harness) में लपेटने से जटिल सॉफ्टवेयर प्रणालियों का पूर्णतः स्वचालित और पूर्ण औपचारिक सत्यापन सक्षम होता है, जो विशेषज्ञ हस्तक्षेप के बिना Coq और Lean 4 में हजारों लेम्मा पर 100% प्रमाण कवरेज प्राप्त करता है।

Shuangxiang Kan, Shuanglong Kan, Sebastian Ertel2026-07-08
💬 NLP

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

रुबेंच (Rubench) एक रिपॉजिटरी-स्तरीय एजेंटिक कोडिंग बेंचमार्क है जिसमें लाइव ओपन-सोर्स प्रोजेक्ट्स से मूल रूप से तैयार की गई 25 रूसी कार्य विशिष्टताएँ शामिल हैं, जिसे वास्तविक रखरखाव कार्यों पर उत्पाद-ग्रेड कोडिंग एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जबकि डेटा संदूषण प्रतिरोध सुनिश्चित करना और कठोर सांख्यिकीय विश्लेषण एवं प्रक्षेपवक्र ऑडिटिंग के माध्यम से तैनात सिस्टम व्यवहारों में महत्वपूर्ण अंतर्दृष्टि को प्रकट करना भी इसका उद्देश्य है।

Evgeny Shilov (Independent Researcher)2026-07-08