🤖 machine learning

Expander Sparse Autoencoders: Parameter-Efficient Dictionaries for Mechanistic Interpretability

यह शोध पत्र एक्सपैंडर स्पार्स ऑटोएनकोडर (Expander Sparse Autoencoders) का परिचय देता है, जो एक पैरामीटर-कुशल संस्करण है जो उच्च फीचर रिकवरी फिडेलिटी बनाए रखते हुए और पहचान क्षमता (identifiability) तथा सटीक सपोर्ट रिकवरी के लिए सैद्धांतिक गारंटी प्रदान करते हुए डिकोडर स्टोरेज और कम्प्यूटेशनल लागत को नाटकीय रूप से कम करने के लिए लेफ्ट-dd-रेगुलर एक्सपैंडर मास्क का उपयोग करता है।

Rodrigo Mendoza-Smith2026-07-03
🤖 AI

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

यह शोध पत्र MMBench-Live को प्रस्तुत करता है, जो एक निरंतर विकसित होने वाला मल्टीमॉडल बेंचमार्क है, जिसे एक मल्टी-एजेंट स्वचालित पाइपलाइन द्वारा संचालित किया जाता है जो वितरण निरंतरता (distribution consistency) को बनाए रखते हुए और डेटा संदूषण (data contamination) को कम करते हुए लागत प्रभावी, उच्च गुणवत्ता वाले मूल्यांकन उदाहरण उत्पन्न करता है।

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma2026-07-03
🤖 AI

MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support

यह शोध पत्र MMIR-TCM प्रस्तुत करता है, जो पारंपरिक चीनी चिकित्सा निदान में व्यक्तिपरकता और डेटा की कमी की चुनौतियों से निपटने के लिए मेमोरी-ऑगमेंटेड सेगमेंटेशन, फाइन-ट्यून्ड मल्टीमॉडल विजन-लैंग्वेज मॉडल और रिट्रीवल-ऑगमेंटेड जनरेशन को संयोजित करने वाला एक नवीन ढांचा है, जिसे एक नए बड़े पैमाने के डेटासेट (MedTCM) और एक विशेष मूल्यांकन मीट्रिक (TDEU) पर मान्य किया गया है जो अग्रणी एआई मॉडलों से बेहतर प्रदर्शन करता है।

Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi (…)2026-07-03
🤖 AI

Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge

यह शोध पत्र "प्री-फ्लाइट" (Pre-Flight) का परिचय देता है, जो विमानन परिचालन ज्ञान पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए डिज़ाइन किए गए 300 विशेषज्ञ-लिखित बहुविकल्पीय प्रश्नों का एक ओपन-सोर्स बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान में सबसे उन्नत मॉडल भी विशेषज्ञ-स्तर की विश्वसनीयता में काफी पीछे हैं और विमानन में जिम्मेदार एआई परिनियोजन के लिए डोमेन-विशिष्ट मूल्यांकन की आवश्यकता को रेखांकित करता है।

Alex Brooker, Tim Hughes2026-07-03
🤖 AI

Actual causality in fault trees

यह शोध पत्र फॉल्ट ट्रीज़ (fault trees) पर हल्पर्न और पर्ल के वास्तविक कार्य-कारण (actual causality) के सिद्धांत को लागू करता है, जो न्यूनतम कट सेट्स (minimal cut sets) को वास्तविक कारणों से जोड़कर प्रभावी विफलता निदान (failure diagnostics) सक्षम करने के लिए पेड़ों के संरचनात्मक और तार्किक गुणों के आधार पर कारण संबंधी धारणाओं का एक पूर्ण वर्गीकरण प्रदान करता है।

Georgiana Caltais, Milan Lopuhaä-Zwakenberg, Mariëlle Stoelinga2026-07-03
🤖 machine learning

Decomposer: Learning to Decompile Symbolic Music to Programs

यह शोध पत्र Decomposer को प्रस्तुत करता है, जो एक दो-चरणीय पोस्ट-ट्रेनिंग फ्रेमवर्क है जो सिंथेटिक डेटा और सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके प्रतीकात्मक MIDI संगीत को पठनीय, निष्पादन योग्य स्ट्रूडल (Strudel) प्रोग्राम में प्रभावी ढंग से डिकंपाइल करता है, जो पुनर्निर्माण सटीकता और कोड गुणवत्ता दोनों में मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue2026-07-03
🤖 AI

Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map

यह शोधपत्र एक थ्रेशोल्ड-मुक्त, दो-सिग्नल ऑडिट पद्धति प्रस्तावित करता है जो स्ट्रिप्ड-रिफ्यूज़ल ("एब्लिटरेटेड") और बेनाइन फाइन-ट्यून्ड एलएलएम चेकपॉइंट्स के बीच उच्च सटीकता के साथ प्रभावी ढंग से अंतर करने के लिए रेफरेंस-एंकरड एक्टिवेशन गैप्स और वेट-रिकवरी एनर्जी को संयोजित करती है, जबकि स्पूफ्ड रेफरेंसेस और व्हाइट-बॉक्स इवेजन के विरुद्ध इसकी सीमाओं को भी स्वीकार करती है।

Gabriel Hurtado2026-07-03
🤖 AI

Safety Targeted Embedding Exploit via Refinement

यह शोध पत्र STEER को प्रस्तुत करता है, जो एक ग्रेडिएंट-गाइडेड हमला है जो कम-संसाधन वाली भाषाओं में सुरक्षा प्रशिक्षण अंतराल का लाभ उठाने के लिए इनकार-प्रेरित (refusal-inducing) शब्दों को पुनरावृत्ति रूप से अनुवादित करता है ताकि बहुभाषी लार्ज लैंग्वेज मॉडल्स के सुरक्षा तंत्रों को बायपास किया जा सके, जिससे उच्च हमला सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि अंग्रेजी-केंद्रित सुरक्षा संरेखण विविध भाषाई इनपुट पर सामान्य होने में विफल रहता है।

Joshua Adrian Cahyono2026-07-03
🤖 AI

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

यह अन्वेषणात्मक अध्ययन 2021 से 2025 तक कंपनी- और समुदाय-प्रबंधित रिपॉजिटरीज़ में LLM-जनित कोड और टिप्पणियों का विश्लेषण करता है, जिससे यह पता चलता है कि जहाँ पता लगाया गया LLM कोड समय के साथ कम हुआ है और उच्च क्लोनिंग दरों वाले टेस्ट केसेस में प्रचलित है, वहीं LLM-जनित टिप्पणियाँ स्थिर बनी हुई हैं लेकिन अक्सर व्याकरणिक रूप से त्रुटिपूर्ण होती हैं, और मानव-लेबल वाले बग्स का LLM-जनित कोड के साथ केवल एक छोटा संबंध दिखता है।

Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang2026-07-03
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach एक स्व-विकसित रूब्रिक फ्रेमवर्क है जो वास्तविक रोलआउट्स से प्रक्रिया-उन्मुख मानदंडों को व्युत्पन्न करके LLM एजेंटों के मूल्यांकन और प्रशिक्षण में सुधार करता है ताकि कौशल चयन, अनुपालन, संयोजन और प्रतिबिंब का आकलन किया जा सके, जिससे वास्तविक प्रक्रिया गुणवत्ता को आकस्मिक कार्य सफलता से अलग किया जा सके।

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue2026-07-03