🤖 machine learning

Decomposer: Learning to Decompile Symbolic Music to Programs

यह शोध पत्र Decomposer को प्रस्तुत करता है, जो एक दो-चरणीय पोस्ट-ट्रेनिंग फ्रेमवर्क है जो सिंथेटिक डेटा और सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके प्रतीकात्मक MIDI संगीत को पठनीय, निष्पादन योग्य स्ट्रूडल (Strudel) प्रोग्राम में प्रभावी ढंग से डिकंपाइल करता है, जो पुनर्निर्माण सटीकता और कोड गुणवत्ता दोनों में मौजूदा मॉडलों से बेहतर प्रदर्शन करता है।

Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue2026-07-03
🤖 AI

Has This Checkpoint Been Abliterated? A Two-Signal Audit and Its Failure Map

यह शोधपत्र एक थ्रेशोल्ड-मुक्त, दो-सिग्नल ऑडिट पद्धति प्रस्तावित करता है जो स्ट्रिप्ड-रिफ्यूज़ल ("एब्लिटरेटेड") और बेनाइन फाइन-ट्यून्ड एलएलएम चेकपॉइंट्स के बीच उच्च सटीकता के साथ प्रभावी ढंग से अंतर करने के लिए रेफरेंस-एंकरड एक्टिवेशन गैप्स और वेट-रिकवरी एनर्जी को संयोजित करती है, जबकि स्पूफ्ड रेफरेंसेस और व्हाइट-बॉक्स इवेजन के विरुद्ध इसकी सीमाओं को भी स्वीकार करती है।

Gabriel Hurtado2026-07-03
🤖 AI

Safety Targeted Embedding Exploit via Refinement

यह शोध पत्र STEER को प्रस्तुत करता है, जो एक ग्रेडिएंट-गाइडेड हमला है जो कम-संसाधन वाली भाषाओं में सुरक्षा प्रशिक्षण अंतराल का लाभ उठाने के लिए इनकार-प्रेरित (refusal-inducing) शब्दों को पुनरावृत्ति रूप से अनुवादित करता है ताकि बहुभाषी लार्ज लैंग्वेज मॉडल्स के सुरक्षा तंत्रों को बायपास किया जा सके, जिससे उच्च हमला सफलता दर प्राप्त होती है और यह प्रदर्शित होता है कि अंग्रेजी-केंद्रित सुरक्षा संरेखण विविध भाषाई इनपुट पर सामान्य होने में विफल रहता है।

Joshua Adrian Cahyono2026-07-03
🤖 AI

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

यह अन्वेषणात्मक अध्ययन 2021 से 2025 तक कंपनी- और समुदाय-प्रबंधित रिपॉजिटरीज़ में LLM-जनित कोड और टिप्पणियों का विश्लेषण करता है, जिससे यह पता चलता है कि जहाँ पता लगाया गया LLM कोड समय के साथ कम हुआ है और उच्च क्लोनिंग दरों वाले टेस्ट केसेस में प्रचलित है, वहीं LLM-जनित टिप्पणियाँ स्थिर बनी हुई हैं लेकिन अक्सर व्याकरणिक रूप से त्रुटिपूर्ण होती हैं, और मानव-लेबल वाले बग्स का LLM-जनित कोड के साथ केवल एक छोटा संबंध दिखता है।

Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang2026-07-03
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach एक स्व-विकसित रूब्रिक फ्रेमवर्क है जो वास्तविक रोलआउट्स से प्रक्रिया-उन्मुख मानदंडों को व्युत्पन्न करके LLM एजेंटों के मूल्यांकन और प्रशिक्षण में सुधार करता है ताकि कौशल चयन, अनुपालन, संयोजन और प्रतिबिंब का आकलन किया जा सके, जिससे वास्तविक प्रक्रिया गुणवत्ता को आकस्मिक कार्य सफलता से अलग किया जा सके।

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue2026-07-03
🤖 AI

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

यह शोध पत्र SAB-LVLM को प्रस्तुत करता है, जो लार्ज विजन-लैंग्वेज मॉडल्स के लिए एक नवीन बाइनराइजेशन फ्रेमवर्क है जो हेसियन-आधारित स्थानिक महत्व मानचित्रों (Hessian-based spatial significance maps) और एक मोडैलिटी-गाइडेड इंटीग्रेशन रणनीति का उपयोग करता है ताकि बाइनराइजेशन त्रुटियों को गतिशील रूप से पुनर्रweight किया जा सके, जिससे मौजूदा विधियों की तुलना में संसाधन-बाधित उपकरणों पर संपीड़न प्रदर्शन में महत्वपूर्ण सुधार होता है।

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu (…)2026-07-03
🤖 machine learning

Rank-Then-Act: Reward-Free Control from Frame-Order Progress

यह शोध पत्र रैंक-देन-एक्ट (RTA) प्रस्तुत करता है, जो एक रिवॉर्ड-फ्री कंट्रोल फ्रेमवर्क है जो एक विजन-लैंग्वेज मॉडल को बिखरे हुए वीडियो फ्रेम्स से टेम्पोरल प्रोग्रेस सीखने के लिए प्रशिक्षित करता है और स्पष्ट एनवायरनमेंट रिवॉर्ड्स के बिना स्थिर पॉलिसी लर्निंग और क्रॉस-टास्क ट्रांसफर सक्षम करने के लिए स्पीरमैन रैंक कोरिलेशन-आधारित रिवॉर्ड सिग्नल का उपयोग करता है।

Yuriy Maksyuta, George Bredis, Ruslan Rakhimov, Daniil Gavrilov2026-07-03
🤖 machine learning

Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs

यह शोध पत्र सेमी-सुपरवाइज्ड GANs के लिए एक जनसंख्या-आधारित बहु-उद्देश्यीय विकासवादी प्रशिक्षण रणनीति प्रस्तावित करता है जो वर्गीकरण सटीकता और वास्तविक/नकली भेदभाव के बीच संतुलन तलाशने के लिए पारेटो डोमिनेंस द्वारा रैंक किए गए डिस्क्रिमिनेटर्स की एक जनसंख्या को बनाए रखता है, जिससे प्रशिक्षण की मजबूती में सुधार होता है और अत्याधुनिक बेसलाइनों की तुलना में बेहतर वर्गीकरण प्रदर्शन प्राप्त होता है।

Francisco Sedeño, Francisco Chicano, Jamal Toutouh2026-07-03
🤖 machine learning

Conditional Co-Ablation: Recovering Self-Repair Backups in Transformer Circuits

यह शोध पत्र कंडीशनल को-एब्लेशन (CoAx) प्रस्तुत करता है, जो एक लेबल-मुक्त विधि है जो प्राथमिक घटकों को हटाने के बाद उनके महत्व में होने वाली वृद्धि को मापकर ट्रांसफॉर्मर सर्किटों में सुप्त बैकअप घटकों का पता लगाती है, जिससे आत्म-मरम्मत तंत्र (self-repair mechanisms) द्वारा उत्पन्न भ्रामक एट्रिब्यूशन पर विजय प्राप्त होती है और अधिक प्रभावी मॉडल प्रूनिंग और क्षमता नॉकआउट (capability knockout) सक्षम होता है।

Zhiren Gong, Zihao Zeng, Chau Yuen, Wei Yang Bryan Lim2026-07-03
🤖 machine learning

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

यह शोध पत्र MediMeta-C डेटासेट का उपयोग करके मेडिकल इमेज क्वालिटी असेसमेंट पर 16 विजन-लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि वे पिक्सेलेशन जैसे इमेज करप्शन के प्रति संवेदनशील हैं और टेक्स्टुअल मेटाडेटा से महत्वपूर्ण पूर्वाग्रह प्रदर्शित करते हैं, लेकिन गोपनीयता-विश्वसनीयता ट्रेड-ऑफ और वस्तुनिष्ठता के संबंध में उनकी वर्तमान सीमाएं तत्काल नैदानिक तैनाती में बाधा डालती हैं।

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer2026-07-03