🤖 machine learning

Mechanistically Eliciting Latent Behaviors in Language Models

यह शोध पत्र कॉज़ल पर्टर्बेटिव एलिसिटेशन (CPE) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised), डेटा-कुशल विधि है जो विविध लेटेंट व्यवहारों (latent behaviors) को उजागर करने में सक्षम व्याख्या योग्य लो-रैंक एडेप्टर्स (low-rank adapters) की खोज के लिए टेंसर डिकंपोजिशन का उपयोग करता है, जिसमें जटिल तर्क और सैंडबैगिंग (sandbagging) या अलाइनमेंट-फेकिंग (alignment-faking) जैसे छिपे हुए विफलता मोड शामिल हैं, जिससे यह एआई सुरक्षा मूल्यांकन और अलाइनमेंट के लिए एक शक्तिशाली उपकरण प्रदान करता है।

Andrew Mack, Nina Panickssery, Alexander Matt Turner2026-06-30
🤖 machine learning

Does Role Specialization Matter for Explanation Faithfulness in Mixture-of-Experts?

यह शोध पत्र यह प्रदर्शित करता है कि जबकि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर में संरचनात्मक भूमिका अपघटन (structural role decomposition) निष्ठापूर्ण स्पष्टीकरण की गारंटी नहीं देता है, विशेषज्ञों के बीच ओवरलैप को कम करने के लिए प्रतिनिधित्व-स्तर के डिकोरिलेशन नियमितीकरण (representation-level decorrelation regularization) को पेश करने से कार्य प्रदर्शन से समझौता किए बिना मल्टीमॉडल बेंचमार्क में स्पष्टीकरण की निष्ठा में महत्वपूर्ण सुधार होता है।

Yeji Kim, Housam Babiker, Mi-Young Kim, Randy Goebel2026-06-30
⚛️ quantum physics

Lie Group Diffusion Models for Hardware-Aware Quantum Circuit Synthesis

यह शोध पत्र एक हार्डवेयर-जागरूक क्वांटम सर्किट संश्लेषण ढांचे को प्रस्तुत करता है जो उच्च-सटीक, बाधा-अनुपालन क्वांटम सर्किट उत्पन्न करने के लिए एक डिस्क्रीट सर्किट स्केलेटन सेलेक्टर को SU(2)SU(2) मैनिफोल्ड पर एक निरंतर ली ग्रुप डिफ्यूजन मॉडल के साथ जोड़ता है, जो मौजूदा बेसलाइन से बेहतर प्रदर्शन करते हैं।

Jyotirmai Singh2026-06-30
🤖 machine learning

t-STEP: An interpretable model for Total Electron Content predictions and irregularities estimations

यह शोध पत्र t-STEP को प्रस्तुत करता है, जो एक व्याख्यात्मक मशीन लर्निंग मॉडल है जो आयनमंडलीय अनियमितताओं को सटीक रूप से पकड़ने के लिए 30-सेकंड के रिज़ॉल्यूशन पर कुल इलेक्ट्रॉन सामग्री (Total Electron Content) की भविष्यवाणी करता है और विशेष रूप से भू-चुंबकीय तूफानों के दौरान IRI-2020 और अटेंशन-आधारित LSTM जैसे मौजूदा बेंचमार्क से बेहतर प्रदर्शन करता है।

Stephen Tete, Carl Shneider, Maxime Cordy, Claudio Cesaroni, Andreas Hein, Vasily Petrov2026-06-30
🤖 machine learning

Fuzzing Large Language Models to Elicit Hidden Behaviours

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में छिपे हुए "स्लीपर एजेंट" व्यवहारों को उजागर करने के लिए वेट्स (weights) या एक्टिवेशन्स (activations) में शोर (noise) इंजेक्ट करके एक व्यवस्थित फज़िंग दृष्टिकोण प्रस्तुत करता है, जो यह प्रदर्शित करता है कि यह टेम्परेचर सैंपलिंग से बेहतर प्रदर्शन करता है और एक सस्ते प्रॉक्सी कार्य के माध्यम से हाइपरपैरामीटर चयन, यूनिफॉर्म स्वीप की तुलना में इलिकिटेशन रेट (elicitation rates) में महत्वपूर्ण सुधार करता है।

Mohammed Abu Baker, Lakshmi Babu-Saheer2026-06-30
⚛️ quantum physics

A Machine-Verified Proof of a Quantum-Optimization Conjecture

यह शोध पत्र क्लॉड फेबल 5 भाषा मॉडल और लीन 4 प्रूफ़ असिस्टेंट के बीच एक सहयोगात्मक फीडबैक लूप के माध्यम से प्राप्त 'रिंग ऑफ डिसएग्रीज़' पर QAOA एप्रोक्सिमेशन रेशियो के संबंध में दशक पुराने फारी-गोल्डस्टोन-गुटमैन अनुमान के मशीन-सत्यापित समाधान की रिपोर्ट करता है, जिसने प्रमाण को निर्मित करने के लिए एक छिपे हुए डायनेमिकल सिमिट्री (गतिशील समरूपता) का अनावरण किया।

Uri Kol, Maor Ben-Shahar, Kfir Sulimany, Dirk Englund2026-06-30
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

यह शोध पत्र IG-Lens प्रस्तुत करता है, जो एक नवीन विधि है जो एक एकल पथ (single path) के साथ टेलोस्कोपिंग इंटीग्रेटेड ग्रेडिएंट्स (telescoping Integrated Gradients) को लागू करके ट्रांसफॉर्मर परतों में सटीक, योगात्मक संभाव्यता एट्रिब्यूशन (additive probability attribution) प्राप्त करती है, जिससे मौजूदा लॉजिट-आधारित या गैर-योगात्मक रीडआउट टूल्स की गैर-रैखिकता और पूर्वाग्रह सीमाओं को पार करते हुए बिना विविक्तीकरण त्रुटि (discretization error) के पूर्णता सुनिश्चित की जाती है।

Duc Anh Nguyen2026-06-30
💬 NLP

ARMOR: Adaptive Retriever Optimization for Low-Resource Telecom Question Answering

यह शोध पत्र ARMOR को पेश करता है, जो एक एडेप्टिव रिट्रीवर ऑप्टिमाइज़ेशन विधि है जो कम-संसाधन वाले टेलीकॉम प्रश्न उत्तर (question answering) को बेहतर बनाने के लिए जनरेटर के बजाय क्वेरी एनकोडर को ट्यून करने हेतु लेटेंट-डॉक्यूमेंट RAG लाइकलीहुड और InfoNCE कॉन्ट्रास्टिव ऑब्जेक्टिव्स को रेगुलराइजेशन के साथ संयुक्त रूप से उपयोग करता है।

Heshan Fernando, Quan Xiao, Yan Xin, Tianyi Chen2026-06-30
💬 NLP

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

यह शोध पत्र SEVA को प्रस्तुत करता है, जो एक स्व-विकसित सत्यापन एजेंट (self-evolving verification agent) है, जो एक संरचित, बहु-घटक आउटपुट सिस्टम को प्रशिक्षित करने के लिए प्रोसेस रिवॉर्ड मैकेनिज्म का उपयोग करके अपारदर्शी बाइनरी फैक्ट-चेकिंग की सीमाओं को दूर करता है, जिससे निरंतर स्व-सुधार संभव होता है जो ऑडिट योग्य तर्क और GPT-4o-mini के तुलनीय प्रदर्शन वाले बेंचमार्क-विशेषज्ञ मॉडल प्रदान करता है।

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao2026-06-30
🤖 machine learning

A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

यह शोध पत्र इवैल्यूएटर-प्रेफरेंस कोलैप्स (EPC) फ्रेमवर्क को प्रोप्राइटरी LLM इवैल्यूएटर्स की समय के साथ होने वाली तीव्र अस्थिरता और "प्रेफरेंस कोलैप्स" को निदान करने और मापने के लिए प्रस्तुत करता है, जो व्यापक बहु-शर्त ऑडिट के माध्यम से यह प्रदर्शित करता है कि वर्ज़न-कंडीशनल ड्रिफ्ट के कारण सिंगल-स्नैपशॉट इवैल्यूएशन अध्ययन मौलिक रूप से अविश्वसनीय हैं।

Liu Zewen2026-06-30