🤖 machine learning

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

यह शोध पत्र यह प्रदर्शित करता है कि प्री-ट्रेंड हिडन स्टेट्स (pre-trained hidden states) से व्युत्पन्न एक सरल, रिप्रेजेंटेशन-आधारित डाइवर्सिटी बोनस को इन्फरेंस-टाइम सैंपलिंग और पोस्ट-ट्रेनिंग रीइन्फोर्समेंट लर्निंग दोनों में शामिल करने से भाषा मॉडल के प्रदर्शन और सैंपल दक्षता में महत्वपूर्ण वृद्धि होती है, क्योंकि यह मौजूदा व्यवहारों को केवल परिष्कृत करने के बजाय नवीन व्यवहारों की खोज को बढ़ावा देता है।

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash2026-07-16
🤖 AI

Benefits and Limitations of Communication in Multi-Agent Reasoning

यह शोध पत्र मल्टी-एजेंट रीजनिंग सिस्टम की अभिव्यक्तता (expressivity) का विश्लेषण करने के लिए एक सैद्धांतिक ढांचा प्रस्तावित करता है, जो विशिष्ट एल्गोरिद्मिक कार्यों के लिए एजेंटों की संख्या, संचार आवश्यकताओं और स्पीडअप पर सीमाएं (bounds) निर्धारित करता है, और बड़े भाषा मॉडलों (large language models) पर अनुभवजन्य प्रयोगों के माध्यम से इन सैद्धांतिक ट्रेडऑफ़्स को मान्य करता है।

Michael Rizvi-Martel, Satwik Bhattamishra, Neil Rathi, Guillaume Rabusseau, Michael Hahn2026-07-16
📊 statistics

Adaptive Conformal Inference through the Lens of Blackwell Approachability

यह शोध पत्र एडेप्टिव कॉन्फॉर्मल इन्फरेंस को एक रिपीटेड गेम के रूप में पुनर्गठित करता है और एक ब्लैकवेल अप्रोचेबिलिटी-आधारित रणनीति पेश करता है जो वैधता की गारंटी देने के साथ-साथ अंतर्निहित डेटा स्टोकेस्टिसिटी के अनुसार प्रेडिक्शन सेट की दक्षता को अनुकूलित करती है, जिससे एक्सचेंजएबल, एडवर्सरियल और इंटरमीडिएट टाइम-सीरीज सेटिंग्स में इष्टतम प्रदर्शन प्राप्त होता है।

Guillaume Principato, Gilles Stoltz2026-07-16
💬 NLP

Value Drifts: Tracing Value Alignment During LLM Post-Training

यह शोध पत्र LLM पोस्ट-ट्रेनिंग के दौरान वैल्यू अलाइनमेंट (मूल्य संरेखण) की गतिशीलता की जांच करता है, जो यह प्रकट करता है कि सुपरवाइज्ड फाइन-ट्यूनिंग मुख्य रूप से एक मॉडल के मूल्यों को स्थापित करती है जबकि बाद का प्रेफरेंस ऑप्टिमाइज़ेशन शायद ही कभी उन्हें पुन: संरेखित करता है, जिसमें अलग-अलग एल्गोरिदम समान डेटासेट पर भी भिन्न परिणाम देते हैं।

Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy2026-07-16
🤖 AI

Machine and Deep Learning for Indoor UWB Jammer Localization

यह शोध पत्र दो नवीन डेटासेट पेश करके और एक डोमेन-एडवर्सरियलियल (domain-adversarial) ConvNeXt ऑटोएन्कोडर प्रस्तावित करके बदलते पर्यावरणीय परिस्थितियों के तहत इनडोर UWB जैमर स्थानीयकरण की चुनौती को संबोधित करता है, जो गैर-एडवर्सरियल बेसलाइन की तुलना में ट्रांसफ़रेबिलिटी में महत्वपूर्ण सुधार करता है और स्थानीयकरण त्रुटि को कम करता है।

Hamed Fard, Mahsa Kholghi, Benedikt Groß, Gerhard Wunder2026-07-16
🤖 machine learning

Power Homotopy for Zeroth-Order Non-Convex Optimizations

यह शोध पत्र GS-PowerHP को प्रस्तुत करता है, जो एक ज़ीरो-ऑर्डर अनुकूलन विधि है जो वैश्विक अन्वेषण (global exploration) और स्थानीय परिशोधन (local refinement) को गतिशील रूप से संतुलित करने के लिए पावर-स्मूथेड होमोटोपी ढांचे के भीतर एक वृद्धिशील रूप से घटते हुए स्मूथिंग रेडियस का उपयोग करती है, जिससे यह उच्च-आयामी प्रतिकूल हमलों (high-dimensional adversarial attacks) जैसे गैर-उत्तल अनुकूलन कार्यों में फिक्स्ड-स्मूथिंग बेसलाइनों से बेहतर प्रदर्शन करती है।

Chen Xu2026-07-16
🤖 machine learning

Lag Operator SSMs: A Geometric Framework for Structured State Space Modeling

यह शोध पत्र स्ट्रक्चर्ड स्टेट स्पेस मॉडल्स (SSMs) के लिए एक नवीन ज्यामितीय ढांचे को प्रस्तुत करता है जो डोमेन विस्तार के माध्यम से सीधे डिस्क्रीट-टाइम पुनरावृत्तियों (recurrences) को व्युत्पन्न करने के लिए एक लैग ऑपरेटर का उपयोग करता है, जो आधार कार्यों (basis functions) और टाइम-वारपिंग स्कीम्स को एकीकृत करते हुए पारंपरिक निरंतर-से-विस्क्रीट मॉडलिंग का एक लचीला, मॉड्यूलर विकल्प प्रदान करता है और HiPPO जैसे स्थापित मॉडलों को पुनः प्राप्त करता है।

Sutashu Tomonaga, Kenji Doya, Noboru Murata2026-07-16
🤖 machine learning

Reliable Hierarchical Operating System Fingerprinting via Conformal Prediction

यह शोध पत्र OS फिंगरप्रिंटिंग में फ्लैट क्लासिफिकेशन की सीमाओं को संबोधित करने के लिए दो संरचित कॉन्फॉर्मल प्रेडिक्शन रणनीतियों, लेवल-वाइज CP और प्रोजेक्शन-आधारित CP को पेश करता है और उनका मूल्यांकन करता है, जो पूर्व के अधिक सटीक, मानव-अनुकूल प्रेडिक्शन सेट्स और उत्तर के संरचनात्मक रूप से सुसंगत, नीति-तैयार सेट्स के बीच एक मौलिक ट्रेड-ऑफ को प्रदर्शित करके किया गया है।

Rubén Pérez-Jove, Osvaldo Simeone, Alejandro Pazos, Jose Vázquez-Naya2026-07-16
🤖 machine learning

Factorization Machine with Quadratic-Optimization Annealing for RNA Inverse Folding and Evaluation of Binary-Integer Encoding and Nucleotide Assignment

यह अध्ययन RNA इन्वर्स फोल्डिंग के लिए एक फैक्टरिज़ेशन मशीन विद क्वाड्रेटिक-ऑप्टिमाइज़ेशन एनीलिंग (FMQA) फ्रेमवर्क प्रस्तावित करता है और प्रदर्शित करता है कि विशिष्ट न्यूक्लियोटाइड-टू-इंटीजर असाइनमेंट को डोमेन-वॉल एनकोडिंग के साथ संयोजित करने से समाधान की गुणवत्ता में महत्वपूर्ण सुधार होता है, जो स्टेम क्षेत्रों में गुआनिन और साइटोसिन से समृद्ध थर्मोडायनामिक रूप से स्थिर संरचनाओं को बढ़ावा देता है।

Shuta Kikuchi, Shu Tanaka2026-07-16
📊 statistics

A plug-and-play approach with fast uncertainty quantification for weak lensing mass mapping

यह शोध पत्र PnPMass को प्रस्तुत करता है, जो वीक-लेंसिंग मास मैपिंग के लिए एक लचीला और कुशल प्लग-एंड-प्ले फ्रेमवर्क है, जो तेज़ पुनर्निर्माण के लिए एक एकल प्रशिक्षित डीप-लर्निंग मॉडल को ग्रेडिएंट डिसेंट के साथ और कैलिब्रेटेड अनसर्टेन्टी क्वांटिफिकेशन के लिए कॉन्फॉर्मल प्रेडिक्शन के साथ जोड़ता है, जो इसे आगामी बड़े पैमाने के कॉस्मोलॉजिकल सर्वेक्षणों के लिए उपयुक्त बनाता है।

Hubert Leterme, Andreas Tersenov, Jalal Fadili, Jean-Luc Starck2026-07-16