🤖 AI

WinDOM: Self-Family Distillation for Small-Model GUI Grounding

WinDOM एक स्व-पर्यवेक्षित (self-supervised) ढांचे को पेश करता है जो छोटे GUI-ग्राउंडिंग एजेंटों के लिए एक DOM-हार्वेस्टेड प्रशिक्षण संग्रह को सेल्फ-फैमिली डिस्टिलेशन और सुदृढीकरण लर्निंग (Reinforcement Learning) के साथ जोड़ता है, जो यह प्रदर्शित करता है कि एक कम-संतृप्त कोल्ड-स्टार्ट इनिशियलाइज़ेशन बाहरी शिक्षकों या मानव एनोटेशन की आवश्यकता के बिना छोटे मॉडलों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Chengheng Li-Chen, Zhiqian Zhou, Hao Chen, Nicolas Chauvin2026-06-25
🤖 machine learning

Improving Neural Network Training by Decoupling the Magnitude and Direction of Weight Vectors

यह शोध पत्र मैग्नीट्यूड-डायरेक्शन (MD) डिकपलिंग पेश करता है, जो एक ऑप्टिमाइज़र संशोधन है जो वेट मैट्रिसेस को फिक्स्ड-नॉर्म दिशाओं और अलग-अलग दरों पर अपडेट होने वाले सीखने योग्य मैग्नीट्यूड्स में विभाजित करता है, जिससे विभिन्न मॉडल आर्किटेक्चर और ऑप्टिमाइज़र केAcross प्रशिक्षण गतिकी (ट्रेनिंग डायनेमिक्स) को स्थिर किया जाता है और वेट डिके व वार्मअप की आवश्यकता को समाप्त किया जाता है।

Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi2026-06-25
🤖 AI

InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

यह शोध पत्र InvestPhilBench प्रस्तुत करता है, जो एक बहु-स्तरीय गतिशील बेंचमार्क है जिसे विशेषज्ञ निवेश निर्णय ढांचों को पुनर्गठित करने और लागू करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि जबकि मिश्रित स्वचालित स्कोर अक्सर प्रवाहपूर्ण गद्य को पुरस्कृत करते हैं, विशिष्ट प्रक्रियात्मक मेट्रिक्स सीमावर्ती मॉडल्स (फ्रंटियर मॉडल्स) में भी महत्वपूर्ण तर्क संबंधी कमियों को उजागर करते हैं।

Mingguang Chen, Bo Qu2026-06-25
💰 quantitative finance

The Inference-Compute Frontier and a Latency-Efficient Architecture for Limit Order Book Prediction

यह शोध पत्र प्रदर्शित करता है कि लिमिट ऑर्डर बुक प्रेडिक्शन (limit order book prediction) एक लेटेंसी-आधारित (latency-based) के बजाय एक पावर-लॉ इन्फरेंस-कंप्यूट फ्रंटियर (power-law inference-compute frontier) का अनुसरण करता है, जो FastBiNLOB के विकास को प्रेरित करता है, जो एक हार्डवेयर-कुशल आर्किटेक्चर है और मौजूदा मॉडलों की तुलना में काफी कम लेटेंसी के साथ अत्याधुनिक मैक्रो-F1 प्रदर्शन प्राप्त करता है।

C. Evans Hedges2026-06-25
🤖 machine learning

Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization

यह शोध पत्र HiReLC को प्रस्तुत करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो लो-लेवल पर-ब्लॉक एजेंटों को हाई-लेवल ग्लोबल बजट आवंटन के साथ समन्वित करके डीप न्यूरल नेटवर्क के संयुक्त क्वांटाइजेशन और स्ट्रक्चर्ड प्रूनिंग को स्वचालित करता है, जो विजन ट्रांसफार्मर और सीएनएन बेंचमार्क में प्रतिस्पर्धी सटीकता बनाए रखते हुए महत्वपूर्ण संपीड़न अनुपात (5.99–6.72×) प्राप्त करने के लिए सरोगेट मॉडल के साथ एक सक्रिय शिक्षण लूप का उपयोग करता है।

Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj, Aissa Boulmerka, Nadir Farhi2026-06-25
🤖 machine learning

Is Variational Monte Carlo Robust? Sharp Moment Thresholds and Heavy-tailed Stochastic Optimization

यह शोधपत्र प्रदर्शित करता है कि वेरिएशनल मोंटे कार्लो अनुकूलन (Variational Monte Carlo optimization) स्वाभाविक रूप से नोडल ज्यामिति (nodal geometry) द्वारा नियंत्रित होता है, जिसके परिणामस्वरूप अक्सर भारी-पूंछ वाले अनुमानक (heavy-tailed estimators) प्राप्त होते हैं जिनमें उच्च क्षण (higher moments) का अभाव होता है, और एक नया सुदृढ़ संस्करण प्रस्तावित करता है जिसे PS-Clip-VMC कहा जाता है जो स्थानीय ऊर्जा और ग्रेडिएंट अनुमानों दोनों को क्लिपिंग (clipping) करके अभिसरण (convergence) प्राप्त करता है।

Philipp Grohs, Davide Nobile2026-06-25
🔬 condensed matter

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

यह शोध पत्र "नेचुरल अनग्रॉकिंग" (natural ungrokking) को प्रस्तुत करता है, जो एक ऐसी घटना है जहाँ भाषा मॉडल प्रीट्रेनिंग के दौरान स्वतः ही विशिष्ट नियमों को सीख लेते हैं और फिर उन्हें अचानक भूल जाते हैं क्योंकि प्रशिक्षण कॉर्पस में नियम-समर्थक साक्ष्य की आवृत्ति किसी नियम के अस्तित्व को निर्धारित करती है, एक ऐसी प्रक्रिया जो विषम नियंत्रण (asymmetric control) द्वारा अभिलक्षित है जहाँ एक नियम को नष्ट करना आसान है लेकिन उसे पुन: स्थापित करना असंभव है।

Juliana Li, Diya Sreedhar2026-06-25
🤖 AI

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

यह शोध पत्र "अनफायरेबल सेफ्टी कर्नेल" (Unfireable Safety Kernel) का प्रस्ताव और सत्यापन करता है, जो एक रस्ट-आधारित (Rust-based), औपचारिक रूप से सत्यापित निष्पादन-समय संरेखण परत है, जो स्व-संशोधित प्रणालियों में एस्केप प्रयासों को रोकने के लिए एआई एजेंट के एड्रेस स्पेस के बाहर आर्किटेक्चरल सुरक्षा नियंत्रणों को लागू करती है, जिससे उन प्रतिकूल बायपासों को 100% अस्वीकार करने में सफलता मिलती है जहाँ पारंपरिक इन-प्रोसेस गार्डरेल्स विफल हो जाते हैं।

Seth Dobrin, Łukasz Chmiel2026-06-25
🤖 machine learning

Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents

यह शोधपत्र "प्रोग्रेस एडवांटेज" (progress advantage) को प्रस्तुत करता है, जो कि RL-प्रशिक्षित और संदर्भ नीतियों के लॉग-संभाव्यता अनुपात (log-probability ratio) से सीधे प्राप्त एक एनोटेशन-मुक्त, डोमेन-अज्ञेय (domain-agnostic), स्टेप-स्तरीय स्कोरिंग सिग्नल है, जो LLM एजेंटों के टेस्ट-टाइम स्केलिंग, अनिश्चितता परिमाणीकरण (uncertainty quantification), और विफलता एट्रिब्यूशन कार्यों में समर्पित रिवॉर्ड मॉडल और कॉन्फिडेंस-आधारित बेसलाइन से बेहतर प्रदर्शन करता है।

Changdae Oh, Wendi Li, Seongheon Park, Samuel Yeh, Tanwi Mallick, Sharon Li2026-06-25
🤖 machine learning

On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity

यह शोध पत्र प्रकट करता है कि जहाँ सैम्पल्ड प्रदर्शनों (sampled demonstrations) के साथ ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (on-policy self-distillation) मजबूत पास@1 सटीकता प्राप्त करता है, वहीं यह अनजाने में कंपाउंडिंग फीडबैक (compounding feedback) के माध्यम से मौजूदा मॉडल पूर्वाग्रहों को बढ़ाकर आउटपुट विविधता को कम कर देता है और पास@k प्रदर्शन को सपाट कर देता है, जिससे अंततः आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों के लिए विविध रणनीतियाँ उत्पन्न करने की मॉडल की क्षमता सीमित हो जाती है।

Andrei Liviu Nicolicioiu, Mohammad Pezeshki, Aaron Courville2026-06-25