🤖 AI

PC Layer: Polynomial Weight Preconditioning for Improving LLM Pre-Training

यह शोध पत्र एक पॉलिनॉमियल वेट प्रीकंडीशनिंग (PC) लेयर पेश करता है जो कम-डिग्री वाले पॉलिनॉमियल्स के माध्यम से वेट सिंगुलर-वैल्यू स्पेक्ट्रा को पुनर्गठित करके LLM प्री-ट्रेनिंग को स्थिर करता है, जिससे मर्ज करने के बाद इन्फरेंस ओवरहेड के बिना ज्यामितीय अभिसरण (geometric convergence) सुनिश्चित होता है और प्रदर्शन में सुधार होता है।

Senmiao Wang, Tiantian Fang, Haoran Zhang, Yushun Zhang, Kunxiang Zhao, Alex Schwing, Ruoyu Sun2026-06-05
💬 NLP

Self-Augmenting Retrieval for Diffusion Language Models

यह शोध पत्र SARDI को प्रस्तुत करता है, जो डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-फ्री रिट्रीवल-ऑगमेंटेड जनरेशन फ्रेमवर्क है, जो डायनेमिक रिट्रीवल को निर्देशित करने के लिए त्याग दिए गए लो-कॉन्फिडेंस टोकन्स को लुकअहेड सिग्नल्स के रूप में उपयोग करता है, और मौजूदा बेसलाइन्स की तुलना में मल्टी-हॉप QA बेंचमार्क्स पर बेहतर प्रदर्शन और 8 गुना तक अधिक थ्रूपुट प्राप्त करता है।

Paul Jünger, Justin Lovelace, Linxi Zhao, Dongyoung Go, Kilian Q. Weinberger2026-06-05
🤖 AI

RREDCoT: Segment-Level Reward Redistribution for Reasoning Models

यह शोध पत्र RREDCoT प्रस्तुत करता है, जो एक नवीन विधि है जो चेन-ऑफ-थॉट (Chain-of-Thought) ट्रेसेस के लिए इष्टतम सेगमेंट-स्तरीय रिवॉर्ड रिडिस्ट्रीब्यूशन (segment-level reward redistribution) को अनुमानित करने के लिए स्वयं रीजनिंग मॉडल का लाभ उठाता है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) फाइन-ट्यूनिंग में पारंपरिक मोंटे कार्लो क्रेडिट असाइनमेंट (Monte Carlo credit assignment) की उच्च विचरणशीलता और कम्प्यूटेशनल अक्षमता का समाधान किया जाता है।

Mykyta Ielanskyi, Kajetan Schweighofer, Lukas Aichberger, Sepp Hochreiter2026-06-05
🤖 AI

Pretraining Recurrent Networks without Recurrence

यह शोध पत्र सुपरवाइज्ड मेमोरी ट्रेनिंग (SMT) को प्रस्तुत करता है, जो एक ऐसी विधि है जो ट्रांसफॉर्मर-आधारित प्रेडिक्टिव स्टेट ऑब्जेक्टिव के माध्यम से मेमोरी अपडेट को क्रेडिट प्रोपेगेशन से अलग करके रिकरेंट न्यूरल नेटवर्क के समानांतर और स्थिर प्रीट्रेनिंग को सक्षम बनाती है, जिससे पारंपरिक बैकप्रोपैगेशन थ्रू टाइम की सीमाओं को दूर किया जा सके।

Akarsh Kumar, Phillip Isola2026-06-05
💬 NLP

Operation-Guided Progressive Human-to-AI Text Transformation Benchmark for Multi-Granularity AI-Text Detection

यह शोध पत्र OpAI-Bench प्रस्तुत करता है, जो एक नया बेंचमार्क है जो प्रगतिशील मानव-से-AI सह-संपादन वर्कफ़्लो का अनुकरण करके कई स्तरों पर AI-टेक्स्ट डिटेक्शन का मूल्यांकन करता है, जिससे यह पता चलता है कि पता लगाने की क्षमता केवल AI-जनित सामग्री के अनुपात से नहीं, बल्कि संपादन कार्यों, डोमेन और संशोधन इतिहास से प्रभावित गैर-एकदिष्ट (non-monotonic) पैटर्न का अनुसरण करती है।

Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tianjun Yao, Xinyi Shang, Yi Tang, Jiacheng Cui, Ahmed Elhagry, Salw (…)2026-06-05
🤖 AI

Regret Minimization with Adaptive Opponents in Repeated Games

यह शोध पत्र रिपीटेड पॉलिसी रिग्रेट (RP-Regret) प्रस्तुत करता है, जो बार-बार खेले जाने वाले खेलों में अनुकूलनशील विरोधियों से निपटने के लिए डिज़ाइन किया गया एक नवीन गेम-थ्योरेटिक मीट्रिक है, और इस गैर-उत्तल (non-convex) रिग्रेट माप को न्यूनतम करने के लिए एल्गोरिदम प्रस्तावित करता है, जिससे सबगेम परफेक्ट इक्विलिब्रियम और अधिक सहकारी परिणामों को सीखना सक्षम हो सके।

Mingyang Liu, Asuman Ozdaglar, Tiancheng Yu, Kaiqing Zhang2026-06-05
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA एक गति-नियंत्रणीय विजन-लैंग्वेज-एक्शन पॉलिसी पेश करता है जो वेरिएबल-स्पीड ट्राजेक्टरी ऑग्मेंटेशन (VSTA) और स्पष्ट स्पीड कंडीशनिंग का लाभ उठाता है ताकि रोबोटों को तेज़ ट्रांजिट और धीमी, सटीक संपर्क चरणों, दोनों के लिए अपनी निष्पादन गति को गतिशील रूप से समायोजित करने में सक्षम बनाया जा सके, जिससे मौजूदा मॉडलों की निश्चित-गति सीमाओं को दूर किया जा सके।

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding2026-06-05
⚡ electrical engineering

Hybrid fuzzy logic and pid controller based ph neutralization pilot plant

यह शोध पत्र एक pH न्यूट्रलाइजेशन पायलट प्लांट के लिए एक हाइब्रिड फजी लॉजिक और PID कंट्रोलर के डिजाइन, अनुकूलन और व्यावहारिक सत्यापन को प्रस्तुत करता है, जो जटिल, गैर-रेखीय रासायनिक प्रक्रियाओं को संभालने में पारंपरिक एकल-कंट्रोलर प्रणालियों की सीमाओं को संबोधित करता है।

Oumair Naseer, Atif Ali Khan2026-06-04
🧬 biology

Characterizing optimal hierarchical policy inference on graphs via non-equilibrium thermodynamics

यह शोध पत्र ग्राफ पर डिस्क्रीट मार्कोव निर्णय प्रक्रियाओं (डिस्क्रीट मार्कोव डिसीजन प्रोसेसेज) के लिए इष्टतम अवस्था-स्थान पदानुक्रमों (स्टेट-स्पेस हायरार्कीज़) को व्युत्पन्न करने के लिए गैर-संतुलन ऊष्मागतिकी (नॉन-इक्विलिब्रियम थर्मोडायनामिक्स) पर आधारित एक औपचारिकता प्रस्तुत करता है, जो परिणामी नीति अनुमान (पॉलिसी इन्फरेंस) को पूर्व और इष्टतम प्रक्षेपवक्र घनत्वों (ट्रैजेक्टरी डेंसिटीज़) के बीच एक पदानुक्रमित ग्रेडिएंट प्रवाह के रूप में फ्रेम करता है।

Daniel McNamee2026-06-04
🤖 AI

CounterFace: A Synthetic Face Dataset for Fine-Grained Counterfactual Evaluation of Face Recognition Systems

यह शोध पत्र CounterFace को प्रस्तुत करता है, जो 20 विशेषताओं और 8 जनसांख्यिकीय कारकों (demographics) के माध्यम से 11,821 चेहरे के जोड़ों वाला एक पूर्णतः स्वचालित सिंथेटिक डेटासेट है, जिसे सूक्ष्म-स्तरीय काउंटरफैक्चुअल मूल्यांकन सक्षम करने के लिए डिज़ाइन किया गया है जो यह प्रकट करता है कि कैसे विशिष्ट दिखावट परिवर्तन और जनसांख्यिकीय कारक विभिन्न फेशियल रिकग्निशन सिस्टम के प्रदर्शन को विशिष्ट रूप से कम करते हैं।

Guruprasad Viswanathan Ramesh, Ashish Hooda, Shimaa Ahmed, Harrison J Rosenberg, Ramya Korlakai Vinayak, Kassem Fawaz2026-06-04