🤖 machine learning

GAE: Graph-Augmented Evolution for Scientific Discovery via Reinforcement Optimization

यह शोध पत्र GAE प्रस्तुत करता है, जो एक नवीन ढांचा है जो संरचना-जागरूक प्रोग्राम प्रतिनिधित्व के लिए ग्राफ न्यूरल नेटवर्क, निर्देशित पैरेंट और उत्परिवर्तन चयन के लिए सुदृढीकरण लर्निंग (reinforcement learning), और उच्च-फिटनेस संरचनात्मक संपादन के साथ LLM उत्परिवर्तन ऑपरेटरों को गतिशील रूप से संरेखित करने के लिए ऑनलाइन GRPO फाइन-ट्यूनिंग को एकीकृत करके वैज्ञानिक खोज के लिए विकासवादी प्रोग्राम खोज को बढ़ाता है, जिससे बंद-रूप (closed-form) भौतिक समीकरणों की खोज में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xuanzhou Chen, Taoli Cheng2026-07-14
📊 statistics

Energy-guided Recursive Model

यह शोध पत्र एनर्जी-गाइडेड रिकर्सिव मॉडल (ERM) को प्रस्तुत करता है, जो रिकर्सिव रीजनिंग में टेस्ट-टाइम स्केलिंग के लिए एक सिद्धांतपूर्ण चयन तंत्र प्रदान करने हेतु स्पष्ट हॉपफील्ड ऊर्जाओं (Hopfield energies) का उपयोग करता है, जिससे सुडोकू और मेज़ (Mazes) जैसे संरचित समस्या-समाधान बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Yifei Zhao, Ying Tang2026-07-14
🤖 machine learning

LeRoPE: Learnable RoPE Frequencies Improve Language Modeling

यह शोध पत्र LeRoPE को प्रस्तुत करता है, जो एक ऐसी विधि है जो रोटरी पोजीशनल एनकोडिंग (RoPE) आवृत्तियों को निश्चित हाइपरपैरामीटर के बजाय सीखने योग्य मापदंडों (learnable parameters) के रूप में मानती है, और 52M से 2.5B पैरामीटर्स वाले मॉडलों को प्रशिक्षित करने के माध्यम से यह प्रदर्शित करती है कि यह दृष्टिकोण मानक और आंशिक RoPE की तुलना में लगातार बेहतर प्रदर्शन करता है और तुलनीय प्रदर्शन प्राप्त करने के लिए काफी कम कंप्यूट की आवश्यकता होती है।

Petros Karypis, Sean O'Brien, Shreyas Kadekodi, Rui Zhu, Julian McAuley2026-07-14
🤖 machine learning

RDQ: Residual Distribution Quantization for Large Language Models

यह शोध पत्र RDQ को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग क्वांटाइजेशन फ्रेमवर्क है जो ड्रिफ्टेड रेसिडुअल डिस्ट्रीब्यूशन के विरुद्ध पर-चैनल स्केल्स को फिट करने के लिए कैस्केडेड एरर कंपनसेशन का उपयोग करके लार्ज लैंग्वेज मॉडल्स में क्वांटाइजेशन नॉइज़ के सुपर-लीनियर संचय को कम करता है, जिससे शून्य इन्फरेंस ओवरहेड के साथ 3-बिट और 4-बिट प्रिसिजन पर स्टेट-ऑफ-द-आर्ट परप्लेक्सिटी प्राप्त होती है।

Prateek Singh2026-07-14
🤖 machine learning

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

यह शोध पत्र "LLM-jury" को प्रस्तुत करता है, जो एक पैरामीटर-मुक्त टेस्ट-टाइम स्केलिंग विधि है जो स्वतंत्र रूप से प्रशिक्षित मॉडलों के बीच क्रॉस-मॉडल सर्वसम्मति का लाभ उठाकर सही रीजनिंग चेन्स (reasoning chains) चुनने में सेल्फ-कंसिस्टेंसी (self-consistency) और प्रशिक्षित रिवॉर्ड मॉडल्स (reward models) से बेहतर प्रदर्शन करती है, जबकि यह इसकी सटीकता की भविष्यवाणी करने और इसके विफलता स्तर (failure ceiling) की पहचान करने के लिए एक क्लोज्ड-फॉर्म लॉ (closed-form law) भी प्रदान करती है।

Ning Liu2026-07-14
🤖 machine learning

Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

यह शोध पत्र LLM सुदृढीकरण शिक्षण (reinforcement learning) में अन्वेषण पतन (exploration collapse) को PPO-Clip के यूक्लिडियन मेट्रिक्स और नीतियों के अंतर्निहित रीमैनियन मैनिफोल्ड (Riemannian manifold) के बीच ज्यामितीय बेमेल के परिणाम के रूप में पहचानता है, और इस दोष को सुधारने के लिए रीमैनियन आइसोमेट्रिक पॉलिसी ऑप्टिमाइज़ेशन (RIPO) का प्रस्ताव करता है, जो कई बेंचमार्क में काफी बेहतर प्रदर्शन और स्थिरता प्राप्त करता है।

Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou2026-07-14
🤖 machine learning

Knowledge-Conditioned, Single-Pass LLM Synthesis of Executable Unity Game Scenes: A Compiler Error Census across 26 Goal Playable Concepts

यह शोध पत्र बिना किसी पुनरावृत्ति सुधार के, एक ही बार में निष्पादन योग्य यूनिटी सी# (Unity C#) कोड उत्पन्न करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि विभिन्न मॉडलों और स्थितियों में 10,400 जनरेशन का परीक्षण करने के बावजूद, इंजन-विशिष्ट ज्ञान की मौलिक कमी के कारण कोई भी सफलतापूर्वक संकलित (compile) नहीं हो सका, जहाँ त्रुटियों को विशिष्ट गेम अवधारणा के आधार पर या तो ग्राउंडिंग संबंधी मुद्दों (बनाई गई API) या स्वच्छता संबंधी मुद्दों (संरचनात्मक दोषों) के रूप में वर्गीकृत किया गया है।

Hugh Xuechen Liu, Kıvanç Tatar2026-07-14
🤖 machine learning

Two Confounds in Cross-Model Value Comparison: Response Determinism and the Access Harness

यह शोधपत्र क्रॉस-मॉडल वैल्यू तुलनाओं में दो महत्वपूर्ण भ्रमों (confounds) की पहचान करता है और उन्हें सुधारता है: रिस्पॉन्स डिटरमिनिज्म (response determinism), जो वास्तविक मूल्य अंतर को मजबूर-विकल्प प्रतिबद्धताओं (forced-choice commitments) की तीक्ष्णता के साथ मिला देता है, और एक्सेस हार्नेस (access harness), जहाँ परिनियोजन-विशिष्ट क्लाइंट परतें मॉडल के स्पष्ट मूल्य प्रोफाइल को महत्वपूर्ण रूप से बदल देती हैं, जिससे एकल-ड्रॉ मापों (single-draw measurements) के आधार पर रैंकिंग विकृत हो जाती है।

Hong-In Won, Jinseok Jang, Hyoseop Kim2026-07-14
💬 NLP

One mechanism for many mental spaces: a shared router over a value slot in language models

यह शोध पत्र प्रदर्शित करता है कि ट्रांसफॉर्मर भाषा मॉडल विविध मानसिक स्थानों (जैसे कि विश्वास, कल्पनाएँ और प्रतितथ्यात्मक/counterfactuals) के लिए एक एकीकृत तंत्र को लागू करते हैं, जो प्रत्येक संदर्भ प्रकार के लिए अलग-अलग तार्किक संरचनाओं का उपयोग करने के बजाय, एक एकल पुन: प्रयोज्य स्लॉट से मानों का चयन करने वाले एक साझा, लो-रैंक राउटर का उपयोग करता है।

Oliver Steele, Jiangtao Wen, Yuxing Han2026-07-14
🤖 machine learning

Data-Driven Telecom Marketing Optimization: A Machine Learning-Based Churn Prediction and Customer Segmentation Framework

यह शोध पत्र एक डेटा-संचालित मार्केटिंग ऑप्टिमाइज़ेशन फ्रेमवर्क का प्रस्ताव करता है जो कार्रवाई योग्य, सेगमेंट-विशिष्ट रिटेंशन रणनीतियों और एक परिमाणित ROI फ्रेमवर्क को उत्पन्न करने के लिए CatBoost-आधारित चर्न प्रेडिक्शन को K-Means कस्टमर सेगमेंटेशन के साथ एकीकृत करता है, जिसे एक इंटरैक्टिव Streamlit एप्लिकेशन के माध्यम से संचालित किया गया है।

Nada Ali, Lina Ahmed, Tahani Abdalla Attia Gasmalla2026-07-14