💬 NLP

Weak-to-Strong Generalization via Direct On-Policy Distillation

यह शोध पत्र डायरेक्ट ऑन-पॉलिसी डिस्टिलेशन (Direct-OPD) का प्रस्ताव करता है, जो एक ऐसी विधि है जो वेरिफिएबल रिवॉर्ड्स (RLVR) के साथ सुदृढीकरण सीखने (reinforcement learning) के दौरान एक छोटे मॉडल द्वारा सीखे गए पॉलिसी शिफ्ट्स को शिक्षक के प्री- और पोस्ट-RL पॉलिसियों के लॉग-अनुपात (log-ratio) को एक डेंस इम्प्लिसिट रिवॉर्ड के रूप में उपयोग करके एक मजबूत लक्ष्य मॉडल में स्थानांतरित करती है, जिससे बड़े मॉडल पर पूर्ण RL चलाने की उच्च कम्प्यूटेशनल लागत के बिना कुशल वीक-टू-स्ट्रोंग जनरलाइजेशन सक्षम होता है।

Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang (…)2026-07-09
💬 NLP

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

यह शोध पत्र PubHealthBench बेंचमार्क को रिट्रीवल-ऑगमेंटेड सेटिंग में विस्तारित करता है, जो यह प्रदर्शित करता है कि हाइब्रिड रिट्रीवल और सावधानीपूर्वक संदर्भ चयन सार्वजनिक स्वास्थ्य प्रश्नोत्तर की सटीकता और विश्वसनीयता में महत्वपूर्ण सुधार करते हैं, जिससे छोटे मॉडल बड़े मॉडलों को पछाड़ सकते हैं, साथ ही मुक्त-रूप प्रतिक्रियाओं का मूल्यांकन करने के लिए एक मान्य LLM-as-a-judge फ्रेमवर्क पेश करते हैं।

Felix Feldman, Joshua Harris, Timothy Laurence, Leo Loman, Ollie Higgins, Fan Grayson, Poonam Soma, Bethany Pace-Bonello (…)2026-07-09
🤖 machine learning

Final Checkpoints Are Not Enough: Analyzing Latent Reasoning Faithfulness Along Training Trajectories

यह शोध पत्र प्रकट करता है कि लेटेंट रीजनिंग (latent reasoning) विधियों की निष्ठा स्थिर नहीं है बल्कि प्रशिक्षण के दौरान गतिशील रूप से विकसित होती है, जिसमें अंतिम उत्तरों में कारण संबंधी योगदान समय के साथ घटता जाता है और उत्तर प्रारूप के अनुसार महत्वपूर्ण रूप से भिन्न होता है, जो यह रेखांकित करता है कि तर्क की विश्वसनीयता का आकलन करने के लिए केवल अंतिम चेकपॉइंट मूल्यांकन पर्याप्त नहीं हैं।

Hengyu Jin, Shu Yang, Di Wang2026-07-09
🤖 AI

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

यह शोध पत्र एक सैद्धांतिक ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि आत्म-चिंतन (self-reflection) के माध्यम से इन-कॉन्टेक्स्ट खोज (in-context search), बेस मॉडल्स की तुलना में सैंपलिंग जटिलता (sampling complexity) में घातांकीय सुधार प्राप्त कर सकती है, क्योंकि यह तब कुशल पोस्टीरियर अपडेट्स को सक्षम करती है जब प्रतिबिंब (reflections) विश्वसनीय रूप से शुरुआती गलतियों को स्थानीयकृत करते हैं, जो कि एक ऐसी क्षमता है जो मजबूती से सीखने योग्य (robustly learnable) है और इष्टतम सुदृढीकरण शिक्षण (optimal reinforcement learning) नीतियों के समकक्ष है।

Yotam Wolf, Noam Wies, Amnon Shashua2026-07-09
🤖 machine learning

Trees from Marginals: Autoregressive drafting with factorized priors

यह शोधपत्र Weaver को प्रस्तुत करता है, जो एक हल्का ऑटोरेग्रेसिव एडैप्टर (autoregressive adapter) है जो कुशल ट्री-आधारित स्पेकुलेटिव डिकोडिंग को सक्षम करने के लिए फैक्टराइज्ड ड्राफ्ट मार्जिनल्स (factorized draft marginals) से कंडीशनल डिपेंडेंसीज़ को पुनर्गठित करता है, जो एक नवीन रोलबैक-मुक्त सत्यापन एल्गोरिदम और अनुकूलित CUDA कर्नेल के माध्यम से मानक ऑटोरेग्रेसिव डिकोडिंग की तुलना में 4.37-गुना गति वृद्धि प्राप्त करता है।

Yuma Oda, Ryan Mathieu, Roman Knyazhitskiy, Artur Chakhvadze2026-07-09
💬 NLP

Ad Headline Generation using Self-Critical Masked Language Model

यह शोध पत्र ट्रांसफॉर्मर-आधारित मास्क्ड लैंग्वेज मॉडल्स पर रीइन्फोर्समेंट लर्निंग पॉलिसी ग्रेडिएंट विधियों को लागू करके उच्च गुणवत्ता वाले ई-कॉमर्स विज्ञापन हेडलाइन्स उत्पन्न करने के लिए एक नवीन प्रोग्रामेटिक समाधान प्रस्तावित करता है, जो व्याकरण संबंधी शुद्धता और रचनात्मक गुणवत्ता दोनों में मौजूदा मॉडल्स और मानव-निर्मित हेडलाइन्स से बेहतर प्रदर्शन करता है।

Yashal Shakti Kanungo, Sumit Negi, Aruna Rajan2026-07-09
💬 NLP

Geometric Self-Distillation for Reasoning Generalization

यह शोध पत्र GeoSD को प्रस्तुत करता है, जो एक ज्यामितीय स्व-डिस्टिलेशन (geometric self-distillation) ढांचा है जो मानक ऑन-पॉलिसी डिस्टिलेशन के कारण होने वाले आउट-ऑफ-डिस्ट्रीब्यूशन रीजनिंग ड्रिफ्ट (out-of-distribution reasoning drift) को कम करने के लिए हेलिंगर लॉस (Hellinger loss) और एक प्रॉक्सिमल फिशर-राओ पेनल्टी (proximal Fisher-Rao penalty) को नेचुरल-ग्रेडिएंट अपडेट्स के साथ जोड़ता है, जिससे विभिन्न मॉडल स्केल्स में जनरलाइजेशन में महत्वपूर्ण सुधार करते हुए इन-डिस्ट्रीब्यूशन प्रदर्शन को संरक्षित किया जा सके।

Josip Jukić, Ivan Titov2026-07-09
💬 NLP

Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

यह शोध पत्र एक व्यापक, बहु-कारक स्कोरिंग प्रणाली को एक ग्राफिकल इंटरफ़ेस के साथ प्रस्तावित करता है जो सटीकता और सुसंगतता जैसे आयामों पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए है, जो TruthfulQA डेटासेट पर उनकी तर्क क्षमता और तथ्यात्मक सीमाओं को उजागर करते हुए भविष्य के मॉडल परिशोधन के लिए एक पारदर्शी ढांचा प्रदान करता है।

Yiming Gai, Junde Lu, Xuefei Huang2026-07-09
💬 NLP

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES एक स्व-सुधारित (self-improving) LLM रीजनिंग के लिए एक नवीन ढांचा है जो चरण-वार निर्देश युग्मों (step-wise instruction pairs) की एक मॉड्यूलर मेमोरी को गतिशील रूप से विस्तारित करता है और यथार्थवादी टेस्ट-टाइम बाधाओं के तहत मेमोरी संरचना और रीजनिंग सटीकता को अनुकूलित करने के लिए एक कोर्स-टू-फाइन (coarse-to-fine), सीखने योग्य चयन तंत्र का उपयोग करता है।

Ruilin Tong, Dong Gong2026-07-09
💬 NLP

Dissociating the Internal Representations of Sycophancy in LLMs

यह शोध पत्र तथ्यात्मक और राय संबंधी उप-प्रकारों के बीच अंतर करके LLM चाटुकारिता (sycophancy) के आंतरिक तंत्रों की जांच करता है, जो यह प्रकट करता है कि विभिन्न मॉडल लीनियर प्रोब्स (linear probes) और स्टीयरिंग वेक्टर्स (steering vectors) के उपयोग के माध्यम से इन व्यवहारों को या तो एकीकृत या भिन्न और कारण रूप से हस्तक्षेप करने वाली अवधारणाओं के रूप में प्रस्तुत करते हैं।

Anthony Baez, Sheer Karny, Pat Pataranutaporn2026-07-09