🤖 AI

Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers

यह शोध पत्र प्रोएक्टिव इंटरएक्टिव रीजनिंग (PIR) को प्रस्तुत करता है, जो एक नया प्रतिमान (पैराडाइम) है जो तर्क करने वाले LLMs को पैसिव सॉल्वर से प्रोएक्टिव इनक्वायरर में बदल देता है, जो आधार (प्रिमाइज़) और इरादे की अनिश्चितता को संबोधित करने के लिए आंतरिक तर्क के साथ उपयोगकर्ता स्पष्टीकरण को जोड़ता है, जिससे सटीकता और दक्षता में उल्लेखनीय सुधार होता है और कम्प्यूटेशनल लागत कम होती है।

Xin Chen, Feng Jiang, Yiqian Zhang, Hardy Chen, Shuo Yan, Wenya Xie, Min Yang, Shujian Huang2026-05-29
🤖 machine learning

Learn from A Rationalist: Distilling Intermediate Interpretable Rationales

यह शोध पत्र REKD का प्रस्ताव करता है, जो एक ज्ञान आसवन (knowledge distillation) ढांचा है जो अधिक सक्षम शिक्षक मॉडल के तर्क (rationales) और भविष्यवाणियों से सीखने के लिए छोटे छात्र नेटवर्क को प्रशिक्षित करके तर्क निष्कर्षण (rationale extraction) मॉडलों के भविष्य कहनेवाला प्रदर्शन और व्याख्यात्मकता को बढ़ाता है, जिससे रिमोट सुपरविजन के तहत फीचर उपसमुच्चयों (feature subsets) को सीखने की कम्प्यूटेशनल चुनौतियों पर विजय प्राप्त होती है।

Jiayi Dai, Randy Goebel2026-05-29
🤖 machine learning

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

यह शोध पत्र PEAR को पेश करता है, जो एक SFT-चरण की विधि है जो ऑफलाइन डेटा और भविष्य की RL नीतियों के बीच बेमेल (mismatch) के आधार पर प्रशिक्षण नुकसान (training losses) को पुन: भारित (reweight) करने के लिए इम्पॉर्टेंस सैंपलिंग का उपयोग करती है, जिससे मानक SFT की तुलना में रीजनिंग कार्यों पर डाउनस्ट्रीम सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng2026-05-29
🤖 AI

AutoSizer: Automatic Sizing of Analog and Mixed-Signal Circuits via Large Language Model (LLM) Agents

यह शोध पत्र AutoSizer को प्रस्तुत करता है, जो एक रिफ्लेक्टिव (reflective) लार्ज लैंग्वेज मॉडल (LLM) एजेंट फ्रेमवर्क है जो सर्किट समझ को दो-लूप अनुकूलन प्रक्रिया के साथ एकीकृत करके एनालॉग और मिक्स्ड-सिग्नल (AMS) सर्किट साइजिंग को स्वचालित करता है ताकि खोज स्थानों (search spaces) को पुनरावृत्ति से परिष्कृत किया जा सके, और साथ ही पारंपरिक और मौजूदा LLM-आधारित विधियों पर इसके उत्कृष्ट प्रदर्शन को प्रदर्शित करने के लिए AMS-SizingBench बेंचमार्क भी प्रदान करता है।

Xi Yu, Dmitrii Torbunov, Soumyajit Mandal, Yihui Ren2026-05-29
💬 NLP

A Language-Guided Bayesian Optimization for Efficient LoRA Hyperparameter Search

यह शोध पत्र एक भाषा-निर्देशित बेयसियन ऑप्टिमाइज़ेशन (Bayesian Optimization) ढांचे का प्रस्ताव करता है जो प्राकृतिक भाषा प्रॉम्प्ट्स के माध्यम से LoRA हाइपरपैरामीटर्स को एक निरंतर वेक्टर स्पेस में मैप करने के लिए प्री-ट्रेंड LLMs का लाभ उठाता है और डेटा उपसमुच्चयों (subsets) पर प्रॉक्सी ट्रेनिंग का उपयोग करता है ताकि व्यापक खोज (exhaustive search) की तुलना में काफी कम पुनरावृत्तियों (iterations) के साथ उच्च प्रदर्शन करने वाले हाइपरपैरामीटर्स को कुशलतापूर्वक खोजा जा सके।

Baek Seong-Eun, Lee Jung-Mok, Kim Sung-Bin, Tae-Hyun Oh2026-05-29
💬 NLP

Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

यह शोध पत्र PACED-RL प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो GFlowNet पार्टीशन फंक्शन को प्रति-प्रॉम्ट सटीकता सिग्नल के रूप में पुनर्व्याख्या करता है ताकि सूचनात्मक प्रॉम्ट्स को प्राथमिकता दी जा सके और रिप्ले को अनुकूलित किया जा सके, जिससे बिना किसी अतिरिक्त कम्प्यूटेशनल ओवरहेड के LLMs में सैंपल दक्षता और रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung2026-05-29
🤖 AI

Benchmarking at the Edge of Comprehension

यह शोध पत्र 'क्रिटीक-रेज़िलिएंट बेंचमार्किंग' (Critique-Resilient Benchmarking) प्रस्तुत करता है, जो एक प्रतिकूल ढांचा (adversarial framework) है जो उत्तरों को गलत सिद्ध करने में प्रतिकूलों की अक्षमता के माध्यम से शुद्धता को परिभाषित करते हुए, और स्थानीय दावों के लिए मनुष्यों को सीमित सत्यापनकर्ताओं (bounded verifiers) के रूप में उपयोग करते हुए, मानव समझ से परे फ्रंटियर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन को सक्षम बनाता है।

Samuele Marro, Jialin Yu, Emanuele La Malfa, Oishi Deb, Jiawei Li, Yibo Yang, Ebey Abraham, Sunando Sengupta, Eric Somme (…)2026-05-29
📊 statistics

GICDM: Mitigating Hubness for Reliable Distance-Based Generative Model Evaluation

यह शोध पत्र जेनेरेटिव ICDM (GICDM) प्रस्तुत करता है, जो एक मल्टी-स्केल विधि है जो उच्च-आयामी एम्बेडिंग स्पेस में हबनेस घटना (hubness phenomenon) को कम करती है ताकि दूरी-आधारित जेनेरेटिव मॉडल मूल्यांकन मेट्रिक्स की विश्वसनीयता और मानवीय संरेखण (human alignment) को बहाल किया जा सके।

Nicolas Salvy, Hugues Talbot, Bertrand Thirion2026-05-29
🤖 AI

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

यह शोध पत्र JAEGER को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो RGB-D अवलोकनों को एक नवीन न्यूरल इंटेंसिटी वेक्टर (Neural Intensity Vector) प्रतिनिधित्व के साथ एकीकृत करके ऑडियो-विजुअल लार्ज लैंग्वेज मॉडल्स को 3D स्पेस तक विस्तारित करता है, और SpatialSceneQA बेंचमार्क के माध्यम से पारंपरिक 2D-केंद्रित दृष्टिकोणों की तुलना में जटिल भौतिक वातावरणों में श्रेष्ठ स्थानिक ग्राउंडिंग (spatial grounding) और तर्क करने में सक्षम बनाता है।

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang2026-05-29
🤖 AI

Recurrent Structural Policy Gradient for Partially Observable Mean Field Games

यह शोध पत्र रिकरेंट स्ट्रक्चरल पॉलिसी ग्रेडिएंट (RSPG) को प्रस्तुत करता है, जो कि आंशिक रूप से अवलोकन योग्य मीन फील्ड गेम्स के लिए पहला इतिहास-जागरूक हाइब्रिड स्ट्रक्चरल मेथड है जो मॉडल-फ्री आरएल (RL) की तुलना में काफी तेज़ अभिसरण (convergence) प्राप्त करता है, साथ ही इसमें MFAX का विमोचन भी शामिल है, जो मीन फील्ड गेम अनुसंधान के लिए एक नया JAX-आधारित फ्रेमवर्क है।

Clarisse Wibault, Johannes Forkel, Sebastian Towers, Tiphaine Wibault, Juan Duque, George Whittle, Andreas Schaab, Yuche (…)2026-05-29