💬 NLP

ThreadWeaver: Adaptive Threading for Efficient Parallel Reasoning in Language Models

ThreadWeaver एक नवीन फ्रेमवर्क है जो एक दो-चरणीय प्रक्षेपवक्र जनरेटर (two-stage trajectory generator), मानक अनुमान इंजनों (standard inference engines) के साथ संगत एक ट्राइ-आधारित रोलआउट डिज़ाइन (trie-based rollout design), और एक समानांतरता-जागरूक सुदृढीकरण शिक्षण रणनीति (parallelization-aware reinforcement learning strategy) को संयोजित करके बड़े भाषा मॉडलों में अत्याधुनिक समानांतर तर्क प्रदर्शन प्राप्त करता है, जिससे अनुक्रमिक सटीकता से मेल खाते हुए अनुमान विलंबता (inference latency) को महत्वपूर्ण रूप से कम किया जा सकता है।

Long Lian, Sida Wang, Felix Juefei-Xu, Tsu-Jui Fu, Xiuyu Li, Adam Yala, Trevor Darrell, Alane Suhr, Yuandong Tian, Xi Vi (…)2026-07-03
💬 NLP

HAL: Inducing Human-likeness in LLMs with Alignment

यह शोध पत्र HAL को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो कंट्रास्टिव डायलॉग डेटा से एक व्याख्यात्मक, डेटा-संचालित रिवॉर्ड (पुरस्कार) प्राप्त करके भाषा मॉडलों को मानवीय संवादात्मक गुणों के साथ संरेखित करता है, जिससे लक्षित अनुकूलन सक्षम होता है जो समग्र प्रदर्शन से समझौता किए बिना कथित मानव-समानता में सुधार करता है।

Masum Hasan, Junjie Zhao, Ehsan Hoque2026-07-03
🤖 machine learning

On the Sample Efficiency of Inverse Dynamics Models for Semi-Supervised Imitation Learning

यह शोध पत्र प्रदर्शित करता है कि इनवर्स डायनेमिक्स मॉडल (IDMs), विशेषज्ञ नीतियों की तुलना में कम-जटिलता और कम स्टोकेस्टिक हाइपोथीसिस क्लास के भीतर कार्य करके, सेमी-सुपरवाइज्ड इमिटेशन लर्निंग में बेहतर सैंपल दक्षता प्राप्त करते हैं, जिससे एक उन्नत लेटेंट एक्शन पॉलिसी लर्निंग एल्गोरिदम का प्रस्ताव मिलता है जिसे कई बेंचमार्क पर मान्य किया गया है।

Sacha Morin, Moonsub Byeon, Alexia Jolicoeur-Martineau, Sébastien Lachapelle2026-07-03
🤖 machine learning

On the Role of Computation in Reinforcement Learning

यह शोध पत्र कंप्यूट-बाउंडेड (compute-bounded) नीतियों की अवधारणा को औपचारिक रूप देता है ताकि यह प्रदर्शित किया जा सके कि, एक न्यूनतम परिवर्तनीय-कंप्यूट (minimal variable-compute) आर्किटेक्चर के माध्यम से कंप्यूटेशन को पैरामीटर संख्या से अलग करके, सुदृढीकरण लर्निंग (reinforcement learning) एजेंट केवल अधिक कम्प्यूटेशनल संसाधनों का उपयोग करके लंबी अवधि के कार्यों (long-horizon tasks) पर बेहतर प्रदर्शन और सामान्यीकरण प्राप्त कर सकते हैं।

Raj Ghugare, Michał Bortkiewicz, Alicja Ziarko, Benjamin Eysenbach2026-07-03
💬 NLP

BRIDGE: Predicting Human Task Completion Time From Model Performance

यह शोध पत्र BRIDGE को प्रस्तुत करता है, जो एक साइकोमेट्रिक ढांचा है जो लेटेंट टास्क डिफिकल्टी (अव्यक्त कार्य की कठिनाई) और मानव पूर्णता समय के लघुगणक (लॉग) के बीच एक रैखिक संबंध स्थापित करके मॉडल प्रदर्शन डेटा से मानव कार्य पूर्णता समय की भविष्यवाणी करता है, जिससे महंगी मानवीय एनोटेशन के बिना स्केलेबल क्षमता पूर्वानुमान सक्षम होता है।

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle2026-07-03
🤖 machine learning

μμpscaling small models: Principled warm starts and hyperparameter transfer

यह शोध पत्र एक सिद्धांत-आधारित विड्थ-आधारित अपस्केलिंग विधि प्रस्तुत करता है जो कार्यात्मक समानता सुनिश्चित करने और छोटे से बड़े मॉडलों में कुशल हाइपरपैरामीटर स्थानांतरण को सक्षम करने के लिए वेट परटर्बेशन (भार विक्षोभ) को सैद्धांतिक रूप से पुष्ट स्केलिंग नियमों के साथ जोड़ता है, जिससे विविध इन्फरेंस बजटों के लिए ट्यूनिंग की लागत कम हो जाती है।

Yuxin Ma, Nan Chen, Mateo Díaz, Soufiane Hayou, Dmitriy Kunisky, Soledad Villar2026-07-03
🤖 machine learning

Prediction of Diffusion Coefficients in Mixtures with Tensor Completion

यह शोध पत्र बाइनरी मिश्रणों में तापमान-निर्भर विसरण गुणांकों (डिफ्यूजन कोएफिशिएंट्स) की सटीक भविष्यवाणी करने के लिए बेयसियन प्रायर्स (Bayesian priors) और सक्रिय शिक्षण (active learning) रणनीतियों द्वारा संवर्धित एक हाइब्रिड टेंसर पूर्णता विधि प्रस्तुत करता है, जो मौजूदा एकल-तापमान मैट्रिक्स पूर्णता मॉडलों और अर्ध-अनुभवजन्य दृष्टिकोणों की सीमाओं को दूर करता है।

Zeno Romero, Kerstin Münnemann, Hans Hasse, Fabian Jirasek2026-07-03
🤖 machine learning

Certified World Models: Predictability Across Configuration, Horizon, and Resolution

यह शोध पत्र इक्विवैरिएंट लेटेंट वर्ल्ड मॉडल्स (equivariant latent world models) के लिए एक कंप्यूट करने योग्य प्रेडिक्टेबिलिटी सर्टिफिकेट (predictability certificate) प्रस्तुत करता है जो कॉन्फ़िगरेशन, होराइजन और रेज़ोल्यूशन में रोलआउट त्रुटियों को सीमित करने के लिए सिमेट्री (symmetry) का लाभ उठाता है, यह प्रदर्शित करते हुए कि सटीक इक्विवैरिएंस (exact equivariance) इनवेरिएंट एरर सुनिश्चित करती है जबकि अनुमानित इक्विवैरिएंस (approximate equivariance) विश्वसनीय निर्णय लेने के लिए मार्गदर्शन हेतु लयापुनोव स्पेक्ट्रा (Lyapunov spectra) के माध्यम से होराइजन एस्टीमेशन (horizon estimation) की अनुमति देती है।

Hongbo Wang2026-07-03
🤖 machine learning

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT एक पॉलिसी-प्रोग्रामेबल रनटाइम है जो GPU पैरेललिज्म को एक गतिशील रूप से शेड्यूलेबल संसाधन के रूप में मानकर डिफ्यूजन ट्रांसफॉर्मर सर्विंग दक्षता को बढ़ाता है, जो वर्कलोड विषमता के अनुकूल होने के लिए एसिंक्रोनस निष्पादन और ग्रुप-फ्री कलेक्टिव्स का उपयोग करता है और स्टैटिक पैरेललिज्म दृष्टिकोणों की तुलना में थ्रूपुट, लेटेंसी और सेवा गुणवत्ता में महत्वपूर्ण सुधार करता है।

Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo2026-07-03
💬 NLP

Office Comprehension Benchmark

यह शोध पत्र ऑफिस कॉम्प्रिहेंशन बेंच (OCB) को प्रस्तुत करता है, जो वर्ड, एक्सेल और पावरपॉइंट बोध के मूल्यांकन के लिए डिज़ाइन किया गया पहला सार्वजनिक बेंचमार्क है, जो दो ट्रैक्स—फाइल फिडेलिटी Q&A और डोमेन Q&A—के माध्यम से यह प्रकट करता है कि शीर्ष स्तर के मॉडल भी जटिल दस्तावेज़ तर्क करने में संघर्ष करते हैं, और डोमेन कार्यों पर केवल 59.3% सटीकता प्राप्त करते हैं।

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwa (…)2026-07-03