💻 computer science

Steering Awareness: Models Can Be Trained to Detect Activation Steering

यह शोध पत्र यह प्रदर्शित करता है कि भाषा मॉडल को एक्टिवेशन स्टीयरिंग हस्तक्षेपों (activation steering interventions) को विश्वसनीय रूप से पहचानने और पहचानने के लिए फाइन-ट्यून किया जा सकता है, जो यह प्रकट करता है कि ऐसा स्टीयरिंग स्वाभाविक रूप से अप्राप्य नहीं है और इसे पहचानने के लिए प्रशिक्षित मॉडल विरोधाभासी रूप से व्यवहारिक हेरफेर के प्रति अधिक संवेदनशील हो सकते हैं।

Joshua Fonseca Rivera, David Demitri Africa2026-03-06
💻 computer science

RePo: Language Models with Context Re-Positioning

यह शोधपत्र RePo प्रस्तुत करता है, जो एक विभेदनीय मॉड्यूल (differentiable module) का लाभ उठाने वाला एक नवीन तंत्र है जो टोकन को निश्चित रैखिक अनुक्रमों के बजाय प्रासंगिक निर्भरताओं के आधार पर गतिशील रूप से पुन: व्यवस्थित करता है, जिससे शोर युक्त संदर्भों, संरचित डेटा और लंबी दूरी की निर्भरताओं वाले कार्यों पर LLM के प्रदर्शन को बढ़ाते हुए अतिरिक्त संज्ञानात्मक भार को कम किया जा सके।

Huayang Li, Tianyu Zhao, Deng Cai, Richard Sproat2026-03-06
💻 computer science

From Word to World: Can Large Language Models be Implicit Text-based World Models?

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को एक अंतर्निहित टेक्स्ट-आधारित विश्व मॉडल के रूप में मूल्यांकित करने के लिए एक तीन-स्तरीय ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि हालांकि वे सुसंगत अवस्था भविष्यवाणी और सिंथेटिक अनुभव निर्माण के माध्यम से एजेंट लर्निंग को बढ़ा सकते हैं, उनकी प्रभावशीलता व्यवहारिक कवरेज और पर्यावरण जटिलता पर महत्वपूर्ण रूप से निर्भर करती है।

Yixia Li, Hongru Wang, Jiahao Qiu, Zhenfei Yin, Dongdong Zhang, Cheng Qian, Zeping Li, Pony Ma, Guanhua Chen, Heng Ji2026-03-06
💻 computer science

Parallel Token Prediction for Language Models

यह शोध पत्र पैरेलल टोकन प्रेडिक्शन (PTP) को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो रैंडम इनपुट वेरिएबल्स के डिटरमिनिस्टिक फंक्शन्स के माध्यम से एक ही फॉरवर्ड पास में कई टोकन का अनुमान लगाकर लैंग्वेज मॉडल इन्फरेंस को तेज करता है, जिससे ऑटोरिग्रेसिव डिकोडिंग की तुलना में 2.4x की गति वृद्धि प्राप्त होती है।

Felix Draxler, Justus Will, Farrin Marouf Sofian, Theofanis Karaletsos, Sameer Singh, Stephan Mandt2026-03-06
💻 computer science

When Do Tools and Planning Help Large Language Models Think? A Cost- and Latency-Aware Benchmark

यह शोध पत्र एक लागत- और विलंबता-जागरूक (cost- and latency-aware) बेंचमार्क प्रस्तुत करता है जो यह प्रदर्शित करता है कि जहाँ टूल-ऑगमेंटेड प्लानिंग (tool-augmented planning) इवेंट-क्यूए (Event-QA) जैसे जटिल ज्ञान-गहन कार्यों के लिए सटीकता में महत्वपूर्ण सुधार करती है, वहीं यह अक्सर अत्यधिक विलंबता लागत का कारण बनती है और उन कार्यों के लिए कोई लाभ नहीं देती—या प्रदर्शन को कम कर देती है—जहाँ पर्सुएसिव रिस्पॉन्स जनरेशन (persuasive response generation) जैसे कार्यों के लिए सरल वन-शॉट प्रॉम्प्टिंग अधिक कुशल है।

Subha Ghoshal, Ali Al-Bustami2026-03-06
💻 computer science

Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM

यह शोध पत्र Yuan3.0 Ultra को प्रस्तुत करता है, जो एक ओपन-सोर्स, ट्रिलियन-पैरामीटर मिक्स्चर-ऑफ-एक्सपर्ट्स लार्ज लैंग्वेज मॉडल है जो प्री-ट्रेनिंग दक्षता में उल्लेखनीय सुधार करने और एंटरप्राइज-ओरिएंटेड बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करते हुए मॉडल के आकार को कम करने के लिए एक नवीन लेयर-एडेप्टिव एक्सपर्ट प्रूनिंग एल्गोरिदम का उपयोग करता है।

YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Jose (…)2026-03-06
💻 computer science

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

यह शोध पत्र ऑन-पॉलिसी सेल्फ-डिस्टिलेशन (OPSD) प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जहाँ एक एकल लार्ज लैंग्वेज मॉडल विशेषाधिकार प्राप्त रीजनिंग ट्रेसेस (privileged reasoning traces) का लाभ उठाकर अपनी ही कमजोर पॉलिसी को सुपरवाइज करने के लिए शिक्षक और छात्र दोनों के रूप में कार्य करता है, जिससे पारंपरिक ऑफ-पॉलिसी डिस्टिलेशन और रिइन्फोर्समेंट लर्निंग विधियों की तुलना में बेहतर गणितीय तर्क प्रदर्शन और काफी अधिक टोकन दक्षता प्राप्त होती है।

Siyan Zhao, Zhihui Xie, Mengchen Liu, Jing Huang, Guan Pang, Feiyu Chen, Aditya Grover2026-03-06
💻 computer science

Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards

यह शोधपत्र VIP को प्रस्तुत करता है, जो एक वेरियंस-इन्फॉर्म्ड प्रेडिक्टिव एलोकेशन रणनीति है जो ग्रेडिएंट वेरियंस को कम करने और सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ ऑनलाइन सुदृढीकरण शिक्षण (online reinforcement learning) में सैंपलिंग दक्षता को महत्वपूर्ण रूप से सुधारने के लिए गॉसियन प्रोसेस-आधारित वेरियंस अनुमान का उपयोग करके प्रशिक्षण प्रॉम्प्ट्स के बीच रोलआउट वितरण को गतिशील रूप से अनुकूलित करती है।

Hieu Trung Nguyen, Bao Nguyen, Wenao Ma, Yuzhi Zhao, Ruifeng She, Viet Anh Nguyen2026-03-06
💻 computer science

Assessing Risks of Large Language Models in Mental Health Support: A Framework for Automated Clinical AI Red Teaming

यह शोध पत्र एक सिमुलेशन-आधारित क्लिनिकल रेड टीमिंग फ्रेमवर्क पेश करता है जो मानसिक स्वास्थ्य सहायता प्रणालियों का मूल्यांकन करने के लिए एआई मनोचिकित्सकों को गतिशील रोगी एजेंटों के साथ जोड़ता है, जो अल्कोहल यूज़ डिसऑर्डर परिदृश्यों के विरुद्ध परीक्षण किए गए एआई एजेंटों में भ्रमों की पुष्टि और आत्महत्या के जोखिम को कम करने में विफलता जैसे महत्वपूर्ण सुरक्षा अंतराल को प्रकट करता है।

Ian Steenstra, Paola Pedrelli, Weiyan Shi, Stacy Marsella, Timothy W. Bickmore2026-03-06
💻 computer science

Learn Hard Problems During RL with Reference Guided Fine-tuning

यह शोध पत्र रेफरेंस-गाइडेड फाइन-ट्यूनिंग (ReGFT) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रिवॉर्ड स्पर्सिटी (reward sparsity) को दूर करने और गणितीय तर्क के लिए सुदृढीकरण शिक्षण (reinforcement learning) के प्रदर्शन और प्रशिक्षण दक्षता को महत्वपूर्ण रूप से बढ़ाने के लिए आंशिक मानव संदर्भ समाधानों का उपयोग करके मॉडल-संरेखित सकारात्मक प्रक्षेपवक्र (positive trajectories) को संश्लेषित करती है।

Yangzhen Wu, Shanda Li, Zixin Wen, Xin Zhou, Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai2026-03-06