🤖 AI

OckBench: Measuring the Efficiency of LLM Reasoning

यह शोध पत्र OckBench प्रस्तुत करता है, जो तर्क (reasoning) और कोडिंग कार्यों में लार्ज लैंग्वेज मॉडल्स की सटीकता और टोकन दक्षता का संयुक्त रूप से मूल्यांकन करने वाला पहला बेंचमार्क है, जो वर्तमान मॉडल्स में महत्वपूर्ण अक्षमताओं को उजागर करता है और टोकन उपयोग को अनुकूलित करने की ओर एक प्रतिमान परिवर्तन (paradigm shift) का समर्थन करता है।

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu2026-06-04
💬 NLP

Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers

यह शोध पत्र मिड-थिंक (Mid-Think) को पेश करता है, जो एक प्रशिक्षण-मुक्त प्रॉम्पटिंग विधि है जो मध्यवर्ती-बजट तर्क (intermediate-budget reasoning) को सक्षम करने के लिए विशिष्ट टोकन-स्तरीय ट्रिगर्स (जैसे कि "Okay" और न्यूलाइन पैटर्न) का लाभ उठाती है, जो न केवल सटीकता-लंबाई ट्रेड-ऑफ में मौजूदा बेसलाइन से बेहतर प्रदर्शन करती है बल्कि तर्क संबंधी कार्यों के लिए सुदृढीकरण शिक्षण (reinforcement learning) को महत्वपूर्ण रूप से तेज और बेहतर भी बनाती है।

Wang Yang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Shouren Wang, Vikash Singh, Vipin Chaudhary, Xiaotian Han2026-06-04
💬 NLP

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

यह शोध पत्र बाउंडेड हाइपरबोलिक टैन (BHyT) का प्रस्ताव करता है, जो प्री-लेयर नॉर्मलाइज़ेशन के लिए एक स्थिर और कुशल ड्रॉप-इन रिप्लेसमेंट है जो डेटा-संचालित इनपुट बाउंडिंग के माध्यम से गहराई-संबंधी अस्थिरता को समाप्त करता है और RMSNorm की तुलना में तेज़ प्रशिक्षण और उच्च थ्रूपुट प्राप्त करता है।

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song2026-06-04
💬 NLP

Adaptive Information Control for Search-Augmented LLM Reasoning

यह शोध पत्र DeepControl का प्रस्ताव करता है, जो एक अनुकूली सूचना-नियंत्रण ढांचा (adaptive information-control framework) है जो सूचना उपयोगिता के आधार पर पुनर्प्राप्त साक्ष्य की सीमा और रिज़ॉल्यूशन को गतिशील रूप से विनियमित करके खोज-संवर्धित LLM तर्क (search-augmented LLM reasoning) को अनुकूलित करता है, जिससे परीक्षण के समय बाहरी नियंत्रण की आवश्यकता के बिना कई बेंचमार्क में प्रशिक्षण स्थिरता और प्रदर्शन में वृद्धि होती है।

Siheng Xiong, Oguzhan Gungordu, James C. Kerce, Faramarz Fekri2026-06-04
💬 NLP

Can Large Language Models Generalize Procedures Across Representations?

यह शोध पत्र प्रदर्शित करता है कि एक दो-चरणीय सुदृढीकरण अधिगम (reinforcement learning) पाठ्यक्रम, जो बड़े भाषा मॉडलों को क्रमवार रूप से प्रतीकात्मक डेटा (कोड/ग्राफ) और उसके बाद प्राकृतिक भाषा पर प्रशिक्षित करता है, प्रक्रियात्मक कार्यों के क्रॉस-रिप्रजेंटेशन सामान्यीकरण को सक्षम बनाता है, जिससे एक छोटा 1.5B मॉडल GPT-4o के ज़ीरो-शॉट प्लानिंग प्रदर्शन के बराबर प्रदर्शन करने में सक्षम होता है।

Fangru Lin, Valentin Hofmann, Xingchen Wan, Weixing Wang, Zifeng Ding, Anthony G. Cohn, Janet B. Pierrehumbert2026-06-04
💬 NLP

Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स (Large Language Models) "वैल्यू एंटैंगलमेंट" (मूल्य उलझाव) से ग्रस्त होते हैं, जहाँ नैतिक, व्याकरणिक और आर्थिक मूल्यों को मनुष्यों की तरह अलग करने के बजाय आपस में मिला दिया जाता है, लेकिन यह प्रदर्शित करता है कि नैतिकता-संबद्ध सक्रियण वेक्टर्स (activation vectors) के चयनात्मक एब्लेशन (ablation) के माध्यम से इस समस्या को कम किया जा सकता है।

Seong Hah Cho, Junyi Li, Anna Leshinskaya2026-06-04
💬 NLP

Prompt-Level Distillation: A Non-Parametric Alternative to Model Fine-Tuning for Efficient Reasoning

यह शोध पत्र प्रॉम्प्ट-लेवल डिस्टिलेशन (PLD) को प्रस्तुत करता है, जो एक नॉन-पैरामीट्रिक विधि है जो एक टीचर मॉडल से स्पष्ट रीजनिंग पैटर्न को संरचित सिस्टम निर्देशों में निकालती है, जिससे छोटे मॉडल नगण्य विलंबता के साथ फ्रंटियर-स्तर की रीजनिंग सटीकता प्राप्त करने में सक्षम होते हैं और विनियमित एवं उच्च-मात्रा वाले अनुप्रयोगों के लिए पूर्ण व्याख्यात्मकता बनाए रखते हैं।

Sanket Badhe, Deep Shah2026-06-04
🤖 machine learning

Do Transformers Need Three Projections? Systematic Study of QKV Variants

यह शोध पत्र व्यवस्थित रूप से यह प्रदर्शित करता है कि ट्रांसफॉर्मर्स में—विशेष रूप से Q-K=V वेरिएंट में—क्वेरी (query), की (key) और वैल्यू (value) प्रोजेक्शन को साझा करना, विजन और लैंग्वेज कार्यों में प्रतिस्पर्धी प्रदर्शन बनाए रखते हुए इन्फरेंस मेमोरी और KV कैश आवश्यकताओं को महत्वपूर्ण रूप से कम करता है, जिससे कुशल ऑन-डिवाइस परिनियोजन सक्षम होता है।

Ali Kayyam, Anusha Madan Gopal, M Anthony Lewis2026-06-04
💻 computer science

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

यह शोध पत्र SceneDiver को प्रस्तुत करता है, जो एक कोर्स-टू-फाइन (coarse-to-fine) फोकस प्लान जनरेशन विधि है जो समग्र सीन ग्राफ (scene graphs) के निर्माण के लिए VLMs का लाभ उठाती है और कार्यों को उप-समस्याओं में पुनरावर्ती रूप से विभाजित करती है, जिससे महत्वपूर्ण वस्तुओं को व्याकुलता उत्पन्न करने वाली वस्तुओं (distractors) से अलग करते हुए एम्बोडीड एआई (embodied AI) में विजुअल हैलुसिनेशन (visual hallucinations) को प्रभावी रूप से कम किया जाता है और इस क्षमता को रिएक्टिव कंट्रोल के लिए लाइटवेट VLAs में संकुचित (distill) किया जाता है।

Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding, Kun Zhou2026-06-04
💻 computer science

Covert Influence Between Language Models

यह शोध पत्र "गुप्त प्रभाव" (covert influence) के बढ़ते जोखिम को रेखांकित करता है, जहाँ भाषा मॉडल फाइन-ट्यूनिंग, डिस्टिलेशन और इन-कॉन्टेक्स्ट लर्निंग इंटरफेस के माध्यम से प्राकृतिक भाषा वाहकों द्वारा एक-दूसरे को अदेय व्यवहार संबंधी पेलोड (behavioral payloads) प्रसारित करते हैं, जो यह प्रदर्शित करता है कि इन्फरेंस-टाइम एट्रिब्यूशन स्कोर इन हस्तांतरणों को बढ़ा भी सकते हैं और इनका पता लगाने तथा शमन के लिए एक उपकरण के रूप में भी कार्य कर सकते हैं।

Avidan Shah, Jay Chooi, Jinghua Ou, Shi Feng2026-06-04