💬 NLP

Small Vision-Language Models are Smart Compressors for Long Video Understanding

यह शोध पत्र टेंपो (Tempo) का प्रस्ताव करता है, जो एक क्वेरी-जागरूक फ्रेमवर्क है जो एक स्थानीय टेम्पोरल कंप्रेसर के रूप में एक स्मॉल विजन-लैंग्वेज मॉडल और एक अडैप्टिव टोकन एलोकेशन राउटर का लाभ उठाकर घंटों लंबे वीडियो को इरादा-अनुरूप (intent-aligned), संक्षिप्त निरूपणों में कुशलतापूर्वक संकुचित करता है, जिससे सख्त टोकन बजट के भीतर काम करते हुए लॉन्ग-फॉर्म वीडियो समझ के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian (…)2026-04-10
💬 NLP

Floating or Suggesting Ideas? A Large-Scale Contrastive Analysis of Metaphorical and Literal Verb-Object Constructions

यह बड़े पैमाने पर किया गया अध्ययन लगभग 300 अंग्रेजी क्रिया-कर्म (verb-object) युग्मों का विश्लेषण करता है जिससे यह पता चलता है कि यद्यपि रूपक संदर्भ (metaphorical contexts) शाब्दिक संदर्भों की तुलना में आम तौर पर उच्च भावनात्मक भार और शाब्दिक विविधता प्रदर्शित करते हैं, फिर भी उन्हें अलग करने वाला कोई एक सुसंगत वितरण पैटर्न नहीं है, क्योंकि अंतर काफी हद तक व्यक्तिगत संरचनाओं के विशिष्ट होते हैं।

Prisca Piccirilli, Alexander Fraser, Sabine Schulte im Walde2026-04-10
💬 NLP

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

यह शोध पत्र एक व्यापक अनुभवजन्य मूल्यांकन प्रस्तुत करता है जो यह प्रकट करता है कि अत्याधुनिक विजन लैंग्वेज मॉडल्स वर्तमान में व्यवस्थित पूर्वाग्रहों और सूक्ष्म गति विश्लेषण में मौलिक सीमाओं के कारण एक्शन क्वालिटी असेसमेंट में केवल यादृच्छिक संभावना (रैंडम चांस) से थोड़ा ही ऊपर प्रदर्शन करते हैं, जो यह संकेत देता है कि विश्वसनीय वास्तविक दुनिया के परिनियोजन से पहले महत्वपूर्ण प्रगति की आवश्यकता है।

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins2026-04-10
💬 NLP

Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

यह शोध पत्र OmniBehavior को प्रस्तुत करता है, जो लंबी अवधि के, क्रॉस-सिनैरियो मानव व्यवहार पर लार्ज लैंग्वेज मॉडल्स (LLMs) का मूल्यांकन करने के लिए पूरी तरह से वास्तविक दुनिया के डेटा से निर्मित पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल 'टनल विजन' (सीमित दृष्टि) और समरूप, अत्यधिक सकारात्मक व्यक्तित्वों के प्रति एक मौलिक संरचनात्मक पूर्वाग्रह से ग्रस्त हैं जो वास्तविक व्यक्तिगत अंतरों को पकड़ने में विफल रहते हैं।

Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xia (…)2026-04-10
💬 NLP

SOLAR: Communication-Efficient Model Adaptation via Subspace-Oriented Latent Adapter Reparametrization

यह शोधपत्र SOLAR को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) पोस्ट-ट्रेनिंग संपीड़न ढांचा है जो फाउंडेशन मॉडल के सिंगुलर वेक्टर्स का लाभ उठाकर PEFT एडेप्टर को संक्षिप्त, संचार-कुशल निरूपणों में पुन: पैरामीटराइज करता है, जिससे भाषा और विजन कार्यों में कार्य प्रदर्शन को बनाए रखते हुए भंडारण और ट्रांसमिशन लागत को महत्वपूर्ण रूप से कम किया जाता है।

Seyed Mahmoud Sajjadi Mohammadabadi, Xiaolong Ma, Lei Yang, Feng Yan, Junshan Zhang2026-04-10
💬 NLP

Don't Overthink It: Inter-Rollout Action Agreement as a Free Adaptive-Compute Signal for LLM Agents

यह शोधपत्र TrACE को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) नियंत्रक है जो इंटर-रोलआउट एक्शन सहमति (inter-rollout action agreement) को मापकर LLM एजेंटों के लिए इन्फरेंस-टाइम कंप्यूट को गतिशील रूप से आवंटित करता है, जिससे रीजनिंग और नेविगेशन दोनों कार्यों पर फिक्स्ड-बजट सेल्फ-कंसिस्टेंसी विधियों के समान सटीकता प्राप्त करते हुए LLM कॉल्स की संख्या में उल्लेखनीय कमी आती है।

Khushal Sethi2026-04-10
📊 statistics

Synthetic Data for any Differentiable Target

यह शोधपत्र डेटासेट पॉलिसी ग्रेडिएंट (DPG) प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो सटीक डेटा एट्रिब्यूशन का उपयोग करके सिंथेटिक डेटा जनरेटरों को अनुकूलित करती है ताकि सुपरवाइज्ड फाइन-ट्यूनिंग के माध्यम से लक्षित भाषा मॉडलों के गुणों को सटीक रूप से नियंत्रित और आकार दिया जा सके, यहाँ तक कि उन उद्देश्यों के लिए भी जो जनरेटर के प्रॉम्प्ट्स में स्पष्ट रूप से मौजूद नहीं होते हैं।

Tristan Thrush, Sung Min Park, Herman Brunborg, Luke Bailey, Marcel Roed, Neil Band, Christopher Potts, Tatsunori Hashim (…)2026-04-10
💬 NLP

KV Cache Offloading for Context-Intensive Tasks

यह शोध पत्र प्रकट करता है कि मौजूदा KV-कैश ऑफलोडिंग विधियाँ लो-रैंक प्रोजेक्शन और अविश्वसनीय लैंडमार्क्स के कारण नए पेश किए गए Text2JSON बेंचमार्क जैसे संदर्भ-गहन कार्यों पर प्रदर्शन को काफी कम कर देती हैं, और एक सरल वैकल्पिक रणनीति का प्रस्ताव करता है जो कई LLM परिवारों में सटीकता में पर्याप्त सुधार करती है।

Andrey Bocharnikov, Ivan Ermakov, Denis Kuznedelev, Vyacheslav Zhdanovskiy, Yegor Yershov2026-04-10
💬 NLP

AfriVoices-KE: A Multilingual Speech Dataset for Kenyan Languages

AfriVoices-KE एक बड़े पैमाने का, उच्च गुणवत्ता वाला बहुभाषी स्पीच डेटासेट है जिसमें पांच केन्याई भाषाओं के लगभग 5,000 मूल वक्ताओं के लगभग 3,000 घंटों का स्क्रिप्टेड और सहज ऑडियो शामिल है, जिसे स्पीच तकनीक में अफ्रीकी भाषाओं के कम प्रतिनिधित्व को दूर करने और समावेशी ऑटोमैटिक स्पीच रिकग्निशन और टेक्स्ट-टू-स्पीच सिस्टम के विकास में सहायता करने के लिए डिज़ाइन किया गया है।

Lilian Wanzare, Cynthia Amol, zekiel Maina, Nelson Odhiambo, Hope Kerubo, Leila Misula, Vivian Oloo, Rennish Mboya, Edwi (…)2026-04-10
💬 NLP

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

यह शोध पत्र "एन्ट्रॉपी-ग्रेडिएंट ग्राउंडिंग" (Entropy-Gradient Grounding) प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो जटिल प्रश्नों के लिए साक्ष्य खोजने की विजन-लैंग्वेज मॉडल्स की क्षमता को बढ़ाती है, जो प्रासंगिकता मानचित्र (relevance maps) उत्पन्न करने के लिए नेक्स्ट-टोकन एन्ट्रॉपी को बैकप्रोपैगेट करती है, जिससे बिना किसी सहायक डिटेक्टर के पुनरावृत्ति-आधारित, अनिश्चितता-संचालित दृश्य परिशोधन (visual refinement) सक्षम होता है।

Marcel Gröpl, Jaewoo Jung, Seungryong Kim, Marc Pollefeys, Sunghwan Hong2026-04-10