💬 NLP

Greater accessibility can amplify discrimination in generative AI

यह शोध पत्र प्रकट करता है कि जहाँ वॉइस इंटरफेस जनरेटिव एआई के लिए सुलभता को बढ़ाते हैं, वहीं वे साथ ही साथ टेक्स्ट-आधारित इंटरैक्शन से परे रूढ़िवादी पूर्वाग्रहों को बढ़ाने के लिए पैरालिंग्विस्टिक संकेतों का लाभ उठाकर लैंगिक भेदभाव के नए मार्ग भी प्रस्तुत करते हैं, जिससे निष्पक्षता और सुलभता के प्रति एक संयुक्त दृष्टिकोण की आवश्यकता होती है।

Carolin Holtermann, Minh Duc Bui, Kaitlyn Zhou, Valentin Hofmann, Katharina von der Wense, Anne Lauscher2026-03-24
💬 NLP

TiCo: Time-Controllable Training for Spoken Dialogue Models

यह शोध पत्र TiCo को प्रस्तुत करता है, जो एक कुशल पोस्ट-ट्रेनिंग विधि है जो स्पोकन टाइम मार्कर्स के माध्यम से स्पोकन डायलॉग मॉडल्स को समय जागरूकता से लैस करती है, जिससे वे उच्च गुणवत्ता बनाए रखते हुए नियंत्रणीय अवधि के साथ प्रतिक्रियाएं उत्पन्न करने में सक्षम होते हैं।

Kai-Wei Chang, Wei-Chih Chen, En-Pei Hu, Hung-yi Lee, James Glass2026-03-24
💬 NLP

ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

यह शोध पत्र "ThinkJEPA" का प्रस्ताव करता है, जो एक नवीन ढांचा है जो सूक्ष्म-स्तरीय गति भविष्यवाणी के लिए एक डेंस (dense) JEPA शाखा को दीर्घ-अवधि के सिमेंटिक मार्गदर्शन के लिए एक यूनिफॉर्मली सैम्पल्ड (uniformly sampled) VLM "थिंकर" शाखा के साथ एकीकृत करके लेटेंट वर्ल्ड मॉडल्स को उन्नत करता है, जिससे अधिक सुदृढ़ प्रक्षेपवक्र पूर्वानुमान (trajectory forecasting) प्राप्त करने के लिए लोकल एक्सट्रपलेशन (local extrapolation) और स्पार्स सैंपलिंग (sparse sampling) की सीमाओं को दूर किया जा सके।

Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu2026-03-24
💬 NLP

WorldCache: Content-Aware Caching for Accelerated Video World Models

WorldCache एक प्रशिक्षण-मुक्त, धारणा-प्रतिबंधित (perception-constrained) गतिशील कैशिंग फ्रेमवर्क है जो मोशन-एडेप्टिव थ्रेशोल्ड और फीचर वार्पिंग को पेश करके डिफ्यूजन ट्रांसफार्मर-आधारित वीडियो वर्ल्ड मॉडल्स को त्वरित करता है, जिससे 99.4% बेसलाइन गुणवत्ता को बनाए रखते हुए और घोस्टिंग आर्टिफैक्ट्स को समाप्त करते हुए 2.3× इन्फरेंस स्पीडअप प्राप्त होता है।

Umair Nawaz, Ahmed Heakl, Ufaq Khan, Abdelrahman Shaker, Salman Khan, Fahad Shahbaz Khan2026-03-24
💬 NLP

Control Illusion: The Failure of Instruction Hierarchies in Large Language Models

यह शोध पत्र प्रकट करता है कि बड़े भाषा मॉडल पदानुक्रमित निर्देश योजनाओं को विश्वसनीय रूप से लागू करने में विफल रहते हैं, क्योंकि उनका व्यवहार स्पष्ट सिस्टम-यूज़र भूमिका भेदों के बजाय प्रीट्रेनिंग से प्राप्त अंतर्निहित सामाजिक पूर्वग्रहों (social priors) से अधिक प्रभावित होता है।

Yilin Geng, Haonan Li, Honglin Mu, Xudong Han, Timothy Baldwin, Omri Abend, Eduard Hovy, Lea Frermann2026-03-23
💬 NLP

Improved Generalized Planning with LLMs through Strategy Refinement and Reflection

यह शोध पत्र LLM-आधारित सामान्यीकृत योजना (generalized planning) के लिए एक उन्नत ढांचे को प्रस्तुत करता है जो स्वचालित डिबगिंग के साथ स्यूडोकोड-आधारित रणनीति परिशोधन (pseudocode-based strategy refinement) को पेश करके, विफलताओं का निदान करने के लिए प्रतिबिंब (reflection) को शामिल करके, और कई प्रोग्राम वेरिएंट उत्पन्न करके योजना की गुणवत्ता को बढ़ाता है, जिससे 17 बेंचमार्क डोमेन में औसतन 82% कवरेज प्राप्त होता है।

Katharina Stein, Nils Hodel, Daniel Fišer, Jörg Hoffmann, Michael Katz, Alexander Koller2026-03-23
💬 NLP

LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation

LiRA एक मल्टी-एजेंट फ्रेमवर्क है जो विश्वसनीय, पठनीय और तथ्यात्मक रूप से सटीक वैज्ञानिक समीक्षाएं उत्पन्न करने के लिए विशिष्ट सहयोगात्मक एजेंटों के माध्यम से मानव साहित्य समीक्षा प्रक्रिया का अनुकरण करता है, जो लेखन और उद्धरण गुणवत्ता में मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है।

Gregory Hok Tjoan Go, Khang Ly, Anders Søgaard, Amin Tabatabaei, Maarten de Rijke, Xinyi Chen2026-03-23
💬 NLP

Can AI Truly Represent Your Voice in Deliberations? A Comprehensive Study of Large-Scale Opinion Aggregation with LLMs

यह शोध पत्र DeliberationBank, एक बड़े पैमाने पर मानव-एनोटेटेड डेटासेट, और DeliberationJudge, एक फाइन-ट्यून्ड मॉडल को प्रस्तुत करता है जो एआई-संचालित सार्वजनिक विचार-विमर्श में अल्पसंख्यक दृष्टिकोणों के कम प्रतिनिधित्व जैसे निरंतर पूर्वाग्रहों को व्यवस्थित रूप से पहचानने और उन्हें संबोधित करने के लिए विचार-विमर्श सारांशों का मूल्यांकन करने में एलएलएम (LLMs) से बेहतर प्रदर्शन करता है।

Shenzhe Zhu, Shu Yang, Michiel A. Bakker, Alex Pentland, Jiaxin Pei2026-03-23
💬 NLP

Modeling Turn-Taking with Semantically Informed Gestures

यह शोध पत्र 2,663 सिमेंटिक जेस्चर एनोटेशन के साथ DnD Gesture++ डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि इन सिमेंटिक रूप से सूचित जेस्चर्स को एकीकृत करने वाला एक मिक्स्चर-ऑफ-एक्सपर्ट्स फ्रेमवर्क, केवल टेक्स्ट और ऑडियो पर निर्भर बेसलाइन्स की तुलना में मल्टीमॉडल टर्न-टेकिंग प्रेडिक्शन में महत्वपूर्ण सुधार करता है।

Varsha Suresh, M. Hamza Mughal, Christian Theobalt, Vera Demberg2026-03-23
💬 NLP

BitSkip: An Empirical Analysis of Quantization and Early Exit Composition in Transformers

यह शोधपत्र BitSkip प्रस्तुत करता है, जो यह दर्शाता है कि बिना हैडामार्ड ट्रांसफॉर्म वाला एक सरल 8-बिट क्वांटाइज्ड मॉडल, जटिल 4-बिट और हैडामार्ड-संवर्धित समकक्षों से बेहतर प्रदर्शन करता है और इष्टतम अर्ली-एग्जिट रणनीतियों के माध्यम से महत्वपूर्ण गति लाभ प्राप्त करता है।

Ramshankar Bhuvaneswaran, Handan Liu2026-03-23