💬 NLP

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

यह शोध पत्र क्रॉस-मोडल कोरेफरेंस (cross-modal coreference) को Omni-LLMs में एक महत्वपूर्ण बाधा के रूप में पहचानता है, इस क्षमता का मूल्यांकन करने के लिए CrossOmni डेटासेट प्रस्तुत करता है, और यह प्रदर्शित करता है कि प्रशिक्षण-मुक्त (training-free) और प्रशिक्षण-आधारित (training-based) दोनों रणनीतियाँ कोरेफरेंस-जागरूक सोच पैटर्न को प्रेरित करके सुदृढ़ ओम्नी-मोडल तर्क में महत्वपूर्ण सुधार करती हैं।

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang2026-04-08
💬 NLP

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

यह शोध पत्र लार्ज विजन-लैंग्वेज मॉडल्स के लिए एंड-टू-एंड दक्षता तकनीकों का एक व्यवस्थित वर्गीकरण प्रस्तुत करता है, जो एनकोडिंग, प्रीफिलिंग और डिकोडिंग चरणों में विजुअल टोकन डोमिनेंस (दृश्य टोकन प्रभुत्व) की बाधा को संबोधित करता है और विजुअल फिडेलिटी (दृश्य निष्ठा) एवं सिस्टम प्रदर्शन के बीच संतुलन बनाने के लिए भविष्य की सीमाओं को रेखांकित करता है।

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li2026-04-08
💬 NLP

Stop Fixating on Prompts: Reasoning Hijacking and Constraint Tightening for Red-Teaming LLM Agents

यह शोध पत्र JailAgent को प्रस्तुत करता है, जो एक नवीन रेड-टीमिंग फ्रेमवर्क है जो ट्रिगर निष्कर्षण (trigger extraction), तर्क हेरफेर (reasoning manipulation) और मेमोरी रिट्रीवल कंट्रोल के माध्यम से LLM एजेंटों पर हमला करने के लिए उनके रीजनिंग ट्राजेक्टरीज को अप्रत्यक्ष रूप से हाईजैक करके और बाधाओं को कड़ा करके, उपयोगकर्ता प्रॉम्प्ट संशोधन को दरकिनार करता है।

Yanxu Mao, Peipei Liu, Tiehan Cui, Congying Liu, Mingzhe Xing, Datao You2026-04-08
💬 NLP

AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery

AutoSOTA एक एंड-टू-एंड, मल्टी-एजेंट स्वचालित अनुसंधान प्रणाली है जो शीर्ष-स्तरीय शोध पत्रों के अत्याधुनिक (SOTA) AI मॉडलों को सफलतापूर्वक पुनरुत्पादित और अनुभवजन्य रूप से बेहतर बनाती है, जिसने संसाधन तैयारी, प्रयोग मूल्यांकन और प्रतिबिंब-संचालित विचारोन्मेष की तीन-चरणीय प्रक्रिया के माध्यम से 105 नए SOTA मॉडल खोजे हैं।

Yu Li, Chenyang Shao, Xinyang Liu, Ruotong Zhao, Peijie Liu, Hongyuan Su, Zhibin Chen, Qinglong Yang, Anjie Xu, Yi Fang (…)2026-04-08
💬 NLP

FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation--Full Version

यह शोध पत्र FastDiSS को पेश करता है, जो सीक्वेंस-टू-सीक्वेंस डिफ्यूजन लैंग्वेज मॉडल्स के लिए एक नवीन प्रशिक्षण ढांचा है, जो कुछ-चरणों (few-step) वाले सैंपलिंग में अप्रॉक्सिमेशन अंतराल (approximation gaps) को दूर करने के लिए विचलित स्व-अनुकूलन (perturbed self-conditioning) और टोकन-स्तरीय शोर जागरूकता (token-level noise awareness) का उपयोग करता है, जिससे प्रतिस्पर्धी जनरेशन गुणवत्ता बनाए रखते हुए 400 गुना तक तेज़ इन्फरेंस प्राप्त होता है।

Dat Nguyen-Cong, Tung Kieu, Hoang Thanh-Tung2026-04-08
💬 NLP

YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset

यह शोध पत्र YoNER को प्रस्तुत करता है, जो योरोबा भाषा के लिए पाँच विविध डोमेन में 5,000 वाक्यों वाला एक नया उच्च-गुणवत्ता वाला, बहु-डोमेन नामयुक्त इकाई पहचान (Named Entity Recognition) डेटासेट है, साथ ही इसमें OyoBERT भाषा मॉडल की रिलीज़ और एक व्यापक बेंचमार्क भी शामिल है जो क्रॉस-डोमेन सामान्यीकरण की चुनौतियों और इस कार्य के लिए अफ्रीकी-केंद्रित मॉडलों की श्रेष्ठता को प्रदर्शित करता है।

Peace Busola Falola, Jesujoba O. Alabi, Solomon O. Akinola, Folashade T. Ogunajo, Emmanuel Oluwadunsin Alabi, David Ifeo (…)2026-04-08
💬 NLP

See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs

यह शोध पत्र LVSpec को पेश करता है, जो एक वीडियो-LLM के लिए प्रशिक्षण-मुक्त स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है, जो कठोर सटीक-मिलान बाधाओं को दूर करने के लिए विजुअल-सिमेंटिक मार्गदर्शन और पोजीशन-शिफ्ट टॉलरेंस का लाभ उठाता है, जिससे 99.8% से अधिक मॉडल प्रदर्शन को बनाए रखते हुए 2.94x तक इन्फरेंस त्वरण प्राप्त होता है।

Yicheng Ji, Jun Zhang, Jinpeng Chen, Cong Wang, Lidan Shou, Gang Chen, Huan Li2026-04-08
💬 NLP

LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals

यह शोध पत्र एलएलएम (LLM) चेन-ऑफ-थॉट रीजनिंग को रिप्रेजेंटेशन स्पेस (representation space) के माध्यम से संरचित प्रक्षेप पथों (structured trajectories) के रूप में अभिलक्षित करता है, जो यह प्रकट करता है कि सही और गलत समाधान व्यवस्थित रूप से अंतिम चरणों में अलग हो जाते हैं ताकि सटीकता की भविष्यवाणी और इन्फ्रेंस-टाइम सुधार के लिए प्रक्षेप पथ-आधारित स्टीयरिंग (trajectory-based steering) सक्षम हो सके।

Lihao Sun, Hang Dong, Bo Qiao, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan2026-04-08
💬 NLP

Dialogue Act Patterns in GenAI-Mediated L2 Oral Practice: A Sequential Analysis of Learner-Chatbot Interactions

यह अध्ययन कक्षा 9 के चीनी EFL शिक्षार्थियों और एक GenAI वॉयस चैटबॉट के बीच 10 सप्ताह की बातचीत का विश्लेषण करता है, जो यह प्रकट करता है कि उच्च-प्रगति वाले सत्र शिक्षार्थी-प्रेरित प्रश्नों और समय पर, प्रॉम्प्टिंग-आधारित सुधारात्मक फीडबैक द्वारा विशिष्ट होते हैं, जिससे अनुकूलन योग्य L2 शैक्षिक चैटबॉट डिजाइन करने के लिए एक शिक्षण-आधारित ढांचा प्राप्त होता है।

Liqun He (Cindy), Shijun (Cindy), Chen, Mutlu Cukurova, Manolis Mavrikis2026-04-08
💬 NLP

Controlling Distributional Bias in Multi-Round LLM Generation via KL-Optimized Fine-Tuning

यह शोध पत्र एक नवीन फाइन-ट्यूनिंग फ्रेमवर्क प्रस्तावित करता है जो स्टीयरिंग टोकन कैलिब्रेशन को हाइब्रिड केएल-डाइवर्जेंस (KL-divergence) और कानमैन-ट्वर्स्की (Kahneman-Tversky) अनुकूलन उद्देश्य के साथ जोड़ता है ताकि बड़े भाषा मॉडलों (LLMs) के आउटपुट वितरणों को कई राउंड में प्रभावी ढंग से नियंत्रित और संरेखित किया जा सके, जो लिंग, नस्ल और भावना जैसे गुणों के संबंध में सांख्यिकीय रूप से प्रतिनिधि सामग्री उत्पन्न करने में मौजूदा विधियों की सीमाओं को संबोधित करता है।

Yanbei Jiang, Amr Keleg, Ryandito Diandaru, Jey Han Lau, Lea Frermann, Biaoyan Fang, Fajri Koto2026-04-08