🧬 biology

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet एक 120M-पैरामीटर वाला पदानुक्रमित जीनोमिक फाउंडेशन मॉडल है जो डायनेमिक चंकिंग और लर्नड रूटिंग के माध्यम से अनसुपरवाइज्ड, लर्नबल टोकनाइजेशन पेश करता है, जो प्रमोटर मोटिफ्स और स्प्लिस जंक्शनों जैसी जैविक रूप से प्रासंगिक संरचनाओं के साथ एडेप्टिव सीक्वेंस बाउंड्रीज़ को संरेखित करके हिस्टोन मॉडिफिकेशन कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है और 20 गुना बड़े मॉडलों से बेहतर प्रदर्शन करता है।

Daria Ledneva, Denis Kuznetsov2026-06-04
💬 NLP

Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents

यह शोधपत्र SegTreeMem को प्रस्तुत करता है, जो एक ऐसी मेमोरी आर्किटेक्चर है जो कालानुक्रमिक संदर्भ (chronological context) को संरक्षित करने के लिए बातचीत के इतिहास को एक समयानुसार क्रमबद्ध सेगमेंट ट्री (segment tree) में व्यवस्थित करती है, और यह प्रदर्शित करती है कि मौजूदा फ्लैट, ग्राफ या ट्री-आधारित मेमोरी सिस्टम की तुलना में कालानुक्रमिक क्रम बनाए रखना लॉन्ग-होरिजन कन्वर्सेशनल एजेंट्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yifan Simon Liu, Liam Gallagher, Faeze Moradi Kalarde, Jiazhou Liang, Armin Toroghi, Scott Sanner2026-06-04
💬 NLP

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

यह शोध पत्र VCIFBench प्रस्तुत करता है, जो वीडियो समझ कार्यों में जटिल, बाधा-युक्त निर्देशों का पालन करने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो वर्तमान प्रदर्शन अंतराल को प्रकट करता है और संवर्धन के लिए DPO प्रशिक्षण की प्रभावकारिता को प्रदर्शित करता है।

Huangchen Xu, Yuan Wu, Yi Chang2026-06-04
💬 NLP

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

यह शोध पत्र एक नए बेंचमार्क का उपयोग करते हुए नौ MLLMs में मल्टी-वीडियो सारांशीकरण (multi-video summarization) में स्थितिजन्य पूर्वाग्रह (positional bias) का व्यवस्थित रूप से मूल्यांकन करता है, जिससे यह पता चलता है कि सारांश की गुणवत्ता इनपुट के क्रम और डोमेन से महत्वपूर्ण रूप से प्रभावित होती है, और वर्तमान न्यूनीकरण रणनीतियाँ इन पूर्वाग्रहों को पूरी तरह से समाप्त करने में विफल रहती हैं।

Huangchen Xu, Yuan Wu, Yi Chang2026-06-04
💬 NLP

Hybrid Adversarial Defence for Natural Language Understanding Tasks

यह शोध पत्र एक हाइब्रिड एडवर्सरियल डिफेंस फ्रेमवर्क प्रस्तावित करता है जो एंट्रॉपी, अनिश्चितता और ज्यामितीय विशेषताओं को एकीकृत करता है ताकि लार्ज लैंग्वेज मॉडल्स की मतिभ्रम (hallucinations) और एडवर्सरियल हमलों के विरुद्ध मजबूती को एक साथ बढ़ाया जा सके, जो विविध इन-डोमेन और आउट-ऑफ-डिस्ट्रीब्यूशन नेचुरल लैंग्वेज अंडरस्टैंडिंग डेटासेट्स पर क्लीन-टास्क प्रदर्शन और सुरक्षा दोनों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Manar Abouzaid, Yang Wang, Chenghua Lin, Stuart E. Middleton2026-06-04
💬 NLP

CRAFT: Cost-aware Refinement And Front-aware Tuning of Prompts

CRAFT एक पारेटो-फ्रंट (Pareto-front) प्रॉम्प्ट ऑप्टिमाइज़र है जो वैलिडेशन कॉल्स को एक दुर्लभ संसाधन मानकर स्केलरलाइजेशन कोलैप्स (scalarization collapse) की सीमाओं से बचता है ताकि विभिन्न कार्यों में इष्टतम सटीकता-लागत ट्रेड-ऑफ (accuracy-cost trade-offs) प्रदान करने वाले प्रॉम्प्ट्स के एक विविध सेट को कुशलतापूर्वक खोजा जा सके।

Shanu Kumar, Shubhanshu Khandelwal, Akhila Yesantarao Venkata, Parag Agrawal, Yova Kementchedjhieva, Manish Gupta2026-06-04
💬 NLP

DuDi: Dual-Signal Distillation with Cross-Lingual Verbalizer

यह शोध पत्र DuDi को प्रस्तुत करता है, जो एक क्रॉस-लिंगुअल वर्बलाइज़र द्वारा संवर्धित एक ड्यूल-सिग्नल डिस्टिलेशन फ्रेमवर्क है, जो अनुक्रम-स्तरीय (sequence-level) और टोकन-स्तरीय (token-level) पर्यवेक्षण संकेतों को जोड़कर छोटे भाषा मॉडलों की बहुभाषी क्षमताओं को, विशेष रूप से दक्षिण-पूर्व एशियाई भाषाओं के लिए, प्रभावी ढंग से सुधारता है।

Patomporn Payoungkhamdee, Tinnakit Udsa, Jian Gang Ngui, Sarana Nutanong, Alham Fikri Aji, Peerat Limkonchotiwat2026-06-04
💬 NLP

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms

यह शोध पत्र LivingScreen को प्रस्तुत करता है, जो गतिशील लघु-वीडियो प्लेटफार्मों पर संचालित होने वाले "Living-Screen-Native" GUI एजेंटों के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल निरंतर बदलते कंटेंट के बीच अवलोकन के समय (observation timing) को प्रभावी ढंग से नियंत्रित करने में असमर्थता के कारण मानव प्रदर्शन का मुकाबला करने में विफल रहते हैं।

Jiashu Yao, Heyan Huang, Daiqing Wu, Wangke Chen, Huaxi Ai, Haoyu Wen, Zeming Liu, Yuhang Guo2026-06-04
💬 NLP

Query-based Cross-Modal Projector Bolstering Mamba Multimodal LLM

यह शोध पत्र एक क्वेरी-आधारित क्रॉस-मोडल प्रोजेक्टर पेश करता है जो क्रॉस-अटेंशन के माध्यम से विजुअल टोकन को संकुचित करके और मैन्युअल 2D स्कैन ऑर्डरिंग की आवश्यकता को समाप्त करके माम्बा (Mamba) आधारित मल्टीमॉडल एलएलएम (LLM) को उन्नत करता है, जिससे ट्रांसफॉर्मर की कम्प्यूटेशनल सीमाओं को संबोधित करते हुए प्रदर्शन और थ्रूपुट दोनों में सुधार होता है।

SooHwan Eom, Jay Shim, Gwanhyeong Koo, Haebin Na, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo2026-06-04
⚡ electrical engineering

Multilingual Long-Form Speech Instruction Following: KIT's Submission to IWSLT 2026

KIT का IWSLT 2026 इंस्ट्रक्शन फॉलोइंग ट्रैक के लिए सबमिशन एक बहुभाषी लॉन्ग-फॉर्म स्पीच इंस्ट्रक्शन सिस्टम प्रस्तुत करता है जो 10 लाख से अधिक प्रशिक्षण उदाहरण उत्पन्न करने के लिए एक डेटा ऑग्मेंटेशन पाइपलाइन का लाभ उठाता है और लॉन्ग-फॉर्म इन्फरेंस में सिमेंटिक डिग्रेडेशन (अर्थ संबंधी गिरावट) को दूर करने के लिए मिनिमम बेयस रिस्क के साथ लाइकलीहुड-आधारित री-रैंकिंग को संयोजित करने वाली एक हाइब्रिड डिकोडिंग रणनीति का उपयोग करता है।

Enes Yavuz Ugan, Maike Züfle, Yuka Ko, Supriti Sinhamahapatra, Fabian Retkowski, Seymanur Akti, Jan Niehues, Alexander W (…)2026-06-04