💬 NLP

SANE Schema-aware Natural-language Evaluation of Biological Data

यह शोध पत्र SANE को पेश करता है, जो स्वचालित रूप से जनरेट किए गए बेंचमार्क का उपयोग करने वाला एक स्कीमा-जागरूक मूल्यांकन प्रतिमान (paradigm) है, जो यह प्रदर्शित करता है कि फ्यू-शॉट लार्ज लैंग्वेज मॉडल्स बिना फाइन-ट्यूनिंग के जैविक सूक्ष्मदर्शी डेटा (biological microscopy data) के लिए सटीक SQL क्वेरीreliably जनरेट कर सकते हैं, बशर्ते कि इनपुट सुव्यवस्थित हों और अस्पष्टता से सुरक्षित हों।

Rolf Gattung, Martin Krueger, Markus Reischl2026-06-04
💬 NLP

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA एक स्पार्स (sparse), डिकपल्ड अटेंशन आर्किटेक्चर पेश करता है जिसमें एक समर्पित "फोरकास्ट" (Forecast) प्रोजेक्शन है जो कुशल लुकअहेड सिलेक्शन और ओवरलैपिंग CPU-GPU प्रीफेचिंग को सक्षम बनाता है, जिससे KV कैश बाधाओं को दूर किया जा सकता है और चयन जटिलता को कम करते हुए सटीकता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को महत्वपूर्ण रूप से त्वरित किया जा सकता है।

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa2026-06-04
🧬 biology

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet एक 120M-पैरामीटर वाला पदानुक्रमित जीनोमिक फाउंडेशन मॉडल है जो डायनेमिक चंकिंग और लर्नड रूटिंग के माध्यम से अनसुपरवाइज्ड, लर्नबल टोकनाइजेशन पेश करता है, जो प्रमोटर मोटिफ्स और स्प्लिस जंक्शनों जैसी जैविक रूप से प्रासंगिक संरचनाओं के साथ एडेप्टिव सीक्वेंस बाउंड्रीज़ को संरेखित करके हिस्टोन मॉडिफिकेशन कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है और 20 गुना बड़े मॉडलों से बेहतर प्रदर्शन करता है।

Daria Ledneva, Denis Kuznetsov2026-06-04
💬 NLP

Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents

यह शोधपत्र SegTreeMem को प्रस्तुत करता है, जो एक ऐसी मेमोरी आर्किटेक्चर है जो कालानुक्रमिक संदर्भ (chronological context) को संरक्षित करने के लिए बातचीत के इतिहास को एक समयानुसार क्रमबद्ध सेगमेंट ट्री (segment tree) में व्यवस्थित करती है, और यह प्रदर्शित करती है कि मौजूदा फ्लैट, ग्राफ या ट्री-आधारित मेमोरी सिस्टम की तुलना में कालानुक्रमिक क्रम बनाए रखना लॉन्ग-होरिजन कन्वर्सेशनल एजेंट्स के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Yifan Simon Liu, Liam Gallagher, Faeze Moradi Kalarde, Jiazhou Liang, Armin Toroghi, Scott Sanner2026-06-04
💬 NLP

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

यह शोध पत्र VCIFBench प्रस्तुत करता है, जो वीडियो समझ कार्यों में जटिल, बाधा-युक्त निर्देशों का पालन करने की मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने और सुधारने के लिए डिज़ाइन किया गया एक व्यापक बेंचमार्क है, जो वर्तमान प्रदर्शन अंतराल को प्रकट करता है और संवर्धन के लिए DPO प्रशिक्षण की प्रभावकारिता को प्रदर्शित करता है।

Huangchen Xu, Yuan Wu, Yi Chang2026-06-04
💬 NLP

A Systematic Evaluation of Positional Bias in Multi-Video Summarization with MLLMs

यह शोध पत्र एक नए बेंचमार्क का उपयोग करते हुए नौ MLLMs में मल्टी-वीडियो सारांशीकरण (multi-video summarization) में स्थितिजन्य पूर्वाग्रह (positional bias) का व्यवस्थित रूप से मूल्यांकन करता है, जिससे यह पता चलता है कि सारांश की गुणवत्ता इनपुट के क्रम और डोमेन से महत्वपूर्ण रूप से प्रभावित होती है, और वर्तमान न्यूनीकरण रणनीतियाँ इन पूर्वाग्रहों को पूरी तरह से समाप्त करने में विफल रहती हैं।

Huangchen Xu, Yuan Wu, Yi Chang2026-06-04
💬 NLP

Hybrid Adversarial Defence for Natural Language Understanding Tasks

यह शोध पत्र एक हाइब्रिड एडवर्सरियल डिफेंस फ्रेमवर्क प्रस्तावित करता है जो एंट्रॉपी, अनिश्चितता और ज्यामितीय विशेषताओं को एकीकृत करता है ताकि लार्ज लैंग्वेज मॉडल्स की मतिभ्रम (hallucinations) और एडवर्सरियल हमलों के विरुद्ध मजबूती को एक साथ बढ़ाया जा सके, जो विविध इन-डोमेन और आउट-ऑफ-डिस्ट्रीब्यूशन नेचुरल लैंग्वेज अंडरस्टैंडिंग डेटासेट्स पर क्लीन-टास्क प्रदर्शन और सुरक्षा दोनों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Manar Abouzaid, Yang Wang, Chenghua Lin, Stuart E. Middleton2026-06-04
💬 NLP

CRAFT: Cost-aware Refinement And Front-aware Tuning of Prompts

CRAFT एक पारेटो-फ्रंट (Pareto-front) प्रॉम्प्ट ऑप्टिमाइज़र है जो वैलिडेशन कॉल्स को एक दुर्लभ संसाधन मानकर स्केलरलाइजेशन कोलैप्स (scalarization collapse) की सीमाओं से बचता है ताकि विभिन्न कार्यों में इष्टतम सटीकता-लागत ट्रेड-ऑफ (accuracy-cost trade-offs) प्रदान करने वाले प्रॉम्प्ट्स के एक विविध सेट को कुशलतापूर्वक खोजा जा सके।

Shanu Kumar, Shubhanshu Khandelwal, Akhila Yesantarao Venkata, Parag Agrawal, Yova Kementchedjhieva, Manish Gupta2026-06-04
💬 NLP

DuDi: Dual-Signal Distillation with Cross-Lingual Verbalizer

यह शोध पत्र DuDi को प्रस्तुत करता है, जो एक क्रॉस-लिंगुअल वर्बलाइज़र द्वारा संवर्धित एक ड्यूल-सिग्नल डिस्टिलेशन फ्रेमवर्क है, जो अनुक्रम-स्तरीय (sequence-level) और टोकन-स्तरीय (token-level) पर्यवेक्षण संकेतों को जोड़कर छोटे भाषा मॉडलों की बहुभाषी क्षमताओं को, विशेष रूप से दक्षिण-पूर्व एशियाई भाषाओं के लिए, प्रभावी ढंग से सुधारता है।

Patomporn Payoungkhamdee, Tinnakit Udsa, Jian Gang Ngui, Sarana Nutanong, Alham Fikri Aji, Peerat Limkonchotiwat2026-06-04
💬 NLP

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms

यह शोध पत्र LivingScreen को प्रस्तुत करता है, जो गतिशील लघु-वीडियो प्लेटफार्मों पर संचालित होने वाले "Living-Screen-Native" GUI एजेंटों के लिए पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल निरंतर बदलते कंटेंट के बीच अवलोकन के समय (observation timing) को प्रभावी ढंग से नियंत्रित करने में असमर्थता के कारण मानव प्रदर्शन का मुकाबला करने में विफल रहते हैं।

Jiashu Yao, Heyan Huang, Daiqing Wu, Wangke Chen, Huaxi Ai, Haoyu Wen, Zeming Liu, Yuhang Guo2026-06-04