⚡ electrical engineering

CASTELLA: Long Audio Dataset with Captions and Temporal Boundaries

यह शोध पत्र CASTELLA को पेश करता है, जो ऑडियो मोमेंट रिट्रीवल के लिए एक बड़े पैमाने का, मानव-एनोटेटेड ऑडियो डेटासेट है जो पिछले छोटे पैमाने के या सिंथेटिक बेंचमार्क का महत्वपूर्ण विस्तार करता है और यह प्रदर्शित करता है कि इस वास्तविक दुनिया के डेटा पर फाइन-ट्यून किए गए मॉडल उन मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं जो केवल सिंथेटिक डेटा पर प्रशिक्षित किए गए हैं।

Hokuto Munakata, Takehiro Imamura, Taichi Nishimura, Tatsuya Komatsu2026-01-30
💬 NLP

LLM-based Few-Shot Early Rumor Detection with Imitation Agent

यह शोध पत्र एक नवीन फ्यू-शॉट अर्ली रयूमर डिटेक्शन (early rumor detection) फ्रेमवर्क का प्रस्ताव करता है जो इष्टतम प्रारंभिक समय बिंदुओं को निर्धारित करने के लिए एक प्रशिक्षित, हल्के स्वायत्त एजेंट को प्रशिक्षण-मुक्त एलएलएम (LLM) के साथ जोड़ता है, जिससे वास्तविक दुनिया के डेटासेट पर बेहतर सटीकता और शीघ्रता प्राप्त होती है और बड़े मॉडलों को फाइन-ट्यून करने की कम्प्यूटेशनल लागत से बचा जा सकता है।

Fengzhu Zeng, Qian Shao, Ling Cheng, Wei Gao, Shih-Fen Cheng, Jing Ma, Cheng Niu2026-01-30
💬 NLP

Mix, MinHash, and Match: Cross-Source Agreement for Multilingual Pretraining Datasets

यह शोधपत्र MixMinMatch को प्रस्तुत करता है, जो एक लागत प्रभावी विधि है जो अरबी, तुर्की और हिंदी के लिए उच्च-गुणवत्ता वाले बहुभाषी प्रीट्रेनिंग डेटासेट उत्पन्न करने हेतु क्रॉस-सोर्स रिडंडेंसी (cross-source redundancy) का एक मुफ्त गुणवत्ता फिल्टर के रूप में लाभ उठाती है, जिससे सिंगल-सोर्स बेसलाइन की तुलना में महत्वपूर्ण टोकन विविधता और प्रदर्शन सुधार प्राप्त होता है।

Sultan Alrashed, Francesco Orabona2026-01-30
💬 NLP

Discovering Multi-Scale Semantic Structure in Text Corpora Using Density-Based Trees and LLM Embeddings

यह शोध पत्र एक ऐसी नवीन विधि प्रस्तुत करता है जो स्थानीय घनत्व बाधाओं (local density constraints) को क्रमिक रूप से शिथिल करके लार्ज लैंग्वेज मॉडल एम्बेडिंग्स से बहु-स्तरीय अर्थपूर्ण पदानुक्रमों (multi-scale semantic hierarchies) का निर्माण करती है, जिससे पूर्व-निर्धारित वर्गीकरणों पर निर्भर किए बिना बड़े टेक्स्ट कॉर्पोरा में व्याख्या योग्य विषयगत संबंधों और संरचनात्मक संक्रमणों को प्रकट किया जा सके।

Thomas Haschka, Joseph Bakarji2026-01-30
💬 NLP

Towards Computational Chinese Paleography

यह शोध पत्र पृथक दृश्य कार्यों से एकीकृत डिजिटल पारिस्थितिक तंत्रों तक कम्प्यूटेशनल चीनी पुरालेखशास्त्र (paleography) के विकास को रेखांकित करता है, जो भविष्य के मानव-केंद्रित, बहुआयामी एआई प्रणालियों की वकालत करते हुए विद्वत्तापूर्ण अनुसंधान को बढ़ाने के लिए डेटा की कमी जैसी चुनौतियों का विश्लेषण करता है।

Yiran Rex Ma2026-01-30
💬 NLP

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

यह शोधपत्र "D-मॉडेल्स" (परिवर्तनीय, कार्य-असंगत सैंपलिंग संभावनाओं वाले) और "E-मॉडेल्स" (स्थिर, कार्य-संरेखित संभावनाओं वाले) के बीच अंतर करके लार्ज लैंग्वेज मॉडल्स में एक मौलिक विविधता-स्थिरता ट्रेड-ऑफ की पहचान करता है, जो वेब-स्केल अनुप्रयोगों में मॉडल चयन को अनुकूलित करने के लिए महत्वपूर्ण अंतर्दृष्टि प्रदान करता है।

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng2026-01-30
💬 NLP

ALRM: Agentic LLM for Robotic Manipulation

यह शोध पत्र ALRM को प्रस्तुत करता है, जो एक एजेंटिक LLM फ्रेमवर्क है जो प्राकृतिक भाषा तर्क और रोबोटिक हेरफेर के बीच के अंतर को एक मॉड्यूलर ReAct-शैली के लूप के माध्यम से पाटता है जो Code-as-Policy और Tool-as-Policy निष्पादन मोड दोनों का समर्थन करता है, जिसे 56 भाषाई रूप से विविध कार्यों के एक नए बेंचमार्क द्वारा मान्य किया गया है।

Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid2026-01-30
💬 NLP

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

यह शोध पत्र एक ट्रेन-फ्री, सेमी-कैस्केडेड फुल-डुप्लेक्स डायलॉग फ्रेमवर्क प्रस्तुत करता है जो बातचीत को न्यूनतम इकाइयों में विभाजित करता है ताकि एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल के माध्यम से स्वतंत्र प्रसंस्करण किया जा सके, जिसने ह्यूमन-लाइक स्पोकन डायलॉग सिस्टम्स चैलेंज में दूसरा स्थान प्राप्त किया है।

Haoyuan Yu, Yuxuan Chen, Minjie Cai2026-01-30
💬 NLP

DeepSearchQA: Bridging the Comprehensiveness Gap for Deep Research Agents

यह शोध पत्र DeepSearchQA को प्रस्तुत करता है, जो 17 क्षेत्रों में फैला हुआ 900-प्रॉम्प्ट वाला एक बेंचमार्क है जिसे जटिल, बहु-चरणीय सूचना-खोज कार्यों पर डीप रिसर्च एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी व्यवस्थित सूचना संकलन, एंटिटी रेजोल्यूशन और स्टॉपिंग क्राइटेरिया (विराम मानदंडों) में रिकॉल और प्रिसिजन के बीच संतुलन बनाने में संघर्ष करते हैं।

Nikita Gupta, Riju Chatterjee, Lukas Haas, Connie Tao, Andrew Wang, Chang Liu, Hidekazu Oiwa, Elena Gribovskaya, Jan Ack (…)2026-01-30
⚡ electrical engineering

asr_eval: Algorithms and tools for multi-reference and streaming speech recognition evaluation

यह शोध पत्र "asr_eval" प्रस्तुत करता है, जो एक व्यापक टूलकिट है जिसमें मल्टी-रेफरेंस और स्ट्रीमिंग स्पीच मूल्यांकन के लिए एक उन्नत स्ट्रिंग अलाइनमेंट एल्गोरिदम के साथ-साथ एक नया विविध रूसी लॉन्ग-फॉर्म डेटासेट और यह विश्लेषण शामिल है जो बताता है कि कैसे मॉडल विशिष्ट लेबलिंग शैलियों पर ओवरफिट होकर मेट्रिक्स को कृत्रिम रूप से बढ़ा सकते हैं।

Oleg Sedukhin, Andrey Kostin2026-01-30