🤖 AI

AI Tour Meeting: Group Travel Planning by LLM Agents

यह शोध पत्र "AI टूर मीटिंग" प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्राकृतिक भाषा चर्चा के माध्यम से समूह यात्रा कार्यक्रमों की योजना बनाने के लिए विशिष्ट व्यक्तित्व वाले कई लार्ज लैंग्वेज मॉडल एजेंटों का उपयोग करता है, जो मल्टी-एजेंट व्यवहारों के अनुकरण और विश्लेषण के लिए एक लचीले उपकरण के रूप में कार्य करता है।

Daisuke Kikuta2026-07-22
💬 NLP

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD-Parsing एक पदानुक्रमित समानांतर डिकोडिंग प्रतिमान (hierarchical parallel decoding paradigm) पेश करता है जो वैश्विक लेआउट विश्लेषण को समवर्ती ब्लॉक-स्तरीय सामग्री निर्माण और प्रगतिशील मल्टी-टोकन भविष्यवाणी के साथ जोड़ता है, जिससे प्रतिस्पर्धी सटीकता बनाए रखते हुए 4,752 टोकन-प्रति-सेकंड का थ्रूपुट (मौजूदा मॉडलों से 2.62 गुना तेज़) प्राप्त होता है।

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cu (…)2026-07-22
💬 NLP

From a Multilingual Streaming ASR Backbone to Kenyan-Language Systems: Data-Centric Adaptation of Nemotron 3.5 for Kikuyu, Dholuo, and Kalenjin

यह शोध पत्र कॉर्पस ऑडिटिंग और नॉर्मलाइज़ेशन जैसी डेटा-केंद्रित रणनीतियों के माध्यम से किकुयू, धोलुओ और कालेनजिन भाषाओं के लिए NVIDIA के नेमोट्रॉन 3.5 स्ट्रीमिंग ASR मॉडल को अनुकूलित करने पर एक व्यापक इंजीनियरिंग अध्ययन प्रस्तुत करता है, जो विशिष्ट WER और CER मेट्रिक्स प्राप्त करते हुए गैर-मानक मूल्यांकन प्रोटोकॉल के कारण स्टेट-ऑफ-द-आर्ट दावों की अनुपस्थिति के साथ चुनौतियों, नकारात्मक निष्कर्षों और पारदर्शिता के साथ रिपोर्टिंग को प्रदर्शित करता है।

Mark Gatere2026-07-22
💬 NLP

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

यह शोध पत्र स्टेप-लेवल सेल्फ-कंसिस्टेंसी ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (SSC-GRPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो कई रीजनिंग रोलआउट्स के माध्यम से सेल्फ-कंसिस्टेंसी स्कोर के आधार पर स्टेप-लेवल रिवार्ड्स प्रदान करके लार्ज लैंग्वेज मॉडल्स में कॉन्टेक्स्ट-सेंसिटिव तथ्यात्मक मतिभ्रम (hallucinations) को कम करती है, जिससे गणितीय तर्क और मतिभ्रम बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao2026-07-22
💬 NLP

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing

यह शोध पत्र ट्रांसक्रिप्शन शैली को एएसआर (ASR) मॉडल में एक नियंत्रणीय लेटेंट वेरिएबल के रूप में मानने का प्रस्ताव देता है, जो यह प्रदर्शित करता है कि कवरेज-अवेयर डिकोडर टोकन और सुपरवाइज्ड क्रॉस-अटेंशन फाइन-ट्यूनिंग वर्बेटिम सटीकता, डिसफ्लुएंसी डिटेक्शन और शब्द-स्तरीय टाइमिंग में महत्वपूर्ण सुधार कर सकते हैं, साथ ही उच्च गुणवत्ता वाले वर्बेटिम स्पीच कॉर्पोरा के निर्माण को स्केल करने के लिए एक नया कार्य भी पेश करते हैं।

Laurin Wagner (nyra labs), Mario Zusag (nyra labs), Bernhard Thallinger (nyra labs)2026-07-22
💬 NLP

Constrained CTC Decoding for Efficient Diacritic Restoration

यह शोध पत्र अरबी भाषण स्वर चिह्न बहाली (diacritic restoration) के लिए एक कुशल गैर-ऑटोरेग्रेसिव CTC-आधारित विधि प्रस्तावित करता है जो अधिक जटिल मल्टी-मोडल बेसलाइन की तुलना में सांख्यिकीय रूप से महत्वपूर्ण त्रुटि दर कमी प्राप्त करने के लिए कैरेक्टर-लेवल लैटिस पर हार्ड कंस्ट्रेंट्स का उपयोग करता है।

Rufael Marew, Amr Keleg, Hanan Aldarmaki2026-07-22
💬 NLP

Verifiable Self-Evolution for Open-Ended Dialogue Skills via Future-Feedback Prediction

यह शोध पत्र "फ्यूचर-फीडबैक स्किल इवोल्यूशन" (future-feedback skill evolution) का प्रस्ताव करता है, जो ओपन-एंडेड संवाद प्रतिक्रियाओं के मूल्यांकन की चुनौती को एक सत्यापन योग्य ऑफलाइन प्रेडिक्शन टास्क में परिवर्तित करता है, जिसमें मॉडल्स को यह पूर्वानुमान लगाने के लिए प्रशिक्षित किया जाता है कि क्या एक दी गई प्रतिक्रिया सकारात्मक या नकारात्मक आगामी उपयोगकर्ता संकेतों की ओर ले जाएगी, जिससे लाइव ट्रैफिक टेस्टिंग की आवश्यकता के बिना पुनरुत्पादक स्व-विकास (self-evolution) सक्षम हो जाता है।

ChaoJin Zhao, Xuan Jiang2026-07-22
💬 NLP

AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism

ऑटोजर्न (AutoJourn) एक प्रदर्शन प्रणाली है जो प्रॉम्प्ट इंजीनियरिंग, रिट्रीवल ऑग्मेंटेशन और बायस विश्लेषण की एक एकीकृत पाइपलाइन के माध्यम से सोशल मीडिया से विविध दृष्टिकोण निकालने, संतुलित बहु-परिप्रेक्ष्य समाचार सारांश उत्पन्न करने और स्वचालित पत्रकारिता में पूर्वाग्रह का पता लगाने या उसे निष्प्रभावी करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाती है।

Himel Ghosh, Ahmed Mosharafa, Georg Groh2026-07-22
💬 NLP

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

यह सर्वेक्षण मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में कम्प्यूटेशनल ह्यूमर (व्यंग्य/हास्य) का एक व्यापक अवलोकन प्रदान करता है, जो इस क्षेत्र को पहचान से लेकर सृजन तक की क्षमताओं के आधार पर व्यवस्थित करता है, वर्तमान डेटासेट्स और मूल्यांकन प्रोटोकॉल को संश्लेषित करता है, और सांस्कृतिक सीमाओं एवं सुरक्षा संबंधी चिंताओं जैसे प्रमुख चुनौतियों की पहचान करता है।

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin2026-07-22
💬 NLP

Content is What Remains: Invariant Speech Tokenization from Parallel Utterances

यह शोध पत्र PINT को प्रस्तुत करता है, जो एक नवीन स्पीच टोकेनाइजेशन विधि है जो SSL एनकोडर्स को फाइन-ट्यून करने के लिए समानांतर उत्तरावली (parallel utterances) का लाभ उठाता है, जो वक्ता की पहचान और प्रोसोडी जैसे ध्वनिक विविधताओं से भाषाई सामग्री को प्रभावी ढंग से अलग करके कम-एन्ट्रॉपी वाले, टेम्पोरल रूप से ग्राउंडेड सिमेंटिक टोकन उत्पन्न करता है जो स्पीकर डिसेंटैंगलमेंट और लैंग्वेज मॉडलिंग में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करते हैं।

Laurin Wagner (nyra labs), Bernhard Thallinger (nyra labs), Miroslav Stankovic (nyra labs), Mario Zusag (nyra labs)2026-07-22