💻 computer science

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

यह शोध पत्र VideoFDB को प्रस्तुत करता है, जो वास्तविक दुनिया की द्वैत (dyadic) अंतःक्रियाओं का विश्लेषण करके फुल-डुप्लेक्स ऑडियो-विजुअल संवादात्मक एजेंटों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान प्रणालियाँ स्पष्ट दृश्य प्रश्नों को संभालने की अपनी क्षमता के बावजूद, स्वाभाविक गैर-मौखिक संचार के लिए स्ट्रीमिंग दृश्य संकेतों को प्रभावी ढंग से एकीकृत करने में विफल रहती हैं।

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini (…)2026-05-29
🤖 AI

Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection

यह शोध पत्र 'लॉन्ग' (Loong) का परिचय देता है, जो लंबे दस्तावेज़ों के अनुवाद के लिए एक मानव-समान एजेंट है, जो विंडो सीमाओं और अतिरेक (redundancy) को दूर करने के लिए 3E मेमोरी मॉड्यूल और सुदृढीकरण लर्निंग-आधारित अनुकूली संदर्भ चयन (reinforcement learning-based adaptive context selection) का उपयोग करता है, जिससे कई भाषाओं और डोमेन में महत्वपूर्ण गुणवत्ता सुधार और मजबूती प्राप्त होती है।

Yutong Wang, Xuebo Liu, Derek F. Wong, Zhilin Li, Rongqing Jiang, Min Zhang, Shimin Tao, Daimeng Wei, Min Zhang2026-05-29
🤖 machine learning

Self-Trained Verification for Training- and Test-Time Self-Improvement

यह शोध पत्र सेल्फ-ट्रेन्ड वेरिफिकेशन (STV) को प्रस्तुत करता है, जो एक बेहतर वेरीफायर को प्रशिक्षित करने के लिए संदर्भ समाधानों (reference solutions) के साथ और उनके बिना त्रुटियों का पता लगाने की एक मॉडल की क्षमता के बीच की विषमता का लाभ उठाता है, जो बदले में जटिल तर्क कार्यों के लिए टेस्ट-टाइम रिफाइनमेंट लूप्स और ट्रेनिंग-टाइम सेल्फ-इम्प्रूवमेंट दोनों को महत्वपूर्ण रूप से बढ़ाता है।

Chen Henry Wu, Aditi Raghunathan2026-05-29
🤖 machine learning

Resolution Diagnostics for Paired LLM Evaluation

यह शोध पत्र वर्तमान युग्मित (paired) LLM लीडरबोर्ड में एक महत्वपूर्ण सांख्यिकीय शक्ति की कमी (statistical power deficit) का निदान करता है, जो यह प्रकट करता है कि अपर्याप्त नमूना आकार और अनपेयर्ड प्रभाव-आकार (unpaired effect-size) के शॉर्टकट के व्यापक दुरुपयोग के कारण कई युग्मवार रैंकिंग अनिर्णायक हैं, जो आवश्यक नमूना आकार को लगभग दो गुना कम करके आंकते हैं।

Anany Kotawala2026-05-29
💻 computer science

COMPOSE: Composing Future Theorems from Citations and Formal Structure

यह शोध पत्र COMPOSE का परिचय देता है, जो एक डुअल-ग्राफ फ्रेमवर्क है जो वैज्ञानिक उद्धरण संदर्भों (scientific citation contexts) और औपचारिक प्रमेय निर्भरताओं (formal theorem dependencies) का संयुक्त रूप से लाभ उठाकर संभावित भविष्य के गणितीय प्रमेयों को उत्पन्न करता है, और एक नए निर्मित डेटासेट और बेंचमार्क के माध्यम से उत्कृष्ट प्रदर्शन प्रदर्शित करता है।

David Busbib, Michael Werman2026-05-29
🤖 AI

Demystifying Data Organization for Enhanced LLM Training

यह शोध पत्र चार प्रमुख दिशा-निर्देशों को औपचारिक रूप देने और दो नवीन क्रम विधियों, STR और SAW को पेश करने के माध्यम से लार्ज लैंग्वेज मॉडल (LLM) प्रशिक्षण के लिए रणनीतिक डेटा संगठन के अल्प-अन्वेषित क्षेत्र को संबोधित करता है, जो न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ प्रशिक्षण स्थिरता और प्रदर्शन को बढ़ाने के लिए पूर्व-निर्धारित नमूना स्कोर का लाभ उठाते हैं।

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Y (…)2026-05-29
🤖 AI

Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents

यह शोध पत्र एक रनटाइम-कंप्यूटेबल कंपोजिशनल रेसिडुअल (runtime-computable compositional residual) का उपयोग करके मल्टी-कंपोनेंट एलएलएम एजेंटों में "स्थानीय रूप से सुसंगत, वैश्विक रूप से असंगत" (locally coherent, globally incoherent) विफलता मोड को औपचारिक रूप देता है और परिमाणित करता है, यह प्रदर्शित करते हुए कि स्थानीय सुसंगतता अक्सर वैश्विक संभाव्यता निरंतरता सुनिश्चित करने में विफल रहती है और वर्तमान एलएलएम-पक्ष शमन अप्रभावी हैं, जबकि नियतात्मक प्रक्षेपण (deterministic projection) और अनुक्रमिक निगरानी (sequential monitoring) व्यवहार्य समाधान प्रदान करते हैं।

Anany Kotawala2026-05-29
🤖 AI

Unlocking the Working Memory of Large Language Models for Latent Reasoning

यह शोध पत्र रीजनिंग इन मेमोरी (RiM) का परिचय देता है, जो एक कंप्यूट-कुशल लेटेंट रीजनिंग विधि है जो ऑटोरेग्रेसिव थॉट जनरेशन को फिक्स्ड मेमोरी ब्लॉक्स से बदल देती है, जिससे लार्ज लैंग्वेज मॉडल्स को मध्यवर्ती चरणों को बाहरी रूप से प्रस्तुत किए बिना आंतरिक तर्क के लिए वर्किंग मेमोरी का उपयोग करने में सक्षम बनाया जा सके।

Lukas Aichberger, Sepp Hochreiter2026-05-29
🤖 AI

SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations

यह शोध पत्र SchGen को प्रस्तुत करता है, जो प्राकृतिक भाषा के अनुरोधों से संपादन योग्य (editable) PCB स्कीमैटिक्स उत्पन्न करने में सक्षम पहला लार्ज लैंग्वेज मॉडल है, जो पारंपरिक ज्यामिति-प्रधान (geometry-heavy) स्कीमैटिक प्रारूपों की सीमाओं को दूर करने के लिए एक नवीन अर्थपूर्ण रूप से आधारित (semantically grounded) कोड प्रतिनिधित्व और एक बड़े पैमाने के डेटासेट का उपयोग करके उच्च सटीकता प्राप्त करता है।

Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu2026-05-29
🤖 machine learning

LLMSurgeon: Diagnosing Data Mixture of Large Language Models

यह शोध पत्र LLMSurgeon को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो व्यवस्थित डोमेन भ्रम (systematic domain confusion) को ठीक करने के लिए एक प्रतिबंधित व्युत्क्रम समस्या (constrained inverse problem) को हल करके लार्ज लैंग्वेज मॉडल्स के प्रीट्रेनिंग डेटा मिश्रण का अनुमान लगाता है, जिससे मॉडल के प्रशिक्षण डेटा तक पहुँच प्राप्त किए बिना उसके "डिजिटल डीएनए" के पोस्ट-हॉक ऑडिटिंग को सक्षम बनाया जा सके।

Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen2026-05-29