💻 computer science

Co-Director: Agentic Generative Video Storytelling

यह शोध पत्र Co-Director प्रस्तुत करता है, जो एक पदानुक्रमित बहु-एजेंट ढांचा (hierarchical multi-agent framework) है जो वीडियो कहानी कहने (video storytelling) को मल्टी-आर्म्ड बैंडिट्स और स्थानीय स्व-परिष्करण (local self-refinement) का उपयोग करके एक वैश्विक अनुकूलन समस्या के रूप में औपचारिक रूप देता है ताकि सिमेंटिक ड्रिफ्ट (semantic drift) और कैस्केडिंग विफलताओं (cascading failures) को दूर किया जा सके, जिससे सुसंगत, उच्च-निष्ठा वाली आख्यानों को उत्पन्न करने में अत्याधुनिक बेसलाइनों से काफी बेहतर प्रदर्शन किया जा सके।

Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan Xu, Daniel Vlasic, Carina Claassen, Jasmine L (…)2026-04-29
💻 computer science

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

यह शोध पत्र "लेटेंट एजेंट्स" (Latent Agents) को प्रस्तुत करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो कंप्यूट-इंटेंसिव मल्टी-एजेंट डिबेट्स को एक एकल LLM में संकुचित (distill) करता है, जिससे 93% तक कम टोकन के साथ तुलनीय प्रदर्शन प्राप्त होता है और व्याख्या योग्य एजेंट-विशिष्ट एक्टिवेशन सबस्पेस (activation subspaces) का अनावरण होता है जो तर्क व्यवहारों पर अधिक कुशल नियंत्रण की सुविधा प्रदान करते हैं।

John Seon Keun Yi, Aaron Mueller, Dokyun Lee2026-04-29
💻 computer science

MultiHedge: Adaptive Coordination via Retrieval-Augmented Control

यह शोधपत्र MultiHedge को प्रस्तुत करता है, जो एक रिट्रीवल-ऑगमेंटेड (retrieval-augmented) LLM समन्वय ढांचा है, जो ऐतिहासिक पूर्ववृत्तों और कैनोनिकल ऑप्शन रणनीतियों का लाभ उठाकर बदलते परिवेश में मॉड्यूलर निर्णय लेने वाली प्रणालियों की मजबूती और स्थिरता को बढ़ाता है, यह प्रदर्शित करते हुए कि मेमोरी-ऑगमेंटेड रिट्रीवल केवल मॉडल के पैमाने को बढ़ाने से बेहतर प्रदर्शन करता है।

Feliks Bańka, Jarosław A. Chudziak2026-04-29
🤖 machine learning

Learning with Embedded Linear Equality Constraints via Variational Bayesian Inference

यह शोध पत्र एक वेरिएशनल बायेसियन अनुमान ढांचा प्रस्तावित करता है जो मशीन लर्निंग मॉडलों में रैखिक समानता बाधाओं को समाहित करता है ताकि यह सुनिश्चित किया जा सके कि भविष्यवाणियां ज्ञात भौतिक नियमों का पालन करती हैं और साथ ही मजबूत अनिश्चितता अनुमान प्रदान करती हैं, जो मानक बायेसियन न्यूरल नेटवर्क की तुलना में एक सिंगल-पार्टिकल बैटरी मॉडल पर बेहतर प्रदर्शन और बाधा अनुपालन प्रदर्शित करता है।

Matthew Marsh, Benoît Chachuat, Antonio del Rio Chanona2026-04-29
💬 NLP

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

यह शोध पत्र GAIA-v2-LILT को प्रस्तुत करता है, जो GAIA बेंचमार्क का एक कठोरता से पुन: ऑडिट किया गया बहुभाषी विस्तार है, जो कार्यात्मक संरेखण, सांस्कृतिक अनुकूलन और कठिनाई अंशांकन को संयोजित करने वाले एक परिष्कृत वर्कफ़्लो का उपयोग करता है ताकि यह प्रदर्शित किया जा सके कि न्यूनतम मशीन अनुवाद एजेंट प्रदर्शन मेट्रिक्स को महत्वपूर्ण रूप से विकृत करता है और उचित स्थानीयकरण बहुभाषी प्रदर्शन अंतराल को पर्याप्त रूप से कम करता है।

Yunsu Kim, Kaden Uhlig, Joern Wuebker2026-04-29
💻 computer science

S-SONDO: Self-Supervised Knowledge Distillation for General Audio Foundation Models

S-SONDO एक नवीन, आर्किटेक्चर-अज्ञेय (architecture-agnostic) फ्रेमवर्क है जो केवल आउटपुट एम्बेडिंग्स का उपयोग करके सामान्य ऑडियो फाउंडेशन मॉडल्स के लिए सेल्फ-सुपरवाइज्ड नॉलेज डिस्टिलेशन को सक्षम बनाता है, जो मूल प्रदर्शन का 96% तक बनाए रखते हुए बड़े मॉडल्स को काफी छोटे स्टूडेंट्स में सफलतापूर्वक संकुचित करता है।

Mohammed Ali El Adlouni, Aurian Quelennec, Pierre Chouteau, Geoffroy Peeters, Slim Essid2026-04-29
🤖 machine learning

Rethinking Layer Redundancy in Large Language Models: Calibration Objectives and Search for Depth Pruning

यह शोध पत्र तर्क देता है कि लार्ज लैंग्वेज मॉडल्स में लेयर रिडंडेंसी (परत अतिरेक) एक अंतर्निहित संरचनात्मक गुण नहीं है बल्कि यह कैलिब्रेशन उद्देश्य पर कार्यात्मक रूप से निर्भर है, जो यह प्रदर्शित करता है कि विशिष्ट सर्च एल्गोरिदम के उपयोग की तुलना में उद्देश्य का चयन डेप्थ प्रूनिंग परिणामों पर अधिक प्रभाव डालता है।

Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim, Youngjin Heo, Suin Cho, Seong-hun Kim, Woosang Lim, Gaeul Kwon2026-04-29
🤖 machine learning

Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence

नेमोट्रोन 3 नैनो ओम्नी (Nemotron 3 Nano Omni) एक नया ओपन-सोर्स मल्टीमॉडल मॉडल है जो मूल रूप से ऑडियो, टेक्स्ट, इमेज और वीडियो इनपुट का समर्थन करता है, जो 30B-A3B बैकबोन और टोकन-रिडक्शन तकनीकों के माध्यम से बेहतर सटीकता, एजेंटिक क्षमताएं और कुशल इन्फरेंस प्रदान करता है, जिसके चेकपॉइंट्स और कोड को आगे के अनुसंधान के समर्थन के लिए जारी किया गया है।

NVIDIA, :, Amala Sanjay Deshmukh, Kateryna Chumachenko, Tuomas Rintamaki, Matthieu Le, Tyler Poon, Danial Mohseni Taher (…)2026-04-29
💬 NLP

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

यह शोधपत्र बेंचगार्ड (BenchGuard) को प्रस्तुत करता है, जो एक स्वचालित ऑडिटिंग फ्रेमवर्क है जो टास्क-ओरिएंटेड एजेंट बेंचमार्क में दोषों को व्यवस्थित रूप से पहचानने और उन्हें मान्य करने के लिए फ्रंटियर एलएलएम (LLM) का लाभ उठाता है, जो कम लागत पर मानवीय समीक्षा द्वारा छूट जाने वाली महत्वपूर्ण त्रुटियों का पता लगाने में इसकी प्रभावशीलता को प्रदर्शित करता है।

Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi2026-04-29
🤖 machine learning

Compute Aligned Training: Optimizing for Test Time Inference

यह शोध पत्र "कंप्यूट अलाइन्ड ट्रेनिंग" (Compute Aligned Training) पेश करता है, जो एक नया फ्रेमवर्क है जो नए लॉस फंक्शन्स को व्युत्पन्न करके लार्ज लैंग्वेज मॉडल्स के ट्रेनिंग ऑब्जेक्टिव्स को टेस्ट-टाइम इन्फरेंस रणनीतियों के साथ संरेखित करता है, जिससे मानक SFT और RL दृष्टिकोणों की तुलना में प्रदर्शन स्केलिंग में महत्वपूर्ण सुधार होता है।

Adam Ousherovitch, Ambuj Tewari2026-04-29