💻 computer science

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

यह शोधपत्र IntentVLM को प्रस्तुत करता है, जो फॉरवर्ड-इनवर्स मॉडलिंग से प्रेरित एक नवीन दो-चरणीय वीडियो-भाषा ढांचा है, जो कार्य को लक्ष्य उम्मीदवार पीढ़ी और संरचित चयन में विभाजित करके ओपन-वोकेबुलरी मानव इरादा पहचान (human intention recognition) में अत्याधुनिक परिणाम प्राप्त करता है, जिससे मतिभ्रम (hallucinations) में उल्लेखनीय कमी आती है और मानव प्रदर्शन के समान स्तर तक पहुँचता है।

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani2026-04-28
🤖 machine learning

TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents

मल्टी-टर्न एजेंट ट्रेनिंग में संचयी त्रुटियों (compounding errors) के कारण होने वाली "ट्रैजेक्टरी-लेवल KL अस्थिरता" की समस्या को संबोधित करने के लिए, यह शोध पत्र **TCOD (टेम्पोरल करिकुलम ऑन-पॉलिसी डिस्टिलेशन)** का प्रस्ताव करता है, जो एक करिकुलम शेड्यूल के माध्यम से छात्र मॉडल (student model) को उजागर की जाने वाली ट्रैजेक्टरी की गहराई को क्रमिक रूप से बढ़ाकर प्रशिक्षण को स्थिर करता है और प्रदर्शन में सुधार करता है।

Jiaqi Wang, Wenhao Zhang, Weijie Shi, Yaliang Li, James Cheng2026-04-28
🔢 mathematics

QED: An Open-Source Multi-Agent System for Generating Mathematical Proofs on Open Problems

यह शोध पत्र QED को प्रस्तुत करता है, जो एक ओपन-सोर्स मल्टी-एजेंट सिस्टम है जिसे एक विशेष आर्किटेक्चर का उपयोग करके LLM बेंचमार्क प्रदर्शन और अनुसंधान-स्तरीय गणित के बीच के अंतर को पाटने के लिए डिज़ाइन किया गया है जो सात विशिष्ट विफलता मोडों को संबोधित करता है, और इसने एप्लाइड एनालिसिस और PDEs में पांच विशेषज्ञ-प्रदत्त खुले प्रश्नों में से तीन के लिए मौलिक और गैर-तुच्छ प्रमाण सफलतापूर्वक उत्पन्न किए हैं।

Chenyang An, Qihao Ye, Minghao Pan, Jiayaun Zhang2026-04-28
💻 computer science

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

यह शोध पत्र शेड्यूलिंग-स्ट्रक्चरल-लॉजिकल (SSL) प्रतिनिधित्व प्रस्तुत करता है, जो एजेंट कौशल के लिए एक नवीन संरचित ढांचा है जो शेड्यूलिंग, निष्पादन और तार्किक साक्ष्य को अलग करता है ताकि स्किल डिस्कवरी और रिस्क असेसमेंट कार्यों में टेक्स्ट-ओनली बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu2026-04-28
💻 computer science

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

एजेंटपल्स (AgentPulse) एक निरंतर, बहु-संकेत मूल्यांकन ढांचे को पेश करता है जो वास्तविक तैनाती परिदृश्यों में एआई एजेंटों के प्रदर्शन और प्रभाव का समग्र मूल्यांकन प्रदान करने के लिए एडॉप्शन (adoption), कम्युनिटी और इकोसिस्टम स्रोतों से रीयल-टाइम डेटा को एकत्रित करके स्टेटिक बेंचमार्क का पूरक बनता है।

Yuxuan Gao, Megan Wang, Yi Ling Yu2026-04-28
🔢 mathematics

Improving Robustness of Tabular Retrieval via Representational Stability

यह शोध पत्र यह पहचानता है कि विभिन्न टेबल सीरियलाइजेशन फॉर्मेट (जैसे CSV या HTML) असंगत रिट्रीवल परिणाम उत्पन्न करते हैं और सेंट्रॉइड-एवरेज्ड रिप्रेजेंटेशन और सिंगल-फॉर्मेट एम्बेडिंग्स को एक स्थिर, फॉर्मेट-इनवेरिएंट सिमेंटिक सिग्नल के साथ संरेखित करने के लिए एक लाइटवेट एडॉप्टर का उपयोग करके मजबूती में सुधार करने की एक विधि प्रस्तावित करता है।

Kushal Raj Bhandari, Adarsh Singh, Jianxi Gao, Soham Dan, Vivek Gupta2026-04-28
💻 computer science

A2DEPT: Large Language Model-Driven Automated Algorithm Design via Evolutionary Program Trees

A2DEPT एक नवीन ढांचा है जो कॉम्बिनेटोरियल ऑप्टिमाइज़ेशन समस्याओं के लिए पूर्ण, निष्पादन योग्य एल्गोरिदम को स्वायत्त रूप से संश्लेषित करने के लिए एक विकासवादी प्रोग्राम ट्री सर्च के भीतर सिस्टम-स्तरीय आर्किटेक्ट के रूप में लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिसे फीडबैक-संचालित मरम्मत तंत्र के साथ जोड़ा गया है, जिससे मौजूदा विधियों की कठोर टेम्पलेट सीमाओं को दूर किया जा सके और बेहतर प्रदर्शन प्राप्त किया जा सके।

Bin Chen, Shouliang Zhu, Beidan Liu, Yong Zhao, Tianle Pu, Huichun Li, Zhengqiu Zhu2026-04-28
💻 computer science

QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

यह शोध पत्र QEVA को प्रस्तुत करता है, जो नैरेटिव वीडियो सारांशीकरण (narrative video summarization) के लिए एक संदर्भ-मुक्त मूल्यांकन मीट्रिक है जो मल्टीमॉडल प्रश्नोत्तर (multimodal question answering) के माध्यम से कवरेज, तथ्यात्मकता और कालक्रम का आकलन करता है, साथ ही MLVU(VS)-Eval बेंचमार्क को भी प्रस्तुत करता है, जो मौजूदा विधियों की तुलना में मानव निर्णयों के साथ बेहतर सहसंबंध प्रदर्शित करता है।

Woojun Jung, Junyeong Kim2026-04-28
💻 computer science

Distilling Self-Consistency into Verbal Confidence: A Pre-Registered Negative Result and Post-Hoc Rescue on Gemma 3 4B

यह शोध पत्र रिपोर्ट करता है कि जहाँ Gemma 3 4B पर लेबल-एन्ट्रॉपी कोलैप्स (label-entropy collapse) के कारण सेल्फ-कंसिस्टेंसी (self-consistency) को वर्बल कॉन्फिडेंस (verbal confidence) में डिस्टिल करने का एक प्री-रजिस्टर्ड प्रयास विफल रहा, वहीं एक बाद के पोस्ट-हॉक रेस्क्यू ट्रेनिंग (post-hoc rescue training) ने अनफिल्टर्ड डेटा पर उच्च-सटीकता वाले सेल्फ-कंसिस्टेंसी सिग्नल्स को एक सिंगल-पास रीडआउट (single-pass readout) में सफलतापूर्वक संकुचित किया, जिसका AUROC2 0.774 था, जो यह प्रदर्शित करता है कि प्रभावी कॉन्फिडेंस कैलिब्रेशन के लिए लेबल एन्ट्रॉपी को बनाए रखना महत्वपूर्ण है।

Jon-Paul Cacioli2026-04-28
💻 computer science

The Pragmatic Persona: Discovering LLM Persona through Bridging Inference

यह शोध पत्र अंतर्निहित ब्रिजिंग अनुमानों (bridging inferences) को संरचित ज्ञान ग्राफ के रूप में मॉडल करके लार्ज लैंग्वेज मॉडल व्यक्तित्वों (LLM personas) की खोज के लिए एक नवीन ढांचे का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि विमर्श-स्तरीय अर्थ संबंधी सुसंगतता (discourse-level semantic coherence), पारंपरिक सतही-स्तरीय शाब्दिक या शैलीगत संकेतों की तुलना में व्यक्तित्व पहचान के लिए अधिक सुदृढ़ और स्थिर आधार प्रदान करती है।

Jisoo Yang (Chung-Ang University), Jongwon Ryu (Chung-Ang University), Minuk Ma (University of British Columbia), Trung (…)2026-04-28