🤖 AI

PPTArena: A Benchmark for PowerPoint Editing

यह शोध पत्र PPTArena प्रस्तुत करता है, जो वास्तविक दुनिया के स्लाइड संशोधनों का उपयोग करके पावरपॉइंट एडिटिंग एजेंटों के मूल्यांकन के लिए एक व्यापक बेंचमार्क है, और PPTPilot प्रस्तुत करता है, जो एक संरचना-जागरूक (structure-aware) एजेंट है जो सिमेंटिक प्लानिंग को प्रोग्रामेटिक और XML-आधारित ऑपरेशन्स के साथ जोड़कर मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है, साथ ही दीर्घकालिक दस्तावेज़ संपादन (long-horizon document editing) में शेष चुनौतियों पर प्रकाश डालता है।

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang2026-07-03
💻 computer science

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

यह शोध पत्र डायरेक्ट डिफ्यूजन स्कोर प्रेफरेंस ऑप्टिमाइजेशन (DDSPO) को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण विधि है जो कंट्रास्टिव पॉलिसी पेयर्स के माध्यम से बैकवर्ड डिनोइजिंग ट्रांजिशन पर सीधे स्टेपवाइज प्रेफरेंस सुपरविजन को परिभाषित करके डिफ्यूजन मॉडल अलाइनमेंट और सौंदर्य गुणवत्ता में सुधार करती है, जिससे टर्मिनल सैंपल्स से फॉरवर्ड-प्रोसेस एप्रोक्सिमेशन पर निर्भर मौजूदा विधियों की सीमाओं को दूर किया जा सके।

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo2026-07-03
💻 computer science

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

यह शोध पत्र क्रॉस-लेयर इंजेक्शन (CLI) को प्रस्तुत करता है, जो एक हल्का ढांचा है जो विजन-लैंग्वेज मॉडल्स में स्थिर एक-से-एक कनेक्शन को एडेप्टिव मल्टी-प्रोजेक्शन और एडेप्टिव गेटिंग फ्यूजन का उपयोग करने वाले एक गतिशील अनेक-से-अनेक आर्किटेक्चर के साथ बदल देता है ताकि LLMs को पदानुक्रमित दृश्य विशेषताओं (hierarchical visual features) तक चुनिंदा रूप से पहुँचने में सक्षम बनाया जा सके, जिससे 18 विविध बेंचमार्क में मल्टीमॉडल तर्क में महत्वपूर्ण सुधार होता है।

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao2026-07-03
💻 computer science

Drive-JEPA: Video JEPA Meets Multimodal Trajectory Distillation for End-to-End Driving

ड्राइव-जेपा (Drive-JEPA) प्रेडिक्टिव रिप्रेजेंटेशन लर्निंग के लिए वीडियो जॉइंट-एम्बेडिंग प्रेडिक्टिव आर्किटेक्चर (V-JEPA) को एक प्रपोजल-सेंट्रिक प्लानर के साथ एकीकृत करके एंड-टू-एंड ऑटोनॉमस ड्राइविंग में एक नया स्टेट-ऑफ-द-आर्ट स्थापित करता है, जो सिंगल-ट्रैजेक्टरी सुपरविजन की सीमाओं को दूर करने के लिए मल्टीमॉडल सिम्युलेटर-जनरेटेड ट्रेजेक्टरीज को डिस्टिल करता है।

Linhan Wang, Zichong Yang, Chen Bai, Guoxiang Zhang, Xiaotong Liu, Xiaoyin Zheng, Xiao-Xiao Long, Chang-Tien Lu, Cheng L (…)2026-07-03
💻 computer science

Language-Guided Transformer Tokenizer for Human Motion Generation

यह शोध पत्र LG-Tok का प्रस्ताव करता है, जो एक भाषा-निर्देशित ट्रांसफॉर्मर टोकेनाइज़र (Language-Guided Transformer Tokenizer) है जो प्राकृतिक भाषा को गति के साथ संरेखित करता है ताकि संक्षिप्त, उच्च-स्तरीय अर्थपूर्ण निरूपण (semantic representations) बनाए जा सकें, जिससे पुनर्निर्माण की गुणवत्ता और पीढ़ी की दक्षता में सुधार होता है और यह HumanML3D एवं Motion-X बेंचमार्क पर अत्याधुनिक विधियों से बेहतर प्रदर्शन करता है।

Sheng Yan, Yong Wang, Xin Du, Junsong Yuan, Mengyuan Liu2026-07-03
💻 computer science

Style-CCL: Content-Preserving Style Transfer via Curriculum Continual Learning

यह शोध पत्र Style-CCL को प्रस्तुत करता है, जो एक मल्टी-स्टेज करिकुलम कॉन्टिनुअल लर्निंग फ्रेमवर्क है जो मेमोरी रिहर्सल के साथ सिमेंटिक से टेक्सचर स्टाइल तक एक ड्यूल-ब्रांच मॉडल को प्रगतिशील रूप से प्रशिक्षित करके डिफ्यूजन ट्रांसफॉर्मर में कंटेंट-प्रिजर्विंग स्टाइल ट्रांसफर की चुनौतियों का समाधान करता है, जिससे स्टाइल समानता, कंटेंट निरंतरता और सौंदर्य गुणवत्ता में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Shiwen Zhang, Haoyuan Wang, Xianghao Zang, Haibin Huang, Chi Zhang, Xuelong Li2026-07-03
💻 computer science

Shift Variant Image Degradation and Restoration Using Singular Value Decomposition

यह शोध पत्र शिफ्ट-वेरिएंट मोशन ब्लर द्वारा खराब हुई छवियों को पुनर्स्थापित करने के लिए एक सिंगुलर वैल्यू डिकंपोजिशन (SVD)-आधारित ढांचे का प्रस्ताव करता है, जो विभिन्न मोशन मॉडलों में शोर प्रवर्धन (noise amplification) को नियंत्रित करते हुए छवि के विवरणों को प्रभावी ढंग से पुनर्प्राप्त करने के लिए सिंगुलर-वैल्यू ऊर्जा प्रतिधारण मानदंड का उपयोग करता है।

Arun D. Kulkarni2026-07-03
💻 computer science

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct एक प्लानर-एक्सेक्यूटर सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) ढांचे को पेश करता है जो टेम्पोरल डिकंपोजिशन और स्टेप-कंडीशन्ड एक्जीक्यूशन को अनुकूलित करने के लिए पदानुक्रमित समूह अन्वेषण (हायरार्किकल ग्रुप एक्सप्लोरेशन) और अनुकूलित पुरस्कारों का लाभ उठाता है, जिससे ऑटोरिग्रेसिव वीडियो जनरेशन में अस्पष्टता और त्रुटि प्रसार को हल किया जा सके और साथ ही टेम्पोरल संभाव्यता और दृश्य गुणवत्ता सुनिश्चित की जा सके।

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang2026-07-03
💻 computer science

Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification

यह शोध पत्र 3D पॉइंट क्लाउड वर्गीकरण के लिए 130 फेडरेटेड लर्निंग और नॉलेज डिस्टिलेशन संयोजनों का एक व्यापक बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि जबकि नॉलेज डिस्टिलेशन मॉडलों को प्रभावी ढंग से संकुचित करता है, मानक मूल्यांकन विधियाँ निजी प्रॉक्सी लेबल लीक करके प्रदर्शन को भ्रामक रूप से बढ़ा सकती हैं, जिससे फेडरेटेड टीचर की गुणवत्ता को सटीक रूप से दर्शाने के लिए लेबल-मुक्त डिस्टिलेशन मेट्रिक्स की आवश्यकता होती है।

Aizierjiang Aiersilan2026-07-03
💻 computer science

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

यह शोध पत्र CPG-PAD का प्रस्ताव करता है, जो एक नवीन ढांचा (framework) है जो प्रॉम्प्ट लर्निंग में XAI-व्युत्पन्न हीटमैप्स के माध्यम से मॉडल-स्तरीय अवधारणा मार्गदर्शन को एकीकृत करके क्रॉस-डोमेन प्रेजेंटेशन अटैक डिटेक्शन को बढ़ाता है, जिससे विविध डेटासेट्स में हस्तांतरणीय हमले के संकेतों को कैप्चर करते हुए और डोमेन-विशिष्ट पूर्वाग्रहों को दबाते हुए अत्याधुनिक सामान्यीकरण (generalization) प्राप्त किया जाता है।

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei2026-07-03