🤖 machine learning

Pre-Warm: Input-Conditioned Weight Initialization for Convolutional Neural Networks

Pre-Warm एक शून्य-प्रशिक्षण-लागत (zero-training-cost) विधि है जो कन्वोल्शनल न्यूरल नेटवर्क की सटीकता में सुधार करती है, जिसमें प्रशिक्षण डेटा के क्लस्टरिंग मीन-सेंटर्ड लोकल पैचेस से प्राप्त सेंट्रोइड्स का उपयोग करके पहली परत के आधे फिल्टर को इनिशियलाइज़ किया जाता है, जबकि शेष के लिए केइमिंग इनिशियलाइजेशन (Kaiming initialization) को बरकरार रखा जाता है।

Rowan Martnishn2026-06-25
🤖 AI

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

यह शोध पत्र फिजिक्स क्वेश्चन सीन ग्राफ (PQSG) प्रस्तुत करता है, जो एक पदानुक्रमित, ग्राफ-आधारित मूल्यांकन पाइपलाइन है जो टेक्स्ट-टू-वीडियो जनरेशन की भौतिक सुसंगतता का सूक्ष्म सटीकता के साथ आकलन करने के लिए विजन-लैंग्वेज मॉडल का उपयोग करता है, जिसे नए फाइनफाईइवल (FinePhyEval) डेटासेट के माध्यम से मान्य किया गया है जो पूर्व विधियों की तुलना में मानव निर्णयों के साथ PQSG के बेहतर सहसंबंध को प्रदर्शित करता है।

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal2026-06-25
🤖 AI

ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency

ESTANet एक हल्का, रियल-टाइम फ्रेमवर्क है जो प्रोसीजरल वीडियो में ऑनलाइन एरर डिटेक्शन के लिए, जटिल आर्किटेक्चरल डिजाइनों के बिना अत्याधुनिक प्रदर्शन प्राप्त करने हेतु विभिन्न टेम्पोरल कॉन्टेक्स्ट वाले मानक और एरर-सेंसिटिव एक्शन डिटेक्टर्स के बीच प्रेडिक्शन इनकंसिस्टेंसी का लाभ उठाता है।

Shih-Po Lee, Reza Ghoddoosian, Faizan Siddiqui, Enna Sachdeva, Behzad Dariush2026-06-25
🤖 machine learning

REViT: Roto-reflection Equivariant Convolutional Vision Transformer

यह शोध पत्र REViT को प्रस्तुत करता है, जो एक नवीन डिस्क्रीट रोटो-रिफ्लेक्शन इक्विवैरिएंट विज़न ट्रांसफार्मर है जो रोटेशनल, फ्लिप और पोजीशनल सिमिट्रीज़ को प्रभावी ढंग से संरक्षित करने के लिए कन्वोल्यूशनल अटेंशन को शामिल करता है, जो मौजूदा इक्विवैरिएंट न्यूरल नेटवर्क दृष्टिकोणों की तुलना में इमेज क्लासिफिकेशन में बेहतर प्रदर्शन प्रदर्शित करता है।

Sheir A. Zaheer, Alexander C. Holston, Chan Y. Park2026-06-25
💻 computer science

Hypergraph Normal World Models for Logical Visual Anomaly Detection

यह शोध पत्र हाइपरग्राफ नॉर्मल वर्ल्ड मॉडल (Hypergraph Normal World Model) का प्रस्ताव करता है, जो एक वन-क्लास डिटेक्टर है जो केवल स्थानीय पैच के बजाय श्रेणी-विशिष्ट सामान्य संबंधों को मॉडल करने के लिए फ्रोजन (frozen) DINOv2 फीचर्स को पैच, रिलेशनल और हाइपरग्राफ सांख्यिकी में संकुचित (distill) करता है ताकि तार्किक दृश्य विसंगतियों (logical visual anomalies) की प्रभावी ढंग से पहचान की जा सके।

Weizhi Nie, Zibo Xu, Weijie Wang, Yuting Su2026-06-25
🤖 machine learning

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation

यह शोध पत्र तर्क देता है कि संक्षिप्तता उत्पन्न करने के लिए डेटा क्यूरेशन (data curation) VLM इन्फरेंस दक्षता में सुधार के लिए एक महत्वपूर्ण लीवर है, जो यह प्रदर्शित करता है कि संक्षिप्त और सटीक डेटा पर प्रशिक्षण, सटीकता से समझौता किए बिना, प्रति सही उत्तर की कम्प्यूटेशनल लागत (Cost-of-Pass) को काफी कम कर देता है, और अक्सर आउटपुट की लंबाई स्थिर होने पर भी प्रदर्शन में सुधार करता है।

DatologyAI, :, Matthew L. Leavitt, Siddharth Joshi, Haoli Yin, Rishabh Adiga, Haakon Mongstad, Alvin Deng, David Schwab (…)2026-06-25
🤖 AI

EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis

EchoStyle एक स्केलेबल टेक्स्ट-ड्रिवन फ्रेमवर्क है जो एक वीडियो-टू-वीडियो आर्किटेक्चर, बड़े पैमाने पर V-Style20k डेटासेट बनाने के लिए एक रिवर्स-सिंथेसिस पाइपलाइन और टेम्पोरल कंसिस्टेंसी (सामयिक निरंतरता) के लिए विशेष तंत्र पेश करके उच्च-फिडेलिटी, लंबी-वीडियो स्टाइलइज़ेशन प्राप्त करता है।

Huaqiu Li, Jiahao Wang, Sijia Cai, Hualian Sheng, Bing Deng, Jieping Ye, Wenhan Luo2026-06-25
💻 computer science

TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition

यह शोध पत्र TACO को प्रस्तुत करता है, जो एक ओपन-वोकेबुलरी वीडियो रिकग्निशन फ्रेमवर्क है, जो आउट-ऑफ-डिस्ट्रीब्यूशन अलाइनमेंट को संरक्षित करने के लिए रिलेटिव स्ट्रक्चर डिस्टिलेशन का उपयोग करके और टास्क-स्पेसिफिक अडैप्टेशन को टेस्ट-टाइम रिप्रेजेंटेशन स्पेस से डीकपल करने के लिए एक स्पेशलाइजेशन प्रोजेक्शन का उपयोग करके ऑब्जेक्टिव इनकंसिस्टेंसी के कारण होने वाले रिप्रेजेंटेशन डेविएशन को कम करता है, जिससे विविध बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen2026-06-25
💻 computer science

Cross-View Variance Correlation in Path-Traced Stereo:A Hidden Shortcut in Synthetic Training Data

यह शोध पत्र यह प्रकट करता है कि पाथ-ट्रेस्ड सिंथेटिक स्टीरियो डेटा में डिस्पैरिटी अलाइनमेंट के बाद बाएं और दाएं दृश्यों के वेरिएंस फील्ड्स के बीच एक पूर्व में अज्ञात, उच्च सहसंबंध (हाई कोरिलेशन) होता है, जो मोंटे कार्लो रेंडरिंग की एक अनूठी छिपी हुई मैचिंग क्यू (हिडन मैचिंग क्यू) के रूप में कार्य करता है जो डिस्पैरिटी-एस्टिमेशन नेटवर्क को प्रशिक्षित करने में एक महत्वपूर्ण सिम-टू-रियल शॉर्टकट हो सकता है।

Po-Ting Lin2026-06-25
💻 computer science

C2RM-Seg: Causal Counterfactual Reasoning with Structural-Semantic Priors for Weakly Supervised Histopathological Tissue Segmentation

यह शोध पत्र C2RM-Seg का प्रस्ताव करता है, जो एक दो-चरणीय कमजोर रूप से पर्यवेक्षित (weakly supervised) ढांचा है जो अत्याधुनिक हिस्टोपैथोलॉजिकल ऊतक विभाजन (histopathological tissue segmentation) प्राप्त करने के लिए आकृति-संरेखित छद्म-लेबल (morphology-aligned pseudo-labels) उत्पन्न करने हेतु कारण प्रतितथ्यात्मक तर्क (causal counterfactual reasoning) को एक संरचना-जागरूक अर्थ संबंधी वास्तुकला (structure-aware semantic architecture) और अनिश्चितता-गेटेड लॉस (uncertainty-gated loss) के साथ जोड़ता है।

Hualong Zhang, Siyang Feng, Zihan Huan, Yi Qian, Zhenbing Liu, Rushi Lan, Xipeng Pan2026-06-25