💻 computer science

Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space

यह शोध पत्र Timeripple को प्रस्तुत करता है, जो एक हल्का और अनुकूलन योग्य (adaptive) रणनीति है जो लेटेंट स्पेस में अंतर्निहित स्थानिक-कालिक (spatio-temporal) सहसंबंधों का लाभ उठाकर अटेंशन स्कोर्स को पुन: उपयोग करती है, जिससे वीडियो गुणवत्ता पर नगण्य प्रभाव के साथ वीडियो डिफ्यूजन ट्रांसफॉर्मर को त्वरित किया जाता है और कंप्यूटेशनल लागत में 85% की कमी आती है।

Wenxuan Miao, Yulin Sun, Aiyue Chen, Jing Lin, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng2026-07-22
🤖 AI

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

यह शोध पत्र T2T-VICL को प्रस्तुत करता है, जो एक सहयोगात्मक प्रॉम्प्ट-ट्रांसफर फ्रेमवर्क है जो एक शिक्षक VLM से निहित पाठ्य मार्गदर्शन (implicit textual guidance) को एक हल्के छात्र मॉडल में संकुचित (distill) करके क्रॉस-टास्क विजुअल इन-कॉन्टेक्स्ट लर्निंग को सक्षम बनाता है, जिससे यह बिना किसी स्पष्ट कार्य नाम के विविध विजन कार्यों में बेमेल प्रदर्शन-क्वेरी (demonstration-query) युग्मों को प्रभावी ढंग से संभालने में सक्षम होता है।

Shao-Jun Xia, Huixin Zhang, Zhengzhong Tu2026-07-22
💻 computer science

Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation

यह शोध पत्र एक ड्यूल-टीचर कंट्रास्टिव डिस्टिलेशन फ्रेमवर्क प्रस्तावित करता है जो कुशल क्रॉस-मोडल ज्ञान हस्तांतरण को सक्षम करने के लिए मल्टीस्पेक्ट्रल और ऑप्टिकल विजन फाउंडेशन मॉडल शिक्षकों का लाभ उठाता है, जिससे ऑप्टिकल-ओनली इनपुट्स पर मजबूती बनाए रखते हुए मल्टीस्पेक्ट्रल अर्थ ऑब्जर्वेशन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Filip Wolf, Blaž Rolih, Luka Čehovin Zajc2026-07-22
🤖 machine learning

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1 एक वास्तविक समय की संवादात्मक वीडियो जनरेशन मॉडल है जो उपयोगकर्ताओं को वॉयस कमांड के माध्यम से डिजिटल पात्रों को नियंत्रित करने में सक्षम बनाती है ताकि उपभोक्ता GPU पर बिना किसी दृश्य गिरावट के 42 FPS तक अनंत लंबाई वाले, उच्च गुणवत्ता वाले 540p वीडियो उत्पन्न किए जा सकें।

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen (…)2026-07-22
🤖 machine learning

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

FedCC एक लो-रिसोर्स फेडरेटेड लर्निंग फ्रेमवर्क है जो फुल फाइन-ट्यूनिंग की तुलना में कंप्यूटेशनल और कम्युनिकेशन लागत को काफी कम करते हुए, भ्रूण अल्ट्रासाउंड छवियों में कॉर्पस कैलोसम के मजबूत, गोपनीयता-संरक्षित स्थानीयकरण (localization) को प्राप्त करने के लिए एक फ्रोजन DINOv2 बैकबोन को LoRA और एक YOLO-आधारित डिटेक्शन हेड के साथ जोड़ता है।

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco (…)2026-07-22
💻 computer science

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

यह शोध पत्र विजन-लैंग्वेज मॉडल्स (Vision-Language Models) के मूल्यांकन के लिए "खतरा" (hazard) और "विसंगति" (anomaly) के बीच एक महत्वपूर्ण अंतर प्रस्तुत करता है, जो यह प्रकट करता है कि वर्तमान मॉडल अक्सर दृश्यों की अनियमितताओं को खतरों के रूप में गलत समझते हैं और यह प्रदर्शित करता है कि इन अवधारणाओं को अलग करने से पारंपरिक द्विआधारी निर्णयों की तुलना में सुरक्षा तर्क का अधिक सटीक मूल्यांकन प्राप्त होता है।

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek2026-07-22
💻 computer science

From Pixel to Prognosis: Convolutional and GLCM Feature Fusion for Automated Four-Class Cataract Severity Classification

यह शोध पत्र एक कम लागत वाले, हाइब्रिड CNN-GLCM-SVM ढांचे को प्रस्तुत करता है जो मानक उपभोक्ता-ग्रेड नेत्र फोटोग्राफ से मोतियाबिंद की चार गंभीरता श्रेणियों को वर्गीकृत करने के लिए डीप लर्निंग फीचर्स को हस्तनिर्मित टेक्सचर डिस्क्रिप्टर के साथ जोड़ता है, जिससे विशेष हार्डवेयर के बिना संसाधन-सीमित टेलीमेडिसिन सेटिंग्स में प्रभावी तैनाती सक्षम होती है।

K. Mithra, Prem Kumar Santhanam2026-07-22
💬 NLP

PathReportEval: A Systematic Benchmark for Pathology Report Generation

यह शोध पत्र PathReportEval प्रस्तुत करता है, जो एक मानकीकृत बेंचमार्क और मूल्यांकन ढांचा है जो पैथोलॉजी रिपोर्ट जनरेशन के लिए मौजूदा लेक्सिकल मेट्रिक्स की सीमाओं को संबोधित करता है, और विविध मॉडलों एवं डेटासेट्स में तथ्यात्मक शुद्धता, मतिभ्रम (hallucinations) और नैदानिक विसंगति (clinical discordance) का सटीक आकलन करने के लिए एक नैदानिक रूप से आधारित क्लिनिकल रिपोर्ट क्वालिटी स्कोर (CRQS) का उपयोग करता है।

Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna2026-07-22
🤖 machine learning

CANDOR: Chance-Calibrated Discordance in Frozen Foundation Encoders

यह शोधपत्र CANDOR को प्रस्तुत करता है, जो एक चांस-कैलिब्रेटेड डिसॉर्डेंस (chance-calibrated discordance) मीट्रिक है जो यह प्रकट करता है कि फ्रोजन फाउंडेशन एनकोडर्स (frozen foundation encoders) स्वाभाविक रूप से चिकित्सा निष्कर्षों के प्रति अंधे नहीं होते हैं, बल्कि वे कमजोर ज्यामितीय पृथक्करण (weak geometric separation) और खराब हेड चयन (poor head selection) से ग्रस्त होते हैं, जैसा कि उनके उच्च नियरस्ट-नेबरर एरर रेट्स (nearest-neighbor error rates) से सिद्ध होता है, भले ही हल्के हेड (lightweight heads) मजबूत प्रदर्शन प्राप्त कर लेते हों।

Soroosh Tayebi Arasteh, Sven Nebelung, Daniel Truhn2026-07-22
🤖 machine learning

Now We Know? A Systematic Comparison of TerraMind and THOR

यह शोध पत्र दस विविध उपयोग के मामलों में दो यूरोपीय अंतरिक्ष एजेंसी के जियोस्पेशियल फाउंडेशन मॉडल्स, THOR और TerraMind का एक व्यवस्थित तुलनात्मक विश्लेषण प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि आर्किटेक्चरल डिज़ाइन विकल्प—विशेष रूप से पैच आकार और डिकोडर जटिलता—मॉडल की पहचान की तुलना में प्रदर्शन भिन्नता को अधिक स्पष्ट करते हैं, जो पूरक निवेश रणनीतियों को प्रकट करते हैं और भविष्य के GFM मूल्यांकन के लिए एक नैदानिक पद्धति स्थापित करते हैं।

Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling, Johannes Jakubik, Arnt-Børre Salberg, Theodor Forgaard, Ni (…)2026-07-22