💻 computer science

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

यह शोध पत्र PlantMicro को प्रस्तुत करता है, जो 5,000 से अधिक सूक्ष्म पादप छवियों और 9,000 VQA युग्मों वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान विजन-लैंग्वेज मॉडल सूक्ष्म डोमेन में सूक्ष्म-स्तरीय पहचान और जैविक रूप से आधारित तर्क करने में काफी संघर्ष करते हैं।

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang2026-06-23
💻 computer science

Biological Sex Determination in Cadavers Using Deep Learning Algorithms from Computed Tomography Images of Pelvis and Skull

यह अध्ययन प्रदर्शित करता है कि पेल्विस और खोपड़ी के 3D CT पुनर्निर्माणों के 2D प्रोजेक्शन पर लागू डीप लर्निंग एल्गोरिदम, विघटित शवों से जैविक लिंग को स्वचालित रूप से निर्धारित करने में उच्च सटीकता (95.65%) प्राप्त कर सकते हैं, जो पारंपरिक फोरेंसिक मानवविज्ञान विधियों के लिए एक तीव्र और वस्तुनिष्ठ विकल्प प्रदान करता है।

Giovanna Herculano Tormena, Davi Nascimento Araújo, Germano Coimbra Soares de Carvalho, Gustavo Bruno Centenaro, Rafael (…)2026-06-23
🤖 machine learning

The Scissors Effect: When Resize-Based Input Diversity Helps or Hurts Transfer Attacks

यह शोध पत्र "सिज़र्स इफ़ेक्ट" (Scissors Effect) को प्रकट करता है, जो एक शासन-निर्भर (regime-dependent) घटना है जहाँ रैंडम रिसाइजिंग के माध्यम से इनपुट विविधता को बढ़ाने से मानक मॉडलों के लिए एडवरसेरियल ट्रांसफ़रेबिलिटी में सुधार होता है, लेकिन यह रोबस्टली प्रशिक्षित सरोगेट्स के लिए ग्रेडिएंट अलाइनमेंट को कम करके इसे महत्वपूर्ण रूप से नुकसान पहुँचाता है, जिससे दोनों प्रकार के मॉडलों में हमले की सफलता को अनुकूलित करने के लिए एक प्रस्तावित ट्रेनिंग-मुक्त नियम (CG-DI) प्राप्त होता है जो स्थानीय ग्रेडिएंट निरंतरता जांच (local gradient consistency probe) के आधार पर विविधता को गतिशील रूप से अक्षम करता है।

Yuhang Jiang, Xiaojing Chen2026-06-23
💻 computer science

Projection-Volume Fidelity Divergence: Diagnosing and Controlling Optimization Drift in Sparse-View 3D Gaussian Tomography

यह शोध पत्र स्पार्स-व्यू 3D गॉसियन टोमोग्राफी में "प्रोजेक्शन-वॉल्यूम फिडेलिटी डाइवर्जेंस" की पहचान और समाधान करता है, जहाँ प्रोजेक्शन गुणवत्ता में सुधार वॉल्यूमेट्रिक गिरावट को छिपा देता है, जिसके लिए LADES का प्रस्ताव दिया गया है, जो एक ग्राउंड-ट्रुथ-मुक्त नियंत्रक है जो पुनर्निर्माण को स्थिर करने और प्रशिक्षण समय को कम करने के लिए लीनियरली एनेल्ड ड्रॉपआउट और स्ट्रक्चर-अवेयर अर्ली स्टॉपिंग को जोड़ता है।

Yikuang Yuluo, Ao Wang, Shen Kuan, Yujie Liu, Wang Liao, Ying Chen, Shuangyang Zhong, Yixing Huang, Fuquan Wang2026-06-23
💻 computer science

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

यह शोध पत्र ट्रैजेक्टरी फोर्सिंग (TF) का प्रस्ताव करता है, जो एक संरचना-प्रथम जनरेटिव फ्रेमवर्क है जो छवि संश्लेषण को वैश्विक लेआउट से लेकर सूक्ष्म विवरणों तक के अर्थपूर्ण रूप से संरचित चरणों के एक स्पष्ट, संपादन योग्य अनुक्रम में परिवर्तित करता है, जिससे प्रतिस्पर्धी नमूना गुणवत्ता बनाए रखते हुए स्थानीयकृत नियंत्रण और मध्यवर्ती अवस्थाओं के निरीक्षण को सक्षम बनाया जा सके।

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger2026-06-23
💻 computer science

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

पॉलिसीट्रिम (PolicyTrim) एक सुदृढीकरण अधिगम (reinforcement learning) आधारित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो विश्वसनीय एक्शन चंक की लंबाई को गतिशील रूप से बढ़ाकर और अनावश्यक भौतिक चरणों को समाप्त करके विजन-लैंग्वेज-एक्शन मॉडल्स की आंतरिक दक्षता को बढ़ाता है, जिसके परिणामस्वरूप कार्य की सफलता दर से समझौता किए बिना 5.83×\times तक एंड-टू-एंड परिनियोजन (deployment) गति में वृद्धि होती है।

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei2026-06-23
🤖 machine learning

Mitigating Measurement-Induced Training Instability in Hybrid Quantum Neural Networks for Protein Classification

यह शोध पत्र हाइब्रिड क्वांटम न्यूरल नेटवर्क में सीमित मापन आउटपुट के कारण "मेजरमेंट-इंड्यूस्ड लॉजिट कॉन्ट्रैक्शन" (मापन-प्रेरित लॉजिट संकुचन) को प्रशिक्षण अस्थिरता के एक कारण के रूप में पहचानता है और इन आउटपुट्स को पुन: स्केल करने के लिए एक सीखने योग्य "क्वांटम मेजरमेंट टेम्परेचर" (QMT) पैरामीटर का प्रस्ताव करता है, जिससे ग्रेडिएंट परिमाण को बढ़ाना, अनुकूलन को स्थिर करना और व्यावहारिक डेटासेट पर वर्गीकरण सटीकता में सुधार करना संभव होता है।

Milton Mondal, Sushovan Chanda, Mohamad Mahdi Alawieh, Brijesh Sukhadiya, Donatus Krah, Clinton Gonsalves, Antonios Ntol (…)2026-06-23
💬 NLP

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

यह शोध पत्र 12 कार्यों और 20 मॉडलों में मल्टीमॉडल चेन-ऑफ-थॉट रीजनिंग का व्यवस्थित मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि यह जटिल तर्क क्षमता को प्रभावी ढंग से बढ़ाता है, यह अक्सर धारणा (परसेप्शन) प्रदर्शन को कम कर देता है और एक "लुक लाइट, थिंक हैवी" (कम देखना, अधिक सोचना) बाधा से ग्रस्त होता है जहाँ बढ़ी हुई मौखिक आत्म-चिंतन के बावजूद दृश्य अंतर्निरीक्षण घट जाता है।

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao2026-06-23
💻 computer science

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image एक नवीन टेक्स्ट-टू-इमेज फाउंडेशन मॉडल है जो एक सिमेंटिक-फर्स्ट डिफ्यूजन प्रतिमान का उपयोग करता है जो पिछले मॉडलों की तुलना में काफी कम प्रशिक्षण कंप्यूट (125K A800 GPU घंटे) के साथ कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है, जबकि विविध परिनियोजन आवश्यकताओं के लिए स्केलेबल वेरिएंट और डिस्टिल्ड फ्यू-स्टेप संस्करण भी प्रदान करता है।

SeFi-Team2026-06-23
💻 computer science

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

यह शोध पत्र MapReason-OSM को प्रस्तुत करता है, जो विजन-लैंग्वेज मॉडल्स (Vision-Language Models) की ग्राफ-सत्यापनीय गतिशीलता संबंधी निर्णय लेने की क्षमता का आकलन करने के लिए OpenStreetMap डेटा का उपयोग करने वाला एक बेंचमार्क और मूल्यांकन हारनेस है, जो यह प्रकट करता है कि हालांकि वर्तमान मॉडल सरल मानचित्र पठन करने में सक्षम हैं, वे जटिल ग्राफ-लागत तर्क (graph-cost reasoning) और क्रॉस-ज़ूम निरंतरता (cross-zoom consistency) के साथ संघर्ष करते हैं।

Srinivas Venkatanarayanan (NVIDIA, University of Central Florida), Clement Pakkam Isaac (NVIDIA, University of South Flo (…)2026-06-23