💻 computer science

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

TrafficAlign एक स्वचालित फ्रेमवर्क है जो ड्राइविंग वीडियो से परिदृश्य (scenarios) संश्लेषित करके लार्ज लैंग्वेज मॉडल्स को वास्तविक दुनिया के ट्रैफ़िक वितरण के साथ संरेखित करता है, जो न केवल मौजूदा तरीकों की तुलना में स्वायत्त ड्राइविंग मॉडल्स में 10.8% अधिक टक्करों को उजागर करता है बल्कि फाइन-ट्यूनिंग के लिए उपयोग किए जाने पर टक्कर दरों में 36.1% की कमी भी लाता है।

Zhi Tu, Liangkun Niu, Tianyi Zhang2026-06-30
🤖 machine learning

BTI-Net: Bidirectional Decoder-Level Task Interaction via Uncertainty-Aware Gating for Multi-Task Medical Image Analysis

यह शोध पत्र BTI-Net प्रस्तुत करता है, जो एक मल्टी-टास्क मेडिकल इमेज एनालिसिस फ्रेमवर्क है जो अनिश्चितता-जागरूक तंत्र (uncertainty-aware mechanism) के माध्यम से गेटेड द्विदिश डिकोडर-स्तरीय इंटरैक्शन स्थापित करके सेगमेंटेशन और क्लासिफिकेशन प्रदर्शन को बढ़ाता है, ताकि बिना किसी अतिरिक्त इन्फरेंस पास के कार्य-विशिष्ट विशेषताओं को गतिशील रूप से फ़िल्टर किया जा सके।

Abdullah Al Shafi, Md Kawsar Mahmud Khan Zunayed, Safin Ahmmed, Sk Imran Hossain, Engelbert Mephu Nguifo2026-06-30
🤖 machine learning

GPC: Large-Scale Generative Pretraining for Transferable Motor Control

यह शोध पत्र जेनेरेटिव प्रीट्रेंड कंट्रोलर्स (GPC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो विशाल मोशन डेटासेट्स को पुनरुत्पादित करने और स्वाभाविक, उभरते व्यवहारों के साथ विविध डाउनस्ट्रीम कार्यों के अनुकूल होने में सक्षम, मजबूत, सामान्य-उद्देश्य वाले नियंत्रकों को बनाने के लिए टोकनाइज्ड मोशन रिप्रेजेंटेशन को ऑटोरेग्रेसिव नेक्स्ट-टोकन प्रेडिक्शन और रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है।

Yi Shi, Yifeng Jiang, Chen Tessler, Xue Bin Peng2026-06-30
⚡ electrical engineering

Spatially Localized Image Degradation Embeddings for Image Quality Assessment

यह शोध पत्र SLIDE-IQA को प्रस्तुत करता है, जो एक ड्यूल-ब्रांच विजन ट्रांसफॉर्मर फ्रेमवर्क है जो स्थानिक रूप से सीमित इमेज डिग्रेडेशन और कंट्रास्टिव प्रीट्रेनिंग के दौरान एक थ्रेशोल्ड-बाउंडेड एक्सक्लूजन मैकेनिज्म का उपयोग करता है ताकि बेहतर नो-रेफरेंस इमेज क्वालिटी असेसमेंट के लिए स्थानिक रूप से सीमित इमेज डिस्टॉर्शन का पता लगाने में मौजूदा सेल्फ-सुपरवाइज्ड मॉडल्स के रिप्रेजेंटेशनल ब्लाइंड स्पॉट्स को दूर किया जा सके।

Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu, Ioannis Katsavounidis, Alan C. Bovik2026-06-30
⚡ electrical engineering

A Self-Supervised Learning Framework for Video Encoding Complexity Clustering

यह शोध पत्र कम्प्रेशन इको कॉन्ट्रास्टिव लर्निंग (CECL) का प्रस्ताव करता है, जो एक नवीन स्व-पर्यवेक्षित ढांचा है जो संपीड़न-प्रेरित संकेतों का उपयोग सुपरविजन के रूप में करके एन्कोडिंग जटिलता को एनकोड करके वीडियो को क्लस्टर करता है, जिससे यह मौजूदा विजुअल एनकोडर्स से बेहतर प्रदर्शन करता है और एडेप्टिव वीडियो स्ट्रीमिंग में बिटरेट और गुणवत्ता की महत्वपूर्ण बचत प्राप्त करता है।

Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu, Ioannis Katsavounidis, Alan C. Bovik2026-06-30
💻 computer science

Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection

यह शोध पत्र एनोमली फैक्ट्री 3D (AF3AD) को प्रस्तुत करता है, जो एक सेंटर-कंडीशन्ड पैरामीट्रिक विरूपण मॉडल (center-conditioned parametric deformation model) का उपयोग करके सामान्य 3D पॉइंट क्लाउड्स से विविध छद्म-विसंगतियों (pseudo-anomalies) को संश्लेषित करने वाला एक मॉड्यूलर फ्रेमवर्क है, जिससे विभिन्न प्रतिमानों (paradigms) में अनसुपरवाइज्ड विसंगति पहचान विधियों के प्रदर्शन और मजबूती को बढ़ाया जा सके।

Ali Balapour, Faraz Hach2026-06-30
💬 NLP

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

यह शोध पत्र देवनागरी पाठ पर दस OCR प्रणालियों का बेंचमार्किंग करता है, जो यह प्रकट करता है कि सिंथेटिक मूल्यांकन प्रदर्शन को बढ़ा-चढ़ाकर दिखाते हैं, विशिष्ट OCR-VLMs क्षरण (degradation) के तहत विनाशकारी विफलताओं के प्रति संवेदनशील होते हैं, और मजबूत अंग्रेजी OCR क्षमताएं इंडिक लिपियों के साथ सफलता की गारंटी नहीं देती हैं, साथ ही एक पोस्ट-करेक्शन दृष्टिकोण भी प्रस्तावित करता है जो उन्हें व्यापक रूप से लागू किए बिना विशिष्ट इंजनों में सुधार करता है।

Aditya Pratap Singh2026-06-30
💻 computer science

Again-Pose: Anchor-Guided Adaptive Inter-Frame Motion Cues Propagating for High-quality Human Pose Reconstruction

यह शोध पत्र Again-Pose का प्रस्ताव करता है, जो एक एंकर-गाइडेड फ्रेमवर्क है जो विश्वसनीय एंकर फ्रेमों की पहचान करके और अत्यधिक धुंधले या बाधित मध्यवर्ती फ्रेमों में पोज़ को पुनः प्राप्त करने के लिए उनके मोशन संकेतों को अनुकूल रूप से प्रसारित करके, खराब वीडियो से उच्च-गुणवत्ता वाले 3D मानव पोज़ को पुनर्गठित करता है, जो मजबूती के मामले में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Shuaikang Zhu, Yiding Sun, Yang Yang2026-06-30
💻 computer science

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT

यह शोध पत्र यह प्रदर्शित करता है कि सिंथेटिक से वास्तविक फेफड़ों के सीटी (CT) डेटा में मेडिकल विजन-लैंग्वेज मॉडल्स की ट्रांसफरेबिलिटी (स्थानांतरणीयता) को डोनर-संचालित फीचर्स (जो ट्रांसफर होते हैं) और होस्ट-संचालित फीचर्स (जो नहीं होते) के बीच अंतर करके लेबल-मुक्त तरीके से पूर्वानुमानित किया जा सकता है, जिससे एक ट्रेनिंग-मुक्त डायग्नोस्टिक राउटर का निर्माण संभव होता है जो वास्तविक दुनिया के लेबल्स की आवश्यकता के बिना सर्वश्रेष्ठ मॉडल का सटीक चयन करता है।

Fakrul Islam Tushar2026-06-30
💻 computer science

Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference

यह शोध पत्र एक कॉन्फिडेंस-फीडबैक-वेटेड ग्राफ मैचिंग नेटवर्क प्रस्तावित करता है जो डिस्ट्रैक्टर प्रसार को दबाने और विभेदन क्षमता को बढ़ाने के लिए पुनरावृत्ति आत्मविश्वास अनुमान और फीडबैक का उपयोग करता है, जिससे जटिल हस्तक्षेप के तहत 96.36% F1-स्कोर के साथ मजबूत ऑनलाइन-ऑफलाइन लेजर-प्रेरित क्षति स्थल मिलान प्राप्त होता है।

Yueyue Han, Guanhua Chen, Hangcheng Dong, Kang Zhang, Fengdong Chen, Zhitao Peng, Fa Zeng, Qihua Zhu, Guodong Liu2026-06-30