🤖 AI

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

यह शोध पत्र UniT को पेश करता है, जो एक ऐसा ढांचा है जो एकीकृत मल्टीमॉडल मॉडलों को बहु-चरणीय तर्क (multi-round reasoning), सत्यापन और परिशोधन के माध्यम से पुनरावृत्ति परीक्षण-समय स्केलिंग (iterative test-time scaling) करने में सक्षम बनाता है, यह प्रदर्शित करते हुए कि लघु तर्क प्रक्षेप पथों (short reasoning trajectories) पर प्रशिक्षण प्रभावी रूप से लंबे अनुमान श्रृंखलाओं (longer inference chains) तक सामान्यीकृत होता है और जटिल दृश्य समझ एवं निर्माण कार्यों में महत्वपूर्ण सुधार करता है।

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Y (…)2026-06-16
⚡ electrical engineering

FireRed-Image-Edit-1.0 Technical Report

यह शोध पत्र FireRed-Image-Edit को प्रस्तुत करता है, जो एक अत्याधुनिक डिफ्यूजन ट्रांसफार्मर है जो निर्देश-आधारित इमेज एडिटिंग के लिए एक सावधानीपूर्वक क्यूरेट किए गए 100M-सैंपल प्रशिक्षण कॉर्पस, डेटा दक्षता और नियंत्रणीयता के लिए नवीन तकनीकों वाले मल्टी-स्टेज ऑप्टिमाइज़ेशन पाइपलाइन, और विविध एडिटिंग कार्यों में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए व्यापक REDEdit-Bench का लाभ उठाता है।

Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang, Dejia Song, Jiale Zhang, Jing Li, Qiang Xiang (…)2026-06-16
💻 computer science

ToaSt: Token Channel Selection and Structured Pruning for Efficient ViT

ToaSt एक डिकपल्ड (decoupled) फ्रेमवर्क है जो अटेंशन मॉड्यूल्स के लिए कपल्ड हेड-वाइज स्ट्रक्चर्ड प्रूनिंग को फीड-फॉरवर्ड नेटवर्क्स के लिए एक ट्रेनिंग-फ्री टोकन चैनल सिलेक्शन पद्धति के साथ जोड़कर विजन ट्रांसफार्मर की दक्षता को बढ़ाता है, जिससे विविध मॉडलों और कार्यों में बेहतर सटीकता-दक्षता ट्रेड-ऑफ प्राप्त होता है।

Hyunchan Moon, Cheonjun Park, Steven L. Waslander2026-06-16
🤖 AI

Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

यह शोध पत्र क्रॉस-मोडल आइडेंटिटी मैपिंग (CIM) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक छवि और उसके टेक्स्ट-रिट्रीव्ड विजुअल समकक्षों के बीच निरंतरता के लिए अनुकूलित करके इमेज कैप्शनिंग में सूचना हानि को कम करता है, जिससे बिना किसी अतिरिक्त एनोटेशन की आवश्यकता के उत्कृष्ट प्रदर्शन प्राप्त होता है।

Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang2026-06-16
💻 computer science

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

यह शोध पत्र DPC-VQA का प्रस्ताव करता है, जो एक लागत प्रभावी ढांचा है जो एक फ्रोजन मल्टीमॉडल लार्ज लैंग्वेज मॉडल और एक लाइटवेट ब्रांच का उपयोग करके परसेप्चुअल प्रायर एक्सट्रैक्शन को रेसिडुअल कैलिब्रेशन से अलग करता है, जिससे न्यूनतम ट्रेन करने योग्य पैरामीटर्स और एनोटेशन डेटा के साथ कुशल वीडियो क्वालिटी असेसमेंट सक्षम होता है।

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai2026-06-16
💬 NLP

MolSight: Molecular Property Prediction with Images

MolSight एक व्यवस्थित बड़े पैमाने का अध्ययन है जो यह प्रदर्शित करता है कि एक विजन एनकोडर द्वारा संसाधित एक एकल 2D कंकाल छवि (skeletal image), विशेष रूप से जब इसे रसायन-सूचित पाठ्यक्रम (chemistry-informed curriculum) के साथ प्रशिक्षित किया जाता है, ग्राफ-आधारित या भाषा मॉडल दृष्टिकोणों की तुलना में काफी कम कम्प्यूटेशनल लागत के साथ विविध कार्यों में प्रतिस्पर्धी आणविक गुण भविष्यवाणी प्राप्त करती है।

Aaditya Baranwal, Akshaj Gupta, Yogesh S Rawat, Shruti Vyas2026-06-16
💻 computer science

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

RepWAM एक प्रतिनिधित्व-केंद्रित (representation-centric) विश्व क्रिया मॉडल पेश करता है जो संरेखित अर्थपूर्ण लेटेंट स्पेस (aligned semantic latent spaces) सीखने के लिए एक नवीन विजुअल-एक्शन टोकेनाइज़र का उपयोग करता है, जो पारंपरिक पुनर्निर्माण-उन्मुख (reconstruction-oriented) दृष्टिकोणों की तुलना में बेहतर निर्देश-अनुपालन और क्लोज्ड-लूप रोबोट हेरफेर प्रदर्शन को सक्षम बनाता है।

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu2026-06-16
🤖 AI

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception

RAMS एक हल्का, संसाधन-अनुकूलित रनटाइम कंट्रोलर है जो बिना मॉडल-रीलोड ओवरहेड के, डिवाइस प्रेशर और हालिया असुरक्षित-सड़क-उपयोगकर्ता (vulnerable-road-user) डिटेक्शन के आधार पर एम्बेडेड एज हार्डवेयर पर इन्फरेंस लेटेंसी और डिटेक्शन क्वालिटी को अनुकूलित करने के लिए YOLOv8 मॉडल टियर्स के बीच गतिशील रूप से स्विच करता है।

Kushal Khemani, Evan Leri, George Xu, Amit Hod2026-06-16
💻 computer science

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection

यह अध्ययन विभिन्न मौसम स्थितियों में समुद्री वस्तु पहचान के लिए छह डीप लर्निंग आर्किटेक्चर का मूल्यांकन करता है, जो यह प्रदर्शित करता है कि जहाँ हल्के मॉडल संसाधन-बाधित उपकरणों के अनुकूल होते हैं, वहीं विजन ट्रांसफॉर्मर (ViT) 100% सटीकता और सबसे तेज़ प्रसंस्करण गति के साथ बेहतर प्रदर्शन प्राप्त करता है।

Ismet Gocer, Zakirul Bhuiayn, Shakeel Ahmad, Raza Hasan2026-06-16
💻 computer science

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

FairGen एक निष्पक्षता-जागरूक (fairness-aware) डिफ्यूजन फ्रेमवर्क है जो चिकित्सक-संरेखित प्राथमिकताओं को समाहित करके जनसांख्यिकीय रूप से संतुलित चिकित्सा छवियों को संश्लेषित करता है, जो उच्च नैदानिक सटीकता बनाए रखते हुए डर्मेटोलॉजी, रेडियोलॉजी और न्यूरोइमेजिंग कार्यों में सबग्रुप कवरेज में उल्लेखनीय सुधार करता है और नैदानिक पूर्वाग्रह को कम करता है।

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen2026-06-16