💻 computer science

Neural Texture Compression using Hypernetworks

यह शोध पत्र न्यूरल टेक्चर कम्प्रेशन के लिए एक हाइपरनेटवर्क-आधारित दृष्टिकोण प्रस्तुत करता है जो एकल नेटवर्क को सीधे लेटेंट फीचर्स और डिकोडर वेट्स दोनों आउटपुट करने के लिए प्रशिक्षित करके प्रति-मटेरियल ग्रेडिएंट-डिसेन्ट ऑप्टिमाइज़ेशन की आवश्यकता को समाप्त करता है, जिससे मौजूदा विधियों के तुलनीय गुणवत्ता प्राप्त होती है और मल्टी-डिकोडर इन्फरेंस एवं सुपर-रिज़ॉल्यूशन क्षमताएं सक्षम होती हैं।

Belcour Laurent2026-06-26
💻 computer science

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

माधो (TraMP-LLaMA) एक नवीन मल्टीमॉडल फ्रेमवर्क है जो नव-निर्मित PFED5-plus डेटासेट पर एक डिकपल्ड इंस्ट्रक्शन-ट्यूनिंग रणनीति के माध्यम से चेहरे के भावों की गंभीरता के स्कोर की संयुक्त रूप से भविष्यवाणी करके और संरचित पाठ्य रिपोर्ट उत्पन्न करके पार्किंसंस रोग के मूल्यांकन में व्याख्यात्मकता को बढ़ाता है।

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi2026-06-26
🤖 AI

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

यह शोध पत्र OmniRef-Bench प्रस्तुत करता है, जो जटिल बहु-संदर्भ (multi-reference) छवि निर्माण में वर्तमान मॉडलों की सीमाओं को उजागर करने वाला एक व्यापक बेंचमार्क है, और DyRef का प्रस्ताव करता है, जो 'डिफिकल्टी-अवेयर एडवांटेज रीवेटिंग' (Difficulty-aware Advantage Reweighting) और 'डिस्क्रिमिनेटिव रिवॉर्ड स्केलिंग' (Discriminative Reward Scaling) का उपयोग करने वाला एक दो-चरणीय प्रशिक्षण ढांचा है जो इन चुनौतीपूर्ण परिदृश्यों में मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian2026-06-26
🤖 AI

Einstein World Models

यह शोध पत्र "आइंस्टीन वर्ल्ड मॉडल्स" का प्रस्ताव करता है, जो एक फ्रेमवर्क है जो एक वर्ल्ड-मॉड्यूल द्वारा जनरेट किए गए विजुअल-टेम्पोरल रोलआउट्स को रीजनिंग ट्रेस के भीतर निरीक्षण योग्य परिकल्पनाओं के रूप में एकीकृत करके LLM तर्क क्षमता को बढ़ाता है, जिससे सिस्टम को भाषा-आधारित विश्लेषण के पूरक के रूप में विजुअल थॉट एक्सपेरिमेंट्स (दृश्य विचार प्रयोग) करने में सक्षम बनाया जा सके।

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui2026-06-26✓ Author reviewed
🤖 machine learning

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

यह शोध पत्र एक नवीन प्रशिक्षण-आधारित ढांचे का प्रस्ताव करता है जो इमेज-टेक्स्ट संरेखण और नियमितीकरण पदों के साथ एक मिश्रित हानि फलन (composite loss function) का उपयोग करके मेडिकल विजुअल क्वेश्चन अनस्विंग (VQA) में मौखिक अनिश्चितता अंशांकन (verbalized uncertainty calibration) को बढ़ाता है, जिससे भविष्य कहने वाली सटीकता को बनाए रखते हुए कई बेंचमार्क और आर्किटेक्चर में अंशांकन त्रुटि में महत्वपूर्ण कमी और भेदभाव में सुधार प्राप्त होता है।

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman2026-06-26
💻 computer science

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

PanoImager एक SfM-मुक्त ढांचा है जो फीड-फॉरवर्ड प्रायर्स (priors), ज्योमेट्री-कंडीशन्ड डिफ्यूजन और डेप्थ-गाइडेड 3DGS का लाभ उठाता है ताकि उन विरल पैनोरमिक छवियों से मजबूत 3D पुनर्निर्माण और नवीन दृश्य संश्लेषण (novel view synthesis) प्राप्त किया जा सके जहाँ कमजोर पैरलैक्स के कारण पारंपरिक विधियाँ विफल हो जाती हैं।

Zhisong Xu, Takeshi Oishi2026-06-26
💻 computer science

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

यह शोधपत्र FlameVQA प्रस्तुत करता है, जो UAV-आधारित जंगल की आग की निगरानी के लिए एक नवीन बहुविकल्पीय विजुअल क्वेश्चन अनस्वर्सिंग बेंचमार्क है, जो तापमान-आधारित तर्क को सक्षम करने के लिए युग्मित RGB और रेडियोमेट्रिक थर्मल इमेजरी का लाभ उठाता है, जबकि क्रॉस-मोडल कार्यों में उनकी शक्तियों और धुएं से बाधित पहचान एवं कवरेज अनुमान में उनकी सीमाओं को उजागर करने के लिए वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है।

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah2026-06-26
🤖 AI

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

यह शोध पत्र एक पुनरावृत्ति स्व-सुधार ढांचे (iterative self-improving framework) का प्रस्ताव करता है जो एक एकीकृत मल्टीमॉडल मॉडल के अपने निर्णय का लाभ उठाकर असुरक्षित जनरेशन की पहचान करता है और अनुकूल रूप से इसके विजुअल कोडबुक को परिष्कृत करता है, जिससे बाहरी मानवीय फीडबैक की आवश्यकता के बिना ऑटोरेग्रेसिव इमेज जनरेशन में सुरक्षा को बढ़ाया जा सके।

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu2026-06-26
💻 computer science

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

यह शोध पत्र LISA को प्रस्तुत करता है, जो एक नियमितीकरण (regularization) विधि है जो विजुअल-कंडीशन द्वारा नियंत्रित जनरेशन में अतिरिक्त अनुमान लागत (inference cost) के बिना प्रशिक्षण दक्षता, अभिसरण (convergence) और फीचर डिसेंटैंगलमेंट (feature disentanglement) में सुधार करने के लिए साइड नेटवर्क फीचर्स को एक अनुमानित संभावना स्कोर (approximated likelihood score) के साथ संरेखित करता है।

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen2026-06-26
🤖 AI

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan

यह अध्ययन 4chan पर एआई नूडिफिकेशन (AI nudification) का एक बड़े पैमाने पर विश्लेषण प्रस्तुत करता है, जो सुलभ ओपन-सोर्स मॉडल और उत्पादकों के एक छोटे समूह द्वारा संचालित, मशहूर हस्तियों से हटकर सामाजिक दायरे के भीतर गैर-मशहूर हस्तियों को लक्षित करने की ओर एक महत्वपूर्ण बदलाव को प्रकट करता है, जिससे शासन और सुरक्षात्मक हस्तक्षेपों की तत्काल आवश्यकता रेखांकित होती है।

Chi Cui, Yixin Wu, Yang Zhang2026-06-26