💬 NLP

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

यह शोध पत्र यह प्रदर्शित करता है कि हस्तलिखित छात्र प्रतिक्रियाओं को क्रॉप करने के लिए बाउंडिंग बॉक्स का उपयोग करना विज़न-आधारित शैक्षिक मूल्यांकन कार्यों पर स्मॉल लैंग्वेज मॉडल्स की ग्रेडिंग सटीकता और कम्प्यूटेशनल दक्षता में महत्वपूर्ण सुधार करता है।

Lachlan McGinness2026-07-22
💻 computer science

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors

GLID एक प्रशिक्षण-मुक्त (training-free) फेस-फॉरजरी डिटेक्टर है जो इमेज पैच टोकन के स्थानीय अंतर्निहित आयाम (local intrinsic dimension) का अनुमान लगाकर एक ज्यामितीय संकेत उत्पन्न करता है जो डेटा-संचालित शिक्षण का पूरक बनता है, जिससे यह फाउंडेशन-मॉडल डिटेक्टरों के ब्लाइंड स्पॉट्स को ठीक करता है और अनदेखी फॉरजरी फैमिली पर पुनर्र्विक्षण (retraining) की आवश्यकता के बिना अत्याधुनिक क्रॉस-जेनरेटर मजबूती प्राप्त करता है।

Guang Yang, Fengchen Liu2026-07-22
💻 computer science

Privileged Lesion-Context Relational Distillation for Mask-Free Skin Lesion Classification

यह शोध पत्र प्रिविलेज्ड लीजन-कॉन्टेक्स्ट रिलेशनल डिस्टिलेशन (PLCRD) का प्रस्ताव करता है, जो एक शिक्षक-छात्र ढांचा है जो रिलेशनल डायग्नोस्टिक ज्ञान को स्थानांतरित करने के लिए विशेष रूप से प्रशिक्षण के दौरान लीजन सेगमेंटेशन मास्क का लाभ उठाता है, जिससे एक व्यावहारिक, केवल-इमेज छात्र मॉडल बिना मास्क की आवश्यकता के उच्च-प्रदर्शन वाली स्किन लीजन क्लासिफिकेशन प्राप्त करने में सक्षम होता है।

Abu Mukaddim Rahi, Md Mithun Hossain, Md Zulficar Hasan Joy, M. F. Mridha, Md. Jakir Hossen2026-07-22
💻 computer science

Image Editing Models are Numerical Solvers

यह शोध पत्र प्रदर्शित करता है कि पूर्व-प्रशिक्षित जनरेटिव इमेज-एडिटिंग मॉडल इनपुट और समाधानों को छवियों के रूप में एनकोड करके भौतिक प्रणालियों के विविध संख्यात्मक सिमुलेशन (numerical simulations) को हल करने के लिए एक एकीकृत इंटरफ़ेस के रूप में कार्य कर सकते हैं, जबकि साथ ही प्रतिनिधित्व संबंधी बाधाओं के कारण अराजक प्रणालियों (chaotic systems) को संभालने और सख्त भौतिक इनवेरियंट्स (physical invariants) को लागू करने में मौलिक सीमाओं को भी रेखांकित करता है।

Ulysse Mizrahi2026-07-22
💻 computer science

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

यह शोध पत्र ZeroSplat को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) और शून्य-विशेषता (zero-feature) वाला ढांचा है जो मौजूदा विधियों की सीमाओं को संबोधित करता है, जिससे मल्टी-व्यू ज्यामितीय बाधाओं के माध्यम से 2D विजन-लैंग्वेज मॉडल प्रायर (priors) को 3D स्पेस में उठाकर 3D गॉसियन स्प्लेटिंग के माध्यम से अनिश्चित संख्या में लक्ष्यों के सामान्यीकृत संदर्भित सेग्मेंटेशन (referring segmentation) को सक्षम बनाया जा सके।

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si2026-07-22
💻 computer science

In-Context Learning for Wound Classification with Small Multimodal Language Models

यह अध्ययन प्रदर्शित करता है कि छोटे मल्टीमॉडल भाषा मॉडल रिट्रीवल-आधारित इन-कॉन्टेक्स्ट लर्निंग के माध्यम से बिना किसी प्रशिक्षण के घाव की छवि वर्गीकरण को प्रभावी ढंग से कर सकते हैं, जो कार्य-विशिष्ट पुन: प्रशिक्षण की आवश्यकता के बिना क्वेरी-कंडीशन्ड सपोर्ट उदाहरणों और मैक्सिमल मार्जिनल रिलेवेंस रीरैंकिंग का लाभ उठाकर सार्वजनिक डेटासेट पर उच्च सटीकता प्राप्त करते हैं।

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg2026-07-22
💻 computer science

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

यह शोध पत्र UniGeo का प्रस्ताव करता है, जो एक सार्वभौमिक पर्सन री-आइडेंटिफिकेशन फ्रेमवर्क है जो 2D बेसलाइन से मोनोकुलर 3D ज्यामितीय निष्कर्षण को अलग करके और संरचनात्मक टोपोलॉजी का लाभ उठाते हुए ज्यामितीय शोर को कम करने के लिए एक कंसिस्टेंसी-अवेयर रिलायबिलिटी गेट के माध्यम से उन्हें गतिशील रूप से संलयित करके विविध परिदृश्यों में मजबूती को बढ़ाता है।

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye2026-07-22
🤖 machine learning

Local Label-Informed Feature Transfer for Generating Ground-Truth Medical Images: A Comparison of GAN- and Diffusion-Based Approaches

यह शोध पत्र लोकल लेबल-इन्फॉर्म्ड फीचर ट्रांसफर (LLIFT) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो पिक्सेल-स्तरीय एनोटेशन के बिना प्रशिक्षित GAN या डिफ्यूजन-आधारित मॉडलों का उपयोग करके स्थानिक रूप से नियंत्रित लीजन्स (lesions) के साथ यथार्थवादी अर्ध-सिंथेटिक ब्रेन MRI चित्र उत्पन्न करता है, जिससे मेडिकल इमेजिंग में एक्सप्लेनेबल एआई (Explainable AI) विधियों को मान्य करने के लिए विश्वसनीय ग्राउंड-ट्रुथ डेटासेट तैयार होते हैं।

Rick Wilming, Irem Ozseker, Luca Matteo Cornils, Ahcène Boubekki, Benedict Clark, Danny Panknin, Stefan Haufe2026-07-22
🤖 AI

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

यह शोध पत्र एक दोहरी प्रतिकूल फाइन-ट्यूनिंग (dual adversarial fine-tuning) रूपरेखा प्रस्तावित करता है जो विज़ुअल और सिमेंटिक सुपरविजन संकेतों को संयुक्त रूप से अनुकूलित करता है ताकि बिना किसी आर्किटेक्चर संशोधन या कार्य-विशिष्ट पुनप्रशिक्षण के, प्रतिकूल हमलों (adversarial attacks) के विरुद्ध लार्ज विजन-लैंग्वेज मॉडल्स की मजबूती और क्रॉस-टास्क सामान्यीकरण क्षमता को महत्वपूर्ण रूप से बढ़ाया जा सके।

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao2026-07-22
💻 computer science

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

DobicVLM एक विजन-लैंग्वेज मॉडल है जो क्लिनिकली-ग्राउंडेड, रूल-बेस्ड रिवार्ड्स के साथ ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाता है ताकि चेस्ट एक्स-रे रिपोर्ट जनरेट की जा सकें जो इम्प्रेशन एक्यूरेसी और मेडिकल टर्मिनोलॉजी में जेमिनी 2.5 फ्लैश जैसे स्ट्रॉन्ग बेसलाइन्स से बेहतर प्रदर्शन करती हैं और न्यूरल रिवॉर्ड मॉडल्स पर निर्भर रहे बिना स्ट्रक्चरल और सिमेंटिक अनुपालन सुनिश्चित करती हैं।

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chib (…)2026-07-22