🤖 AI

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

लेगाटो 2 (Legato 2) एक नवीन, सिस्टम-दर-सिस्टम न्यूरल पाइपलाइन पेश करता है जो टेक्स्ट को समाहित करते हुए प्रतीकात्मक प्रतिलेखन (symbolic transcriptions) उत्पन्न करके और मल्टीमॉडल एकीकरण के माध्यम से डाउनस्ट्रीम म्यूजिकल डॉक्यूमेंट अंडरस्टैंडिंग को बढ़ाकर ऑप्टिकल म्यूजिक रिकग्निशन में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith2026-07-08
💻 computer science

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

यह शोध पत्र GRSSL नामक एक दो-चरणीय ढांचे का प्रस्ताव करता है जो संदर्भ-परिवर्तित वस्तु वेरिएंट बनाने के लिए जनरेटिव इंटरवेंशन (generative intervention) को क्रॉस-वेरिएंट सेल्फ-सुपरवाइज्ड लर्निंग (Cross-Variant Self-Supervised Learning) के साथ जोड़ता है ताकि स्पष्ट रूप से बैकग्राउंड-इनवेरिएंट (background-invariant) निरूपणों को प्रशिक्षित किया जा सके, जिससे कई बेंचमार्क पर वितरण बदलावों (distribution shifts) के विरुद्ध अत्याधुनिक मजबूती प्राप्त होती है।

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav2026-07-08
💻 computer science

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation

GraspIT एक नवीन ओपन-सोर्स डेटासेट है जो सिम-टू-रियल गैप को पाटता है, क्योंकि यह रोबोटिक ग्रैस्पिंग और पॉलिसी लर्निंग को सक्षम करने के लिए फ्रैंका पांडा रोबोटों पर एक कठोर चार-चरणीय स्लिप-टेस्ट के माध्यम से जनरेट किए गए 316,000 भौतिक रूप से सत्यापित, उच्च-गुणवत्ता वाले 6-DoF ग्रैस्प एनोटेशन को सिम्युलेटेड और वास्तविक दुनिया के टेबलटॉप दृश्यों में प्रदान करता है।

Paul Koch. Adem Karakurt, André Sers2026-07-08
🤖 AI

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

Harrison.Rad 1.5 एक रेडियोलॉजी-विशिष्ट मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जिसे विविध एक्स-रे और मैमोग्राफी छवियों, नैदानिक संदर्भ और पूर्व अध्ययनों से संरचित और असंरचित रिपोर्ट उत्पन्न करने के लिए एक तीन-चरणीय पाइपलाइन के माध्यम से प्रशिक्षित किया गया है, जो सिम्युलेटेड FRCR परीक्षा सहित नैदानिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah2026-07-08
💬 NLP

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

यह शोध पत्र पॉलिसी-एडेप्टिव इमेज गार्डरेल्स के मूल्यांकन के लिए पॉलिसीशिफ्टबेंच (PolicyShiftBench) का परिचय देता है, और पॉलिसीशिफ्टगार्ड (PolicyShiftGuard) का प्रस्ताव करता है, जो दो-चरणीय रेसिपी के साथ प्रशिक्षित एक नवीन मॉडल है जो विभिन्न सुरक्षा नीतियों के अनुकूल गतिशील रूप से ढलने में मौजूदा विधियों की तुलना में काफी बेहतर प्रदर्शन करता है।

Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li2026-07-08
💬 NLP

CMDR: Contextual Multimodal Document Retrieval

यह शोध पत्र CMDR पेश करता है, जो एक नया मल्टीमॉडल दस्तावेज़ पुनर्प्राप्ति कार्य और बेंचमार्क (CMDR-Bench) है जिसके लिए दस्तावेज़ संदर्भ को मॉडल करने की आवश्यकता होती है, साथ ही इसमें CMDR-Embed फ्रेमवर्क और CMCL लर्निंग ऑब्जेक्टिव है जो कई पृष्ठों को संयुक्त रूप से एनकोड करता है ताकि मौजूदा गैर-संदर्भात्मक विधियों से काफी बेहतर प्रदर्शन किया जा सके।

Ryota Tanaka, Taku Hasegawa, Kyosuke Nishida2026-07-08
🤖 AI

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

NegROI एक नवीन ट्रांसफार्मर-आधारित फ्रेमवर्क है जो इंटरैक्टिव 3D सेगमेंटेशन के लिए, अनिश्चितता-निर्देशित स्थानीय बहु-रिज़ॉल्यूशन परिशोधन (uncertainty-guided local multi-resolution refinement) को दृश्य-सशर्त नकारात्मक प्रॉम्प्ट्स (scene-conditioned negative prompts) के साथ जोड़कर क्लिक दक्षता और विविध डेटासेटों में मजबूती को बढ़ाता है, ताकि फॉल्स पॉजिटिव्स को प्रभावी ढंग से दबाया जा सके और ऑब्जेक्ट सीमाओं को स्पष्ट किया जा सके।

Shuheng Zhang, Feng Wu2026-07-08
💻 computer science

Unlearnable Faces: Privacy Protection Surviving Extraction Pipeline

यह शोध पत्र LPID को प्रस्तुत करता है, जो एक गोपनीयता संरक्षण विधि है जो चेहरे के निष्कर्षण पाइपलाइन (face extraction pipeline) को अनलर्नेबल उदाहरण निर्माण प्रक्रिया में एकीकृत करती है ताकि ऐसे अदृश्य विक्षोभ (imperceptible perturbations) बनाए जा सकें जो इमेज क्रॉपिंग और रिसाइजिंग के बाद भी अनधिकृत फेस-रिकग्निशन मॉडल के विरुद्ध प्रभावी बने रहते हैं, और साथ ही अनदेखी पहचानों (unseen identities) के लिए सामान्यीकरण भी करते हैं।

Byunghoon Oh, Sunghwan Park, Jaewoo Lee2026-07-08
💻 computer science

OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations

OBBSeg एक नवीन वीक्यली सुपरवाइज्ड (weakly supervised) सेग्मेंटेशन फ्रेमवर्क है जो ओरिएंटेड बाउंडिंग बॉक्स एनोटेशन, ज्यामितीय निरंतरता के लिए एक मास्क-टू-ओबीबी (Mask-to-OBB) लॉस, और प्रॉम्प्ट-ड्रिवन सिमेंटिक गाइडेंस का लाभ उठाता है ताकि विविध चिकित्सा इमेजिंग मोडैलिटीज में पूर्णतः सुपरवाइज्ड विधियों के तुलनीय प्रदर्शन प्राप्त किया जा सके, जबकि एनोटेशन लागत को महत्वपूर्ण रूप से कम किया जा सके।

Jun Wei, Xinchang Liu, Yu Liu, Chuhua Yang, Shuhui Wang, Hui Huang2026-07-08
💻 computer science

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

यह शोध पत्र एक एंड-टू-एंड पाइपलाइन प्रस्तुत करता है जो पहले उनके संरचनात्मक प्रकारों को वर्गीकृत करके और फिर उच्च गुणवत्ता वाला JSON डेटा उत्पन्न करने के लिए DeepSeek R1 लार्ज लैंग्वेज मॉडल का उपयोग करके, 2,781 विषम रियल एस्टेट प्रश्नावली दस्तावेजों से संरचित संपत्ति मेटाडेटा को सफलतापूर्वक निकालता है, जिसे निरंतरता स्कोरिंग और मार्केट सेगमेंटेशन क्लस्टरिंग के माध्यम से सत्यापित किया गया था।

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García2026-07-08