🤖 AI

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

यह शोध पत्र एक पुनरावृत्ति स्व-सुधार ढांचे (iterative self-improving framework) का प्रस्ताव करता है जो एक एकीकृत मल्टीमॉडल मॉडल के अपने निर्णय का लाभ उठाकर असुरक्षित जनरेशन की पहचान करता है और अनुकूल रूप से इसके विजुअल कोडबुक को परिष्कृत करता है, जिससे बाहरी मानवीय फीडबैक की आवश्यकता के बिना ऑटोरेग्रेसिव इमेज जनरेशन में सुरक्षा को बढ़ाया जा सके।

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu2026-06-26
💻 computer science

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

यह शोध पत्र LISA को प्रस्तुत करता है, जो एक नियमितीकरण (regularization) विधि है जो विजुअल-कंडीशन द्वारा नियंत्रित जनरेशन में अतिरिक्त अनुमान लागत (inference cost) के बिना प्रशिक्षण दक्षता, अभिसरण (convergence) और फीचर डिसेंटैंगलमेंट (feature disentanglement) में सुधार करने के लिए साइड नेटवर्क फीचर्स को एक अनुमानित संभावना स्कोर (approximated likelihood score) के साथ संरेखित करता है।

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen2026-06-26
🤖 AI

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan

यह अध्ययन 4chan पर एआई नूडिफिकेशन (AI nudification) का एक बड़े पैमाने पर विश्लेषण प्रस्तुत करता है, जो सुलभ ओपन-सोर्स मॉडल और उत्पादकों के एक छोटे समूह द्वारा संचालित, मशहूर हस्तियों से हटकर सामाजिक दायरे के भीतर गैर-मशहूर हस्तियों को लक्षित करने की ओर एक महत्वपूर्ण बदलाव को प्रकट करता है, जिससे शासन और सुरक्षात्मक हस्तक्षेपों की तत्काल आवश्यकता रेखांकित होती है।

Chi Cui, Yixin Wu, Yang Zhang2026-06-26
💻 computer science

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

यह शोध पत्र CORTEX को प्रस्तुत करता है, जो 3D चेस्ट सीटी मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के लिए एक संरचित तर्क बेंचमार्क है, जो एक चार-चरणीय वर्कफ़्लो के माध्यम से लुप्त नैदानिक निशानों को पुनर्स्थापित करता है और विश्वसनीय, व्याख्या योग्य मेडिकल एआई के विकास को सक्षम करने के लिए एक चिकित्सक-डिज़ाइन किए गए मूल्यांकन प्रोटोकॉल के माध्यम से उन्हें मान्य करता है।

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert2026-06-26
💻 computer science

Exact and Deterministic Patch Descriptor Retrieval via Hierarchical Normalization

यह शोध पत्र पदानुक्रमित सामान्यीकरण (Hierarchical Normalization) को प्रस्तुत करता है, जो एक नियत (deterministic) विधि है जो फीचर वेक्टर्स को प्रमुख और गौण घटकों में विभाजित करके कुशल ब्रांच-एंड-बाउंड प्रूनिंग को सक्षम बनाने के लिए डिज़ाइन की गई है, जिससे ब्रूट-फोर्स सर्च की तुलना में महत्वपूर्ण गति प्राप्त होती है और साथ ही पूर्ण-वेक्टर मूल्यांकन के समान परिणाम बनाए रखती है, जिससे यह सिद्ध रूप से सटीक निकटतम-पड़ोसी पैच डिस्क्रिप्टर पुनर्प्राप्ति (nearest-neighbor patch descriptor retrieval) प्राप्त करता है। HN-Desc, 96.9% डिस्क्रिप्टर ऊर्जा को 8 आयामों तक सीमित करने के लिए पदानुक्रमित सामान्यीकरण पेश करता है, जो अनुमानित इंडेक्स के बिना सिद्ध सटीक निकटतम-पड़ोसी पुनर्प्राप्ति को सक्षम बनाता है, और गैर-समान आयामी महत्व (non-uniform dimensional importance) की अवधारणा का संबंध 2020 [पेटेंट 11,797,603] से है, जो कि मैट्रोशका प्रतिनिधित्व लर्निंग (Matryoshka Representation Learning, 2022) से पूर्व का है जो सामान्य-उद्देश्य के प्रतिनिधित्व के लिए नेस्टेड इलास्टिक एम्बेडिंग्स पर केंद्रित है।

Koichi Sato2026-06-26✓ Author reviewed
💻 computer science

Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

यह शोध पत्र एक पूर्व-प्रशिक्षित 3D-सचेत फेस GAN (EG3D) को सीधे न्यूरल रेडिएंस फील्ड डेंसिटी मानों पर मानव फीडबैक से सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करके फाइन-ट्यून करने की एक विधि प्रस्तुत करता है, जो स्पष्ट मेश पर्यवेक्षण या आकार पूर्वग्रहों (shape priors) की आवश्यकता के बिना उपयोगकर्ता-पसंद 3D चेहरे की ज्यामिति उत्पन्न करने में सक्षम बनाता है।

Archer Moore, Mingming Gong, Liam Hodgkinson2026-06-26
💻 computer science

See & Sniff: Learning Visuo-Olfactory Representations

यह शोध पत्र स्मेलनेट-वी (SmellNet-V) प्रस्तुत करता है, जो एक स्केलेबल विज़ुओ-ऑल्फैक्टरी (visuo-olfactory) डेटासेट है जिसे गंध के नमूनों को अर्थपूर्ण रूप से संरेखित छवियों के साथ सिंथेटिक रूप से जोड़कर बनाया गया है, और "सी एंड स्निफ़" (See & Sniff) स्वयं-पर्यवेक्षित ढांचे का प्रस्ताव करता है जो संयुक्त प्रतिनिधित्व सीखने में सक्षम बनाता है जो गंध वर्गीकरण, स्थानिक स्थानीयकरण और क्रॉस-मोडल रिट्रीवल को सक्षम बनाता है।

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak2026-06-26
💻 computer science

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

यह शोध पत्र OctoSense प्रस्तुत करता है, जो एक ओपन-सोर्स मल्टीमॉडल सेंसर प्लेटफॉर्म और संबंधित डेटासेट है जो एक तेज़, सुदृढ़, लेट-फ्यूजन मास्क ऑटोएनकोडर को सक्षम बनाता है ताकि विभिन्न धारणा कार्यों (perception tasks) में, विशेष रूप से रात के समय या सेंसर विफलता जैसी खराब स्थितियों के तहत, मौजूदा इमेज-ओनली फाउंडेशन मॉडल्स से बेहतर प्रदर्शन किया जा सके।

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari2026-06-26
💻 computer science

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

RoPEMover एक गहराई-जागरूक (depth-aware) ऑब्जेक्ट रिलोकेशन विधि पेश करता है जो डिफ्यूजन ट्रांसफॉर्मर्स के भीतर रोटरी पोजीशनल एम्बेडिंग्स (rotary positional embeddings) में हेरफेर करके ज्यामिति-संगत स्थानिक पुनर्व्यवस्था प्राप्त करता है, जिसमें यथार्थवादी ऑक्लूजन हैंडलिंग और शैडो अपडेट शामिल हैं, जो न्यूनतम वास्तविक दुनिया के पर्यवेक्षण के बावजूद अत्याधुनिक प्रदर्शन प्रदर्शित करता है।

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar2026-06-26
💻 computer science

DnA: Denoising Attention for Visual Tasks

यह शोध पत्र डिनाइजिंग अटेंशन (DnA) प्रस्तुत करता है, जो एक नवीन तंत्र है जो सकारात्मक और नकारात्मक क्वेरीज़ का उपयोग करके इंटरैक्शन को विशिष्ट सबस्पेस में प्रोजेक्ट करता है, जिससे विजुअल कार्यों में शोर वाले अटेंशन पैटर्न को कम किया जा सके, और इस प्रकार इमेज और वीडियो अंडरस्टैंडिंग बेंचमार्क में प्रदर्शन लाभ प्राप्त किया जा सके।

Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta2026-06-26