💻 computer science

Where Does Generative Difficulty Reside? An Empirical Study of Target Representations

تُظهر هذه الدراسة التجريبية أن اختيار تمثيل الهدف في المولدات المستمرة المقنعة يعيد توزيع صعوبة التوليد بشكل جوهري عبر النمذجة السياقية، وإزالة الضجيج لكل رمز، والتحكم في وقت الاستدلال، مما يكشف أن عوامل مثل الضغط أو دقة إعادة البناء وحدها لا يمكنها التنبؤ بالأداء التوليدي للنموذج.

Marcel Plocher, Bernhard Schölkopf, Andreas Geiger, Gege Gao2026-08-04
💻 computer science

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds

يُعد CopyCat إطار عمل خفيف الوزن للتحسين لمرة واحدة، يعمل على تحسين الاتساق الدقيق للموضوع في نماذج "الموضوع إلى صورة" بشكل كبير خلال ثوانٍ معدودة عبر تحسين نموذج LoRA للاتساق الدقيق باستخدام صورة وسيطة واحدة من خلال هدف إعادة البناء الذاتي، مما يتيح تخصيصاً عالي الجودة عبر مواضيع متنوعة غير مرئية دون الحاجة إلى مزيد من الضبط.

Peng Zheng, Ruiqi Liu, Rui Ma, Zuxuan Wu2026-08-04
💻 computer science

Proteus: A Truncation-Robust Entropy Model for Progressive LiDAR Compression

بروتيوس (Proteus) هو إطار عمل تعلمي لضغط بيانات ليدار (LiDAR) يحقق المتانة ضد بتر القنوات اللاسلكية من خلال فصل بيانات السحابة النقطية إلى مستويات بت المدى الهامة لضمان خط أساس إدراكي، ومكونات غير هامة ذات أولوية هندسية، مما يتيح فقدان تدفق البتات بنسبة تصل إلى 70% مع التفوق على المعايير الحالية.

Yihan Qiu, Xiaodong Lin, Baoquan Zhao, Hailong Jiao, Ge Li2026-08-04
💻 computer science

Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection

تقترح هذه الورقة نموذجاً جديداً قائماً على "نسيان الآلة" للكشف عن الصور الاصطناعية، مستفيدة من الرؤية القائلة بأن نماذج الرؤية الضخمة تنسى سمات الصور المولدة بشكل أسرع من الصور الطبيعية، وذلك لتطوير طرق كشف تعتمد على البيانات أو لا تعتمد عليها تتفوق على الأساليب التقليدية.

Jun Nie, Yonggang Zhang, Tongliang Liu, Yiu-ming Cheung, Bo Han, Xinmei Tian2026-08-04
💻 computer science

Foveated Probes Recover Localized Binding Information in Vision Foundation Models

تُثبت هذه الورقة أن العمى المكاني الظاهري لنماذج الرؤية التأسيسية المجمدة ناتج في المقام الأول عن قيود تضمينات الصور العالمية، وليس عن نقص في المعلومات المكانية، حيث ينجح استخراج معلومات بؤري خفيف الوزن في استعادة تفاصيل الربط الموضعية التي يحجبها التجميع العالمي.

Mateusz Michalkiewicz, Mahsa Baktashmotlagh, Guha Balakrishnan2026-08-04
💻 computer science

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

تقدم هذه الورقة مجموعة بيانات ومعيار MDTD-Art لتقييم استعادة الصور في ظل تدهورات تراكب الأنسجة، كاشفةً أن نماذج تحرير الصور المعززة بهندسة الأوامر المهيكلة تتفوق على بنيات الاستعادة المتخصصة في الحفاظ على التفاصيل الدلالية والهيكلية.

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum2026-08-04
🤖 AI

Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation

تقترح هذه الورقة إطار عمل DP-SimAgg، وهو إطار تعلم اتحادي يحافظ على الخصوصية ويجمع بين التجميع الموزون بالتشابه والخصوصية التفاضلية من جانب الخادم لتدريب نماذج تقسيم أورام الدماغ بفعالية على بيانات رنين مغناطيسي غير متجانسة ومتعددة المؤسسات مع الحفاظ على أداء تنافسي في ظل ميزانيات خصوصية صارمة.

Muhammad Irfan Khan, Eero Lehtonen, Joni Obradovic, Elina Kontio, Esa Alhoniemi, Suleiman A. Khan, Mojtaba Jafaritadi2026-08-04
⚡ electrical engineering

MBO Scheme for Local Chan--Vese Segmentation

تقترح هذه الورقة خوارزمية فعالة تعتمد على طريقة ميريمن-بنس-أوشر (MBO) لحل نموذج تشان-فيس المحلي من أجل تقسيم الصور بشكل قوي، مع توسيع تطبيقها ليشمل الصور ثنائية الطور، ومتعددة الأطوار، والملونة، بما في ذلك البيانات الطبية وبيانات المجهر.

Kevin Bui, Adina Ciomaga2026-08-04
💻 computer science

Look Up and Look Back: Hidden Attention and Latent Orientation in a Frozen Foundation Model for Panoramic SLAM

تقدم الورقة البحثية HALO-SLAM، وهو نظام SLAM بانورامي أحادي الكاميرا مبتكر يستفيد من الانتباه الخفي وإشارات التوجيه الكامنة من نموذج تأسيسي مجمد لتحقيق محاذاة للجاذبية بدون وحدة قياس القصور الذاتي (IMU) وإغلاق حلقي قوي، مما أدى إلى نجاح بنسبة 100% ودقة تضاهي أحدث ما توصل إليه العلم عبر خمسة معايير مرجعية واقعية.

Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao2026-08-04
💻 computer science

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

يُعد MonitorVLM-v2 إطار عمل مُنشرًا يحول نماذج الرؤية واللغة الكبيرة إلى نظام مراقبة سلامة حتمي في الوقت الفعلي عبر استبدال تسلسل التفكير مفتوح النهايات بتنبؤات قواعدية أحادية الخطوة ومضغوطة وتحسين سياسات رمزية، محققًا زيادة في السرعة بمقدار 19.45 ضعفًا ومعدلات أعلى بكثير في اكتشاف الانتهاكات في منشأة تعدين تحت الأرض تشغيلية.

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan2026-08-04