💻 computer science

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

تقدم هذه الورقة البحثية إطار عمل GAR-SSL، وهو إطار لتحديد موقع مصدر الصوت لا يتطلب تدريباً، يستفيد من قدرات الاستدلال الميتافيزيقي الجوهرية للنماذج اللغوية الكبيرة متعددة الوسائط من خلال مسار (توليد-تحليل-تنقيح) لتحقيق أداء تنافسي في المشاهد الصوتية المعقدة دون الاعتماد على التعلم التبايني.

Subin Park, Jung Uk Kim2026-04-09
💻 computer science

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

يُعد RefineAnything نموذجاً يعتمد على الانتشار متعدد الوسائط، حيث يقدم إعداداً للتحسين المخصص لمنطقة معينة لاستعادة التفاصيل المحلية دقيقة الحبيبات مع الحفاظ بصرامة على الخلفية، مستفيداً من استراتيجية "التركيز والتحسين" المبتكرة التي تعيد تخصيص الدقة للمنطقة المستهدفة وفقدانٍ مدرك للحدود لتقليل العيوب.

Dewei Zhou, You Li, Zongxin Yang, Yi Yang2026-04-09
💻 computer science

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

يُعد Q-Zoom إطار عمل تكيفي يعتمد على الاستعلام، يعمل على تعزيز كفاءة ودقة النماذج اللغوية الكبيرة متعددة الوسائط من خلال التجاوز الديناميكي لمعالجة الدقة العالية غير الضرورية وتوظيف آلية ذاتية الإشراف لتحديد وتدقيق المناطق ذات الصلة بالمهمة بدقة، مما يحقق تسريعاً كبيراً في عملية الاستنتاج دون المساس بالأداء.

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu2026-04-09
💻 computer science

POS-ISP: Pipeline Optimization at the Sequence Level for Task-aware ISP

يقدم POS-ISP إطار عمل للتعلم المعزز على مستوى التسلسل يتسم بالاستقرار والكفاءة، حيث يعمل على تحسين خط معالجة معالجة الصور الرقمية (ISP) المعياري بأكمله ومعاملاته في تمريرة أمامية واحدة باستخدام مكافأة مهمة نهائية، مما يتغلب على عدم التطابق بين التدريب والاستدلال والعبء الحسابي الذي تسببه أساليب البحث في البنية العصبية والتعلم المعزز المرحلي الحالية.

Jiyun Won, Heemin Yang, Woohyeok Kim, Jungseul Ok, Sunghyun Cho2026-04-09
💻 computer science

Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis

تقدم هذه الورقة البحثية "Grounded Forcing"، وهو إطار عمل مبتكر يعزز التماسك والقدرة على التحكم طويل الأمد في توليد الفيديو ذاتي الانحدار من خلال دمج ذاكرة تخزين مؤقت ثنائية لـ KV (Dual Memory KV Cache)، وحقن RoPE ثنائي المرجع (Dual-Reference RoPE Injection)، وإعادة تخزين تقاربي غير متماثل (Asymmetric Proximity Recache) لمعالجة تحديات النسيان الدلالي، والانجراف البصري، وتبديل التعليمات في آن واحد.

Jintao Chen, Chengyu Bai, Junjun hu, Xinda Xue, Mu Xu2026-04-09
💻 computer science

Compression as an Adversarial Amplifier Through Decision Space Reduction

تكشف هذه الورقة أن ضغط الصور يمكن أن يعمل كمضخم للخصومة من خلال إحداث تقليص في فضاء القرار، مما يؤدي إلى تقليص هوامش التصنيف ويجعل المصنفات الصورية العميقة أكثر عرضة بشكل كبير للهجمات المطبقة مباشرة في النطاق المضغوط مقارنة بالهجمات التقليدية في نطاق البكسل.

Lewis Evans, Harkrishan Jandu, Zihan Ye, Yang Lu, Shreyank N Gowda2026-04-09
💻 computer science

MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation

تقدم هذه الورقة MAR-GRPO، وهو إطار عمل للتعلم التعزيزي المستقر لتوليد الصور الهجين القائم على التشفير الذاتي التكراري المقنع والانتشار، والذي يستخدم توقع المسارات المتعددة واختيار الرموز المدرك لعدم اليقين للتخفيف من ضوضاء التدرج وتحسين الجودة البصرية واستقرار التدريب.

Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao2026-04-09
💻 computer science

Generative Phomosaic with Structure-Aligned and Personalized Diffusion

تقدم هذه الورقة أول نهج توليدي لإنشاء الفسيفساء الفوتوغرافية يستخدم نماذج الانتشار المحاذية للهيكل والمخصصة لتخليق صور بلاطات ذات تعبير دلالي وتماسك هيكلي، متجاوزةً بذلك قيود التنوع والاتساق التي تفرضها طرق مطابقة الألوان التقليدية.

Jaeyoung Chung, Hyunjin Son, Kyoung Mu Lee2026-04-09
💻 computer science

Synthetic Dataset Generation for Partially Observed Indoor Objects

تقدم هذه الورقة إطار عمل للمسح الافتراضي مُنفذ في بيئة Unity يقوم بتوليد مجموعة بيانات V-Scan، وهي مجموعة واسعة النطاق من المسوحات الداخلية الاصطناعية الواقعية مع معلومات كاملة حول الهندسة الأرضية والحجب، وذلك لمعالة ندرة البيانات اللازمة لتدريب أساليب إعادة بناء المشاهد ثلاثية الأبعاد وإكمال الأجسام القائمة على التعلم.

Jelle Vermandere, Maarten Bassier, Maarten Vergauwen2026-04-09
⚛️ high-energy experiments

Towards foundation-style models for energy-frontier heterogeneous neutrino detectors via self-supervised pre-training

تقترح هذه الورقة إطار عمل لنموذج "ViT" متفرق ذاتي الإشراف يستفيد من الترميز التلقائي المقنع والأهداف العلاقاتية لتعلم تمثيلات قابلة لإعادة الاستخدام من بيانات كواشف النيوترينو غير المتجانسة، مما يحسن بشكل كبير أداء إعادة البناء وكفاءة البيانات لتجارب حدود الطاقة مثل FASERCal مع إظهار قدرة قوية على النقل عبر تقنيات الكواشف المتنوعة.

Saúl Alonso-Monsalve, Fabio Cufino, Umut Kose, Anna Mascellani, André Rubbia2026-04-09