💻 computer science

Low-Cost Neural Radiance Fields

تقدم هذه الورقة دراسة مقارنة لمتغيرات حقول الإشعاع العصبي المتسارعة (DS-NeRF، وTensoRF، وHashNeRF)، وتستكشف الامتدادات ذات الحوسبة المنخفضة والبيانات المحدودة، لتخلص في النهاية إلى أنه على الرغم من عدم تفوق أي من التعديلات الهيكلية أو التعديلات في الإشراف المقترحة بشكل قاطع على النماذج المرجعية الحالية تحت قيود الوقت المتساوي، إلا أن التجارب تقدم رؤى قيمة حول مقايضات التصميم في الإعدادات المقيدة.

Alice Huang, Prathamesh Sonawane, Yashdeep Thorat, Yug Rao2026-05-12
🤖 machine learning

Mem-W: Latent Memory-Native GUI Agents

يقدم Mem-W فئة جديدة من وكلاء واجهة المستخدم الرسومية (GUI) التي تدمج الذاكرة التاريخية والذاكرة العاملة مباشرة في السياق الكامن للنموذج كرموز مدمجة، مما يلغي التباين بين الذاكرة الرمزية الخارجية والتمثيلات الداخلية لتحسين أداء المهام طويلة المدى بشكل كبير عبر اختبارات الويب والهاتف المحمول.

Guibin Zhang, Yaohui Ling, Fanci Meng, Kun Wang, Shuicheng Yan2026-05-12
🤖 machine learning

PGID: Progressive Guided Inversion and Denoising for Robust Watermark Detection

تقترح هذه الورقة إطار عمل PGID، وهو إطار عمل جاهز للاستخدام ولا يتطلب تدريباً، يعمل على الدفاع ضد هجمات إزالة العلامات المائية وهجمات التزوير على الصور المولدة بواسطة الذكاء الاصطناعي من خلال استخدام العكس الموجه التدريجي وإزالة الضجيج لإسقاط الكمونات المضطربة مرة أخرى إلى مناطقها الأصلية، مما يؤدي إلى استعادة موثوقية الكشف القوية.

Minh Quoc Duong, Chun Tong Lei, Chun Pong Lau2026-05-12
💻 computer science

FrameTwin: Curve-Anchored Gaussian Alignment from Sparse Views for Adaptive Wireframe 3D Printing

يُعد FrameTwin إطار عمل للمحاذاة الغاوسية المرتكزة على المنحنيات، والذي يستفيد من صور ذات رؤية ضئيلة ومسار رندرة تفاضلي لتقدير حقول التشوه في الوقت الفعلي، مما يتيح تحديثات مسار تكيفية لطباعة ثلاثية الأبعاد للهياكل السلكية تتسم بالمتانة.

Wenting Wang, Zhuo Huang, Kun Qian, Neelotpal Dutta, Yuhu Guo, Yingjun Tian, Yeung Yam, Charlie C. L. Wang2026-05-12
🧬 biology

LiteMedCoT-VL: Parameter-Efficient Adaptation for Medical Visual Question Answering

تقدم هذه الورقة البحثية LiteMedCoT-VL، وهو إطار عمل فعال من حيث المعلمات يقوم باستخلاص استدلال سلسلة الأفكار (chain-of-thought) من نموذج معلم بحجم 235 مليار معلمة إلى نموذج طالب بحجم 2 مليار معلمة عبر الضبط الدقيق باستخدام تقنية LoRA، مما يمكّن النماذج البصرية اللغوية الطبية المدمجة من تحقيق أداء رائد على معيار PMC-VQA دون الاعتماد على التسميات التوضيحية للصور.

Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao2026-05-12
💻 computer science

AnyDepth-DETR/-YOLO: Any-depth object detection with a single network

تقدم هذه الورقة البحثية AnyDepth-DETR/-YOLO، وهو إطار عمل يُمكّن شبكة واحدة لاكتشاف الأشياء من ضبط عمقها ديناميكياً عند الاستدلال لتشمل نطاقاً مستمراً من المقايضات بين الدقة والكفاءة دون الحاجة لإعادة التدريب، وذلك عبر توظيف بنية مسار تحسين قابل للتخطي وتدريب التقطير الذاتي للحفاظ على التسلسل الهرمي للميزات وضمان الوحدات المرحلية.

Woochul Kang, Hyungseop Lee, Jiho Lee2026-05-12
🤖 AI

Relational Retrieval: Leveraging Known-Novel Interactions for Generalized Category Discovery

تقترح هذه الورقة البحثية "اتساق النمط العلاقاتي" (RPC)، وهو إطار عمل مبتكر لاكتشاف الفئات المعممة يستفيد من نقل المعرفة ثنائي الاتجاه بين البيانات المصنفة وغير المصنفة من خلال المحاذاة الدلالية ومطابقة الأنماط العلاقاتية الثابتة لتحقيق أداء يمثل أحدث ما توصل إليه العلم.

Yulin Xu, Chunqi Guo, Yuanzhen Shuai, Jianyuan Ni2026-05-12
🤖 AI

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

تقدم الورقة البحثية COAST، وهو إطار عمل لتقليم الرموز الدلالية التكيفي والتبايني ولا يتطلب تدريباً، يمنع "الحبسة البصرية" (Visual Aphasia) من خلال الحفاظ ديناميكياً على الرموز البصرية الجوهرية بناءً على التشتت السياقي والتوجيه التبايني، محققاً تسريعاً كبيراً في الاستنتاج مع الحفاظ على أداء قريب من الأداء الأصلي عبر مختلف نماذج الرؤية واللغة.

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun2026-05-12
🤖 AI

When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation

تُثبت هذه الورقة أن استبدال العمود الفقري القياسي FLUX.dev المكون من 28 خطوة بنسخة FLUX.schnell المقطرة، مع الإبقاء على محول الهوية InfuseNet مجمدًا وتعطيل التوجيه الخالي من التصنيف، يحقق تقليلاً في زمن الاستجابة بمقدار 5.9 ضعفًا مع تحسين دقة الهوية والجودة البصرية، مما يكشف أن الحفاظ على الهوية يتم تأسيسه بفعالية خلال أول 4 إلى 8 خطوات من إزالة الضجيج.

Dongqi Zheng2026-05-12
⚡ electrical engineering

ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality

تقدم هذه الورقة ML-CLIPSim، وهو مقياس جودة صور مرجعي كامل وقابل للتفاضل يستفيد من تشابهات طبقات CLIP المتعددة ليتوافق بشكل أفضل مع التفضيلات الموجهة للآلة ويحسن المقايضات بين المعدل والمهمة في ضغط الصور، مع الحفاظ على التنافسية في التنبؤ بالجودة البشرية.

Feng Ding, Haisheng Fu, Jie Liang, Qihan Xu, Siyu Zhu, Jingning Han2026-05-12