🤖 AI

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

تقدم الورقة البحثية LiteLVLM، وهي طريقة لتقليم الرموز (token pruning) تعتمد على التوجيه النصي ولا تتطلب تدريباً، تقوم بعكس ترتيب تشابه الصور والنصوص الخاص بـ CLIP للاحتفاظ بكفاءة بالمناطق المرجعية لعملية التوطين البكسلي (pixel grounding) في النماذج اللغوية البصرية الكبيرة، محققةً بذلك تسريعاً كبيراً وتقليلاً في استهلاك الذاكرة مع التفوق على الأساليب الحالية.

Sangin Lee, Yukyung Choi2026-05-14
💻 computer science

Does Engram Do Memory Retrieval in Autoregressive Image Generation?

تُبين هذه الورقة أنه في حين أن وحدة "Engram" تُحسّن توليد الصور ذاتي الانحدار من خلال عملها كمسار جانبي معماري مُبَوَّب، إلا أنها تفشل في العمل كمسترجع ذاكرة موجه بالمحتوى، حيث تنبع مكاسب الأداء الخاصة بها أساساً من المسار نفسه بدلاً من الجدول المتعلم ذي المفاتيح الهاشية.

Jinghao Wang, Qiyuan He, Chunbin Gu, Pheng-Ann Heng2026-05-14
💻 computer science

Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation

تقترح هذه الورقة إطار عمل للتعليق التوضيحي المتوافق مع المهارات لتقييم نماذج تحويل النص إلى صورة، والذي يخصص استراتيجيات التعليق التوضيحي لمهارات محددة، مما يثبت أن هذا النهج يولد إشارات تقييم أكثر اتساقاً واستقراراً وموثوقية مقارنة بالطرق الموحدة التقليدية.

Abdelrahman Eldesokey, Merey Ramazanova, Ahmad Sait, Ansar Khangeldin, Karen Sanchez, Tong Zhang, Bernard Ghanem2026-05-14
💬 NLP

Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation

تقترح هذه الورقة إطار عمل معلوماتي نظري لا يتطلب تدريباً لعملية التوليد المعزز بالاسترجاع متعدد الوسائط، حيث يختار الأدلة المرئية بناءً على فائدتها (كسب المعلومات) بدلاً من التشابه الدلالي، محققاً أداءً استدلالياً متفوقاً وكفاءة حوسبية عالية عبر معايير قياسية متعددة.

Weiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang, Ziyi Huang2026-05-14
💻 computer science

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

تُعد Img2CADSeq مسار معالجة مبتكر متعدد المراحل يقوم بتوليد نماذج CAD ذات تمثيل حدودي (BRep) عالية الجودة وصحيحة طوبولوجياً من صور أحادية المنظور، وذلك عبر الاستفادة من دفتر رموز هرمي، والتعلم التبايني مع وسائط سحابة النقاط، ونموذج VQ-Diffusion لسد الفجوة بين النمطين ثنائي الأبعاد وثلاثي الأبعاد.

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen2026-05-14
💬 NLP

What Limits Vision-and-Language Navigation ?

تقدم الورقة البحثية StereoNav، وهو إطار عمل قوي للرؤية واللغة والعمل يستفيد من الرؤية المجسمة وأولويات الموقع المستهدف للتغلب على الفجوات بين المحاكاة والعالم الحقيقي في مجال الملاحة القائمة على الرؤية واللغة، محققاً أداءً هو الأفضل في فئته مع تحسين الموثوقية في البيئات المعقدة، وذلك باستخدام عدد أقل من المعلمات وبيانات تدريب أقل مقارنة بالنهج القائمة على التوسع.

Yunheng Wang, Yuetong Fang, Taowen Wang, Lusong Li, Kun Liu, Junzhe Xu, Zizhao Yuan, Yixiao Feng, Jiaxi Zhang, Wei Lu, Z (…)2026-05-14
🤖 machine learning

Neural Surrogate Forward Modelling For Electrocardiology Without Explicit Intracellular Conductivity Tensor

تقدم هذه الدراسة التجريبية نموذجاً بديلاً عصبياً قائماً على التعلم العميق يقوم بتمثيل دقيق للجهد داخل الأذين الأيسر وتحويله إلى تخطيط كهربائية القلب في المجال البعيد دون الحاجة إلى موترات موصلية داخل الخلايا غير قابلة للقياس صراحةً، مما يقلل من عدم اليقين الهيكلي في نمذجة الفسيولوجيا الكهربائية للقلب غير الجراحية.

Shaheim Ogbomo-Harmitt, Cesare Magnetti, Jakub Grzelak, Oleg Aslanidi2026-05-14
💻 computer science

Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics

تقدم هذه الورقة البحثية هجوم "الوكيل التكراري الخصمي" (SIAA)، وهو أسلوب من نوع "الصندوق الرمادي" يثبت أن معرفة هيكل "محول الرؤية" (Vision Transformer) وحده كافية لاختراق النماذج التأسيسية المجمدة المستخدمة في التحقيق الجنائي للصور الاصطناعية بشكل فعال، مما يكشف عن ثغرة حرجة في أنظمة الكشف عن التزييف العميق الحالية.

Chiara Musso, Joy Battocchio, Andrea Montibeller, Giulia Boato2026-05-14
🤖 machine learning

Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation

تقترح هذه الورقة البحثية RobustLT، وهو إطار عمل جاهز للتشغيل (plug-and-play) يقوم بتعديل الاضطرابات بشكل تكيفي أثناء التدريب الخصمي لتعزيز متانة النموذج ومعالجة عدم توازن الفئات في مجموعات البيانات ذات الذيل الطويل في آن واحد.

Lilin Zhang, Yimo Guo, Yue Li, Jiancheng Shi, Xianggen Liu2026-05-14
💻 computer science

Bayesian In Vivo Tracking of Synapses using Joint Poisson Deconvolution and Diffeomorphic Registration

تقدم هذه الورقة إطاراً بايزياً موحداً ومبتكراً يقوم في آن واحد بإزالة الضجيج من الصور، وفك الالتفاف، واستنتاج الكثافة، والتسجيل التمايزي لتتبع ونمذجة إعادة التنظيم الديناميكي للمشابك العصبية بمتانة في بيانات المجهر الفوتوني ثنائي الفوتون الحية الطولية المشوبة بالضجيج والاضطرابات الحركية.

Shashwat Kumar, Dominic M. Padova, Binish Narang, Gabrielle I. Coste, Austin R. Graves, Richard L. Huganir, Adam S. Char (…)2026-05-14