💻 computer science

Perturb the Thought, Not the Pixels: Latent-Space Rollout Diversification for Reinforcement Learning of Vision-Language Models

تقدم الورقة البحثية طريقة "التعلم المعزز بتباين الضجيج" (NC-GRPO)، وهي وسيلة تعمل على تنويع مخرجات التعلم المعزز للنماذج اللغوية البصرية عبر حقن ضجيج مُعاير في الفضاء الكامن بدلاً من البكسلات، مما يعزز بشكل كبير القدرة على الاستنتاج خارج النطاق والمتانة ضد الهلوسة مع الحفاظ على حد أدنى من بصمة التنفيذ.

Michael Jerge, Joseph Pelczar, Justin Downes2026-08-25
💻 computer science

SketchFlow: Zero-Shot Vector Sketch Generation via GMM Prior Flow in CLIP Latent Space

يُعد SketchFlow إطار عمل مبتكر لتوليد رسومات المتجهات بنمط (zero-shot)، حيث يستفيد من مطابقة التدفق الشرطي القائم على النقل الأمثل ضمن فضاء CLIP الكامن، مدمجاً مع نموذج خليط غاوسي مسبق وفك تشفير انتشار هجين، لإنتاج مسارات ضربات فرشاة عالية الجودة تشبه تلك البشرية دون الحاجة إلى بيانات مقترنة بين النص والرسومات.

Jin Zhou, Hongliang Yang, Pengfei Xu, Hui Huang2026-08-25
💻 computer science

Emotion Intensity Matters: Generating Realistic Expressions in Virtual Humans with CVAEs

تقترح هذه الورقة البحثية نموذج مشفر تلقائي تبايني شرطي (CVAE) تم تدريبه على مجموعة بيانات صغيرة من تعبيرات الوجه البشرية الحقيقية لتوليد رسوم متحركة لبشر افتراضيين واقعيين وقابلين للتحكم، تحافظ على الاتساق الدلالي وتعكس بدقة شدة المشاعر المتفاوتة دون الحاجة إلى تدخل يدوي.

Vitor Miguel Xavier Peres, Lara Volpato, Gabriel Ferri Scnheider, Soraia Raupp Musse2026-08-25
💬 NLP

The Plan, Not the Decoder: Diagnosing and Repairing Compositional Failure in Reasoning-Augmented Text-to-Image Generation

تشخّص هذه الورقة الإخفاقات التركيبية في نماذج تحويل النص إلى صورة المعززة بالاستدلال عبر إثبات أن فك التشفير ينفذ الخطة المولدة بأمانة بينما يمثل المخطط نفسه عنق الزجاجة بسبب الانحيازات المعتمدة على الصياغة والازدحام الهندسي، مما يثبت أن تعديل الخطة الصريحة بدلاً من إعادة تدريب النموذج يحل هذه الأخطاء بفعالية.

Ashritha Gonuguntla2026-08-25
💻 computer science

Calibrate What You SHIP: Post-Selection Risk Control for Verifier-Guided Text-to-Image Generation

تقدم هذه الورقة البحثية SHIP، وهي طريقة تعمل على معايرة عتبات الإصدار على مستوى السياسة بدلاً من مستوى المرشح لضمان ضبط المخاطر الصالح لأنظمة تحويل النص إلى صورة الموجهة بالتحقق والتي تستخدم البحث في وقت الاختبار، مما يقلل بشكل كبير من خطر المخرجات المُطلقة مع الحفاظ على الصلاحية في العينات المحدودة.

Xuanhua Yin, Shunqi Mao, Wei Guo, Chuanzhi Xu, Weidong Cai2026-08-25
⚛️ nuclear experiments

How Architecture and Training Affect TPC Representations Across Experiments

تُثبت هذه الورقة أن التصميم المعماري للمشفرات، وليس مجرد تدريبها، هو المصدر الرئيسي للبنية القابلة لإعادة الاستخدام وذات الصلة بالمهام في تمثيلات أحداث غرفة الإسقاط الزمني (TPC)، كما يتضح من الفائدة العابرة للتجارب لتمثيلات التضمين المستخرجة من نماذج Sparse ResNet وPointNet، سواء كانت مدربة أو ذات تهيئة عشوائية.

Tyler Wheeler, Michelle P. Kuchera, Raghuram Ramanujan, William Sieland, Ryan Krupp, Daniel Bazin, Connor L. Cross, Hoi (…)2026-08-25
🤖 AI

What Does CLIP Learn for Regional Geolocalization? Probing Visual Cues and Scene Configuration After Adaptation

تُثبت هذه الورقة أن تكييف نماذج CLIP مسبقة التدريب عبر الضبط الدقيق للمُشفّر يُحسن بشكل كبير من دقة التحديد الجغرافي الإقليمي في المناطق الحضرية من خلال تعزيز الحساسية لتكوينات المشاهد المتكاملة، في حين تظل النماذج المجمدة التي تعتمد على الميزات صفرية التدريب غير فعالة للتمييز دقيق التفاصيل.

Changyu Lee, Yeonsoo Park, Abdullah Alfarrarjeh, Seon Ho Kim2026-08-25
💬 NLP

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

تقترح الورقة البحثية GapSight، وهو إطار عمل يدرب موجِّهًا خفيف الوزن لتمكين نماذج الرؤية واللغة من إعادة فحص مناطق صور حرة التنسيق بشكل انتقائي بناءً على إشارات الفشل الخاصة بها (الإشراف بفجوة الخسارة)، مما يحسن الأداء بشكل كبير في المهام التي تركز على التفاصيل دون زيادة تكاليف الحوسبة بشكل عشوائي.

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang2026-08-25
⚡ electrical engineering

LiteEvent-AE: Lightweight Autoencoder for Event-Based Vision on Low-Latency Energy-Constrained Edge Devices

تقدم هذه الورقة LiteEvent-AE، وهو مشفر تلقائي خفيف الوزن للرؤية القائمة على الأحداث يحقق دقة تمييز تنافسية مع عدد معاملات أقل بمقدار 35.6 ضعفاً واستهلاك طاقة أقل بمقدار 726.3 ضعفاً مقارنة بـ YOLOv9، مما يتيح استدلالاً مستداماً وفي الوقت الفعلي على الأجهزة الطرفية محدودة الموارد مثل Raspberry Pi 4B وNVIDIA Jetson Nano.

Riadul Islam, Joey Mule, Dhandeep Challagundla, Shahmir Rizvi, Sean Carson, Rachit Saini2026-08-25
💻 computer science

DefaultShift: Auditing Semantic Default Shift in Accelerated Text-to-Image Models

تقدم هذه الورقة البحثية DefaultShift، وهو إطار عمل للتدقيق المزدوج وطريقة للمعايرة تكتشف وتخفف من حدة "الانزياح الدلالي الافتراضي" — وهو التغيير غير المقصود في توزيعات السمات غير المحددة في نماذج تحويل النص إلى صورة المتسارعة — مما يضمن الحفاظ على الدلالات دون المساس بجودة المخرجات.

Xuanhua Yin, Chuanzhi Xu, Shunqi Mao, Wei Guo, Weidong Cai2026-08-25