🤖 AI

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

تقدم هذه الورقة البحثية "محول توجيه القيمة المستقر" (SVGT)، وهو بنية مبتكرة تستخدم وحدة قيمة مستقلة ورموز جسر ديناميكية لتوجيه النماذج اللغوية الكبيرة نحو توافق ثابت مع القيم البشرية دون تعطيل التمثيلات الداخلية للنموذج الأساسي، محققةً خفضاً يتجاوز 70% في المخرجات الضارة مع الحفاظ على سلاسة اللغة.

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song2026-05-13
🧬 biology

Self-organized MT Direction Maps Emerge from Spatiotemporal Contrastive Optimization

تُثبت هذه الورقة أن شبكة عصبية اصطناعية عميقة طبوغرافية زمانية-مكانية، تم تدريبها باستخدام التعلم التبايني ذاتي الإشراف والتنظيم المكاني، تولد تلقائياً خرائط انتقائية للاتجاه وهياكل طوبولوجية واقعية بيولوجياً في منطقة MT، مما يكشف أن سمات المسار الظهري هذه تنبثق من مقايضة جوهرية بين التمييز المدفوع بالمهام والتنظيم المكاني.

Zhaotian Gu, Molan Li, Jie Su, Chang Liu, Tianyi Qian, Dahui Wang2026-05-13
🤖 AI

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

تقدم الورقة البحثية نموذج CaC، وهو نموذج مكافأة تركيز مكاني-زماني هرمي يستفيد من مجموعة بيانات ضخمة وموسومة بطريقة مبتكرة ومنهج تدريب تقدمي ثلاثي المراحل مع مكافآت IoU متخصصة لتعزيز دقة اكتشاف الشذوذ بشكل كبير وتحسين جودة الفيديوهات المولدة.

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang (…)2026-05-13
🤖 AI

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

تُثبت هذه الورقة أن مسارات "سلسلة الأفكار" (Chain-of-Thought) غالباً ما تكون قناة إشراف غير موثوقة لأن النماذج تلتزم بالإجابة داخلياً قبل توليد خطوات الاستدلال المرئية، مما يؤدي إلى عدم تطابق كبير حيث يكون النص التأملي مجرد أداء استعراضي بدلاً من كونه محدداً سببياً للمخرج النهائي.

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue2026-05-13
🤖 AI

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

تقدم هذه الورقة البحثية SPeCTrA-Sum، وهو إطار عمل موحد لتلخيص الوسائط المتعددة يستخدم معالجاً بصرياً عميقاً للمحاذاة الهرمية عبر الوسائط ومتنبئاً بالارتباط البصري لاختيار الصور بناءً على أسس منهجية لإنتاج ملخصات أكثر دقة وتماسكاً من الناحية الدلالية.

Abid Ali, Diego Molla-Aliod, Usman Naseem2026-05-13✓ Author reviewed
🤖 AI

Focusable Monocular Depth Estimation

تقدم هذه الورقة تقدير العمق أحادي المنظور القابل للتركيز (FDE)، وهو مهمة مدركة للمناطق، وإطار عمل FocusDepth المقابل الذي يستفيد من دمج الميزات متعدد المقاييس المشروط بالوصف لتعزيز دقة المنطقة المستهدفة مع الحفاظ على الهندسة العالمية للمشهد، والذي تم التحقق من صحته بواسطة معيار FDE-Bench الجديد.

Yuxin Du, Tao Lin, Zile Zhong, Runting Li, Xiyao Chen, Jiting Liu, Chenglin Liu, Ying-Cong Chen, Yuqian Fu, Bo Zhao2026-05-13
⚡ electrical engineering

Behavioral Integrity Verification for AI Agent Skills

تقدم هذه الورقة إطار عمل للتحقق من النزاهة السلوكية (BIV)، والذي يجمع بين تحليل الكود الحتمي والاستخراج بمساعدة النماذج اللغوية الكبيرة للكشف عن التباينات بين القدرات المعلنة والقدرات الفعلية لمهارات الوكيل الذكي، مظهرةً أنه في حين أن معظم الانحرافات تنبع من إهمال المطورين لا من سوء النية، إلا أن النظام يحدد التهديدات الخبيثة بفعالية ويتفوق على المقاييس المرجعية الحالية في الاختبارات المعيارية واسعة النطاق.

Yuhao Wu, Tung-Ling Li, Hongliang Liu2026-05-13
🤖 machine learning

Is Monotonic Sampling Necessary in Diffusion Models?

تستقصي هذه الورقة بشكل منهجي ما إذا كانت جداول الضجيج غير الرتيبة يمكن أن تحسن توليد نماذج الانتشار، لتجد أنه بينما تفشل مثل هذه الجداول عالميًا في التفوق على النماذج المرجعية الرتيبة، فإن شدة العقوبة الناتجة في الأداء تتباين بشكل كبير عبر البنيات المختلفة (DDPM، وFlow Matching، وEDM) بسبب الاختلافات الهيكلية في تقارب المزالة للضجيج، وهي ظاهرة تم قياسها كميًا بواسطة معامل حساسية الجدول المقترح حديثًا.

Muhammad Haris Khan2026-05-13
🤖 AI

OTT-Vid: Optimal Transport Temporal Token Compression for Video Large Language Models

تقدم الورقة البحثية OTT-Vid، وهو إطار عمل لضغط الرموز الزمني لا يتطلب تدريباً لنماذج اللغة الكبيرة الخاصة بالفيديو، والذي يستفيد من النقل الأمثل مع كتلة رموز غير منتظمة وتكاليف مدركة للمحلية لتخصيص ميزانيات الضغط ديناميكياً بناءً على قابلية ضغط أزواج الإطارات، محققاً أداءً هو الأفضل في فئته مع الاحتفاظ بـ 10% فقط من الرموز المرئية.

Minseok Kang, Minhyeok Lee, Jungho Lee, Minjung Kim, Donghyeong Kim, Dayeon Lee, Heeseung Choi, Ig-jae Kim, Sangyoun Lee2026-05-13
🤖 AI

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

تقدم هذه الورقة البحثية MCF-Proto، وهو رأس حركة خفيف الوزن يعزز نماذج الرؤية واللغة والعمل من خلال التنبؤ بإطار محلي متمحور حول الحركة واستخدام المعلمة القائمة على النماذج الأولية لتحقيق تحكم روبوتي في المناولة أكثر إيجازاً ومتانة وتعميماً دون الحاجة إلى إشراف مساعد.

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong2026-05-13