AnyUp: Universal Feature Upsampling
تقدم AnyUp طريقة عالمية لرفع دقة الميزات أثناء الاستدلال، تتعمم عبر أنواع ميزات الرؤية المتنوعة دون الحاجة إلى إعادة التدريب، مما يضع معياراً جديداً فائقاً في جودة رفع الدقة مع الحفاظ على السلامة الدلالية.
13135 ورقة بحثية
تقدم AnyUp طريقة عالمية لرفع دقة الميزات أثناء الاستدلال، تتعمم عبر أنواع ميزات الرؤية المتنوعة دون الحاجة إلى إعادة التدريب، مما يضع معياراً جديداً فائقاً في جودة رفع الدقة مع الحفاظ على السلامة الدلالية.
تقدم هذه الورقة البحثية طريقة "إزالة سياق المشهد" (SDeC)، وهي طريقة مبتكرة وخالية من التدريب، تعمل على التخفيف من حدة انزياح الهوية في توليد الصور من النصوص عبر كبح الارتباطات بين سياق المشهد الكامن وتضمينات الأوامر النصية بشكل تكيفي، مما يتيح الحفاظ المستمر على الموضوع عبر مشاهد متنوعة دون الحاجة إلى معرفة مسبقة بالبيئات المستهدفة.
يُعدُّ PRISMM-Bench أول معيار مرجعي يستند إلى التناقضات الحقيقية التي رصدها مراجعون أقران في النصوص والأشكال والجداول والمعادلات عبر الأوراق العلمية، وهو مصمم لتقييم وكشف القصور الكبير في النماذج اللغوية الكبيرة متعددة الوسائط الحالية في اكتشاف الأخطاء العلمية متعددة الوسائط وتصحيحها والاستنتاج بشأنها بشكل صارم.
تقترح هذه الورقة البحثية "التحسين الدلالي من الأعلى إلى الأسفل" (TDSR)، وهو إطار عمل جاهز للاستخدام يعيد تعريف وصف الصور كمسألة تخطيط هرمي تُحل عبر خوارزمية بحث مونت كارلو في شجرة موجهة بصرياً وفعالة، وذلك لتعزيز التماسك العالمي، ودقة التفاصيل، وكبح الهلوسة بشكل كبير في النماذج اللغوية البصرية الكبيرة الحالية.
تقترح هذه الورقة نموذج نمذجة تأثير الفعل (AEM)، وهو إطار عمل موحد يحسن الكشف عن الأخطاء الإجرائية من خلال التحليل المشترك لتنفيذ الفعل والنتائج الناجمة عنه عبر التأسيس البصري ورسوم المشاهد البيانية الرمزية، محققاً أداءً هو الأفضل في فئته على معايسات اختبارية صعبة.
يقدم البحث إطار عمل "SlimEdge"، الذي يجمع بين تقليم النماذج المهيكل والتحسين متعدد الأهداف لتمكين النشر القوي، والمدرك للأداء، والمقاوم للفشل للشبكات العصبية العميقة الموزعة على أجهزة الحافة محدودة الموارد، محققاً تسريعاً كبيراً في عملية الاستنتاج مع الحفاظ على الدقة في ظل حالات فشل الأجهزة.
يُعد Q-Hawkeye إطار عمل موثوقاً لتحسين السياسة البصرية القائم على التعلم المعزز لتقييم جودة الصور، حيث يعمل على تعزيز استقرار التنبؤ والتأصيل الإدراكي من خلال توظيف إعادة التوزين الديناميكي المدرك لعدم اليقين وفقد الإدراك الضمني لمعالجة أوجه القصور في طرق GRPO الحالية.
تقترح هذه الورقة إطار عمل هجين للتسجيل يتكون من مرحلتين يجمع بين مطابقة المقطع العرضي الأمثل للمحاذاة العالمية المقيدة وشبكة تعلم عميق خفيفة الوزن لتنقيح التشوه المحلي المتبقي، مما يتيح إعادة بناء ثلاثية الأبعاد قوية ودقيقة لتشريح الكلى من المقاطع العيانية رغم ندرة البيانات والتشوه العالي.
يُعد OmniVideo-R1 إطار عمل تعزيزي مبتكر يعزز الاستدلال السمعي البصري في نماذج الفيديو الشاملة عبر توظيف التأسيس كثيف الاستعلام والدمج المنتبه للنماط، محققاً أداءً فائقاً وتعميماً قوياً عبر معايير قياسية متعددة.
يُعد VLA-JEPA إطار عمل جديد للتدريب المسبق يعزز نماذج الرؤية واللغة والعمل من خلال توظيف آلية تنبؤ بالحالة الكامنة خالية من التسرب لتعلم تجريدات ديناميكية قوية، مما يتغلب على انحياز المظهر والحركة غير المرغوب فيها لتحقيق تعميم ومتانة فائقين في مهام المعالجة في كل من البيئات المحاكية والواقعية.