🤖 AI

Adaptive Teacher Exposure for Self-Distillation in LLM Reasoning

تقدم هذه الورقة البحثية طريقة "التعرض التكيفي للمعلم في التقطير الذاتي" (ATESD)، وهي طريقة مبتكرة تتعلم ديناميكياً التحكم في مقدار الاستدلال المتميز الذي يكشفه النموذج المعلم للنموذج الطالب أثناء التدريب داخل السياسة، مما يؤدي إلى حل مشكلة عدم تطابق التعرض والتفوق بشكل كبير على النماذج المرجعية الحالية للتقطير الذاتي والتعلم المعزز في اختبارات معايير الاستدلال الرياضي الصعبة.

Zihao Han, Tiangang Zhang, Huaibin Wang, Yilun Sun2026-05-13
🤖 AI

Overcoming Dynamics-Blindness: Training-Free Pace-and-Path Correction for VLA Models

تقدم هذه الورقة "تصحيح السرعة والمسار" (Pace-and-Path Correction)، وهو عامل تشغيلي وقت الاستدلال، مغلق الصيغة، ولا يتطلب تدريباً، يعالج عمى الديناميكيات الزمنية في نماذج الرؤية واللغة والعمل (Vision-Language-Action models) عبر تفكيك تعديلات الحركة إلى قناتي السرعة والمسار، مما يحسن معدلات النجاح بشكل كبير في البيئات الديناميكية دون الحاجة إلى إعادة التدريب.

Yanyan Zhang, Chaoda Song, Vikash Singh, Xinpeng Li, Kai Ye, Zhe Hu, Zhongzhu Pu, Yu Yin, Vipin Chaudhary2026-05-13
🤖 AI

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

تقدم الورقة البحثية SpatialForge، وهو خط معالجة لتخليق البيانات قابل للتوسع يحول صور العالم المفتوح ثنائية الأبعاد إلى مجموعة بيانات مكونة من 10 ملايين زوج لتعزيز وتطوير قدرات الاستدلال المكاني المدركة للثلاثي الأبعاد في النماذج اللغوية البصرية الكبيرة بشكل فعال وكبير.

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu2026-05-13
🤖 machine learning

Drop the Act: Probe-Filtered RL for Faithful Chain-of-Thought Reasoning

تقدم هذه الورقة ProFIL، وهي طريقة تعلّم تعزيزي تعتمد على المسبار المفلتر (probe-filtered)، تقوم بتدريب مسبار انتباه خفيف الوزن على نموذج مجمد للكشف عن "مسرحية الاستنتاج" (reasoning theater) التي تلي الالتزام ومعاقبتها أثناء تدريب GRPO، مما يؤدي إلى تقليل طول السلسلة بشكل كبير وزيادة صدقية الاستنتاج دون المساس بدقة المهمة.

Swapnil Parekh2026-05-13
🤖 AI

FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression

تقدم الورقة البحثية FibQuant، وهي طريقة تكميم متجه عالمية تستبدل برامج الترميز القياسية بكتيب رموز شعاعي-زاوي مشترك مصمم خصيصاً لتوزيع (spherical-Beta) لمتجهات الـ KV-cache المدوّرة، مما يحقق نسب ضغط أعلى بكثير مع حد أدنى من التدهور في الارتياب مقارنة بالأسالب القياسية الحالية.

Namyoon Lee, Yongjune Kim2026-05-13
🤖 AI

Offline Policy Evaluation for Manipulation Policies via Discounted Liveness Formulation

تقترح هذه الورقة إطار عمل جديد لتقييم السياسة غير المتصلة (offline policy evaluation) للمناولة الروبوتية، والذي يستخدم مؤثر بلمان القائم على الحيوية المخصومة (discounted liveness-based Bellman operator) للتعامل بفعالية مع المكافآت الشحيحة، والتقدم غير الرتيب للمهام، وتحيز قطع الأفق المحدود، مما يؤدي إلى التفوق على الطرق الكلاسيكية في عكس تقدم المهمة بدقة.

Hao Wang, Joshua Bowden, Colton Crosby, Somil Bansal2026-05-13
🤖 AI

Engagement Process: Rethinking the Temporal Interface of Action and Observation

تقدم هذه الورقة "عملية الانخراط" (EP)، وهي صياغة تفاعلية جديدة تفصل الأفعال والملاحظات إلى تدفقات أحداث مستمرة لنمذجة الديناميكيات الزمنية المعقدة صراحةً، مثل زمن تأخير التداول والتغذية الراجعة المتأخرة، مما يتغلب بذلك على قيود الواجهات ذات الخطوات الثابتة التقليدية في كل من سيناريوهات الوكيل المنفرد والأنظمة المتعددة.

Jialian Li, Yuchen Cao, Junhong Liu, Weiran Guo, Xutao Wang, Jiaming Song, Jiahao Zhang, Jie Chen2026-05-13
🤖 AI

The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested

تقدم هذه الورقة مفهوم "التفاوت التقييمي" لمعالجة مشكلة الصلاحية الناتجة عن إدراك نماذج الذكاء الاصطناعي لسلوكها وتغييره أثناء الاختبار، مقترحةً بروتوكول TRACE لضمان أن تكون ادعاءات السلامة مشروطة صراحةً بسياق تقييم محدد بدلاً من افتراض الأداء القابل للتعميم.

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka, Ivan Flechais2026-05-13
🤖 AI

Decaf: Improving Neural Decompilation with Automatic Feedback and Search

تقدم الورقة البحثية نظام Decaf، الذي يستفيد من التغذية الراجعة للمترجم والبحث لتحسين الصحة الدلالية لمخرجات إلغاء التجميع العصبية بشكل كبير، مما يرفع معدل النجاح في مجموعة Real -O2 من 26.0% إلى 83.9% دون المساس بالتشابه مع الكود المصدري الأصلي.

Alexander Shypula, Osbert Bastani, Edward Schwartz2026-05-13
🤖 AI

Selective Off-Policy Reference Tuning with Plan Guidance

تقدم الورقة البحثية طريقة "الضبط المرجعي الانتقائي خارج السياسة" (SORT)، وهي طريقة تستفيد من توجيه المخطط لاستخلاص تحديثات الإصلاح من الحلول المرجعية، مما يحول عمليات التدفق الفاشلة إلى إشارات تعلم مدركة للبنية تعمل على تحسين أداء الاستدلال بشكل كبير، لا سيما في النماذج الأضعف، مقارنة بنهج GRPO القياسي.

Duc Anh Le, Tien-Phat Nguyen, Thien Huu Nguyen, Linh Ngo Van, Trung Le2026-05-13