💬 NLP

Autonomous Frontier-Based Exploration with VLM Guidance

تقدم هذه الورقة مسار استكشاف ذاتي خفيف الوزن وخالٍ من التدريب، يستفيد من النماذج اللغوية الرؤيوية للقيام باتخاذ قرارات استراتيجية عالية المستوى من خلال تحليل المطالبات متعددة الوسائط للخرائط والصور المرئية، مما يؤدي إلى تحسين تغطية الخرائط بنسبة تصل إلى 24% مقارنة بالطرق الهندسية الاستدلالية الحالية في البيئات غير المعروفة.

Aarush Aitha, Avideh Zakhor2026-05-25
🤖 AI

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

تقدم هذه الورقة البحثية PoisonForge، وهو معيار مرجعي يوضح أن تسميم البيانات على مستوى المهام باستخدام 1% فقط من الأمثلة المصممة يمكن أن ينجح في إجبار النماذج اللغوية الكبيرة المضبوطة بالتعليمات على تضمين كيانات محددة من قبل المهاجم في مخرجات المهام المستهدفة مع الحفاظ على الأداء الطبيعي في مجالات أخرى، مما يكشف أن خيارات تصميم التسميم وليس حجم النموذج هي المحركات الأساسية لنجاح الهجوم.

Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea2026-05-25
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

تكشف هذه الورقة عن فجوة حرجة في معايير تقييم الاستدلال في السياقات الطويلة من خلال إثبات أن التقييمات السائدة تفشل في ضبط موضع المهمة، مما يؤدي إلى انخفاض كبير في الأداء عندما توضع المهام في منتصف السياقات الطويلة بسبب تداخل الحشو، وتقترح إطار عمل تقييم تعفن السياق (CRE) لمعالجة هذه النقطة العمياء الهيكلية.

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang2026-05-25
🤖 AI

Lipschitz Optimization for Formal Verification of Homographies

تقدم هذه الورقة إطار عمل للتحقق الرسمي يستنتج حدوداً خطية محكمة لقيم البكسل تحت اضطرابات حركة الكاميرا ثلاثية الأبعاد من خلال الاستفادة من تحسين ليبشيتز والاستمرارية الجزئية للتحويلات الهوموجرافية، مما يتيح أول ضمانات متينة وصارمة لمتانة الشبكات الرؤيوية في المشاهد المستوية دون الاعتماد على عمليات محاكاة معقدة أو نماذج بديلة.

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio2026-05-25
🤖 AI

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

تقدم هذه الورقة GENSTRAT، وهو إطار عمل يستخدم بيئات استراتيجية مُولدة إجرائياً وملف تعريف قدرات متعدد المحاور لتقييم التفكير الاستراتيجي للنماذج اللغوية الكبيرة، مما يكشف أن النماذج ذات الأداء العام المتشابه يمكن أن تُظهر نقاط قوة متميزة وتقلبات سلوكية غير متوقعة في سيناريوهات محددة ذات صلة بالنشر.

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala2026-05-25
🤖 AI

Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks

تُظهر هذه الورقة أنه في حين تعاني النماذج اللغوية الكبيرة الرائدة من معدلات مرتفعة من الإيجابيات الكاذبة وانخفاض في تغطية الثغرات في مهام الأمن السيبراني، فإن النماذج المتخصصة في المجال التي توظف منهجيات اختبار هيكلية تحقق دقة فائقة، مما يشير إلى أن النماذج التأسيسية العمودية المبنية على بيانات متخصصة وسلاسل هجوم هيكلية تُعد ضرورية للتطبيقات الأمنية الفعالة.

Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri2026-05-25
🤖 machine learning

Enhancing Deep Neural Network Reliability with Refinement and Calibration

تقترح هذه الورقة إطار عمل RefCal، وهو إطار تدريب موحد يقدم خسارة تباين تحت إشراف مبتكرة لتحسين الدقة والمعايرة والتهذيب بشكل مشترك، مما يتغلب على المقايضة الشائعة حيث تعمل الطرق الحالية على تحسين المعايرة على حساب قدرة النموذج على التمييز بين التنبؤات الصحيحة والخاطئة.

Ramya Hebbalaguppe, Ajay Shastry, Soumya Suvra Ghosal, Chetan Arora2026-05-25
🤖 machine learning

Multi-Gate Residuals

تقترح الورقة البحثية بنية "البواقي متعددة البوابات" (MGR)، وهي بنية مبتكرة تعمل على تثبيت مقاييس التنشيط في الشبكات المتبقية العميقة باستخدام آلية تسجيل وبوابة مع تجميع الانتباه، مما يحقق تحسينات في الأداء دون عبء الاتصال المرتبط ببواقي الانتباه.

Zhizhan Zheng, Feiyun Zhang, Shuchun Liu, Tian Xia, Xi Liu, Dasheng Hu, Hongquan Zhou2026-05-25
🤖 AI

Design and Report Benchmarks for Knowledge Work

تقترح هذه الورقة إطار عمل مكوناً من ثلاث خطوات لتصميم وإعداد تقارير معايير قياس أعمال المعرفة، والتي توائم صراحةً بين المهام المُقيمة، وبيئات الاختبار، ومعايير التقييم وبين أنشطة العمل في العالم الحقيقي لضمان أن تعكس درجات معايير القياس بشكل موثوق قدرة النظام في سيناريوهات النشر الفعلية.

Yining Hua, Hongbin Na, Cyrus Ayubcha, Levi Lian2026-05-25
🤖 machine learning

When Good Equations Get Bad Scores: Improving Symbolic Regression Through Better Parameter Optimization

تقدم هذه الورقة البحثية SAGE-Fit، وهو إطار عمل جاهز للاستخدام (plug-and-play) يستفيد من الأولويات الهيكلية والدلالية للتعبيرات الرمزية للتغلب على معضلة "البنية الجيدة، والدرجة السيئة" في الانحدار الرمزي، مما يحسن بشكل كبير من تحسين المعلمات وأداء البحث الإجمالي.

Boxiao Wang, Kai Li, Zhiwei Chen, Yang Huang, Runxiang Wang, Ziwen Zhang, Yifan Zhang, Jian Cheng2026-05-25