🤖 AI

Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning

تقدم هذه الورقة البحثية "التفكير كفء الميزانية" (BET)، وهو إطار عمل ثنائي المراحل يعمل على تحسين حسابات وقت الاختبار لنماذج الاستدلال الكبيرة من خلال تعلم تخصيص الميزانيات ديناميكيًا بناءً على العوائد المتوقعة بدلاً من الصعوبة المتصورة، مما يحقق تقليلاً كبيراً في عدد الرموز (tokens) مع تحسين الأداء من خلال سلوكيات "الحل القصير"، و"الطي اللطيف"، و"نداء البطل" التكيفية.

Zhaomeng Zhou, Lan Zhang, Junyang Wang, Mu Yuan, Junda Lin2026-05-13
🤖 AI

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

يُعد Seirênes إطار عمل للتعلم التعزيزي القائم على اللعب الذاتي التنافسي، والذي يعزز متانة الاستنتاج في النماذج اللغوية الكبيرة عبر تدريب نموذج واحد على توليد سياقات مشتتة وحل المشكلات ضمنها في آن واحد، مما يحول التداخل السياقي إلى منهج تعليمي تطوري مشترك يعمل على تحسين الأداء عبر مختلف المعايير المرجعية وكشف نقاط الضعف في النماذج الأخرى.

Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang2026-05-13
💬 NLP

Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation

تقدم هذه الورقة إطار عمل جديد لتقطير النماذج اللغوية البصرية (VLM) يسمى "Hide to See" يعزز قدرات الاستدلال متعدد الوسائط للنماذج الطلابية المدمجة من خلال توظيف قناع بادئة الاستدلال البارزة والجدولة ذاتية الخطوات لإجبار النموذج على الاعتماد على الأدلة البصرية أثناء عملية التفكير، مما يؤدي إلى التفوق على أساليب التقطير والتقطير الذاتي الحالية.

Seonghoon Yu, Dongjun Nam, Byung-Kwan Lee, Jeany Son2026-05-13
🤖 AI

Every Bit, Everywhere, All at Once: A Binomial Multibit LLM Watermark

تقدم هذه الورقة البحثية مخططاً جديداً لعلامة مائية ثنائية الحدين متعددة البتات للنماذج اللغوية الكبيرة (LLM) تقوم بتشفير كل بت من الحمولة عند كل موضع للرمز باستخدام مشفر ذي حالة لتحديد أولوية البتات غير المشفرة بشكل ديناميكي، مما يحقق دقة ومتانة فائقتين مقارنة بالنماذج المرجعية الحالية مع اقتراح مقياس أكثر عملية لتسجيل الثقة لكل بت من أجل التقييم.

Thibaud Gloaguen, Robin Staab, Mark Vero, Martin Vechev2026-05-13
🤖 AI

Weather-Robust Cross-View Geo-Localization via Prototype-Based Semantic Part Discovery

تقدم الورقة البحثية SkyPart، وهو نموذج أولي خفيف الوزن لاكتشاف الأجزاء الدلالية يعتمد على النماذج الأولية (prototype-based) لشبكات المحولات الرؤيوية (vision transformers)، والذي يحقق أفضل النتائج الحالية في تحديد المواقع الجغرافية عبر الرؤى المختلفة والمتينة تجاه الظروف الجوية من خلال الفصل الصريح بين التخطيط والنسيج، وتهميش تباينات الارتفاع، واستخدام تدريب متعدد الأهداف بوزن عدم اليقين.

Chi-Nguyen Tran, Dao Sy Duy Minh, Huynh Trung Kiet, Nguyen Lam Phu Quy, Phu-Hoa Pham, Long Tran-Thanh2026-05-13
🤖 machine learning

Evolutionary Task Discovery: Advancing Reasoning Frontiers via Skill Composition and Complexity Scaling

تقترح الورقة البحثية "اكتشاف المهام التطوري" (EvoTD)، وهو إطار عمل يعزز استدلال النماذج اللغوية الكبيرة من خلال معاملة تركيب البيانات كبحث موجه عبر سمات تكوين المهارات والتعقيد، باستخدام مؤثرات تطورية مهيكلة ومرشح صعوبة ديناميكي للتغلب على تجانس البيانات وتحقيق تعميم قوي.

Liqin Ye, Yanbin Yin, Michael Galarnyk, Yuzhao Heng, Sudheer Chava, Chao Zhang2026-05-13
🤖 AI

Cochise: A Reference Harness for Autonomous Penetration Testing

تقدم هذه الورقة Cochise، وهو إطار مرجعي بلغة بايثون يتكون من 597 سطرًا فقط، يطبق بنية "المخطط-المنفذ" (Planner-Executor) المنفصلة لاختبار الاختراق المستقل، مما يمكّن الباحثين من تقييم الوكلاء الموجهين بالنماذج اللغوية الكبيرة (LLMs) ضد بيئة اختبار "لعبة النشاط في الدليل النشط" (GOAD)، مع توفير أدوات مفتوحة المصدر لإعادة التشغيل، والتحليل، ومشاركة بيانات المسار.

Andreas Happe, Jürgen Cito2026-05-13
🤖 AI

A CAP-like Trilemma for Large Language Models: Correctness, Non-bias, and Utility under Semantic Underdetermination

مستوحاةً من نظرية CAP، تقترح هذه الورقة معضلة ثلاثية للنماذج اللغوية الكبيرة تؤكد أنه في ظل عدم التحديد الدلالي، يستحيل ضمان الصحة القوية، وعدم التحيز الصارم، والمنفعة العالية في آن واحد، حيث يتطلب تحقيق الحسم إدخال تفضيلات غير مدعومة تخل بالحياد أو الصحة.

Vinu Ellampallil Venugopal2026-05-13
🤖 machine learning

Shaping Zero-Shot Coordination via State Blocking

تقدم هذه الورقة البحثية "التنسيق المحظور للحالة" (SBC)، وهو إطار عمل يعزز التنسيق صفري الاستباق (zero-shot coordination) من خلال توليد بيئات افتراضية متنوعة عبر حظر الحالة، مما يمكّن الوكلاء من التعميم بفعالية على الشركاء غير المرئيين، بما في ذلك البشر، دون تعديل البيئة الأساسية.

Mingu Kang, Sunwoo Lee, Yonghyeon Jo, Seungyul Han2026-05-13
🤖 AI

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

تقدم هذه الورقة البحثية MM-Eval، وهو إطار عمل موحد يقيم الملخصات متعددة الوسائط بشكل شامل من خلال دمج جودة النص الواقعي، والمواءمة بين الصورة والنص، والتنوع البصري في مقياس واحد قابل للتفسير ومعاير وفقاً لتفضيلات البشر، مما يعالج أوجه القصور في طرق التقييم أحادية الوسائط المجزأة.

Abid Ali, Diego Molla-Aliod, Usman Naseem2026-05-13