💬 NLP

As X, Do Y: How Persona and Task Combine in Instruction-Tuned LLMs

بينما تُظهر هذه الورقة أن تعليمات الشخصية والمهمة في النماذج اللغوية الكبيرة المضبوطة بالتعليمات تُظهر تفكيكاً خطياً جمعياً واضحاً عند الانتقال من المطالبة إلى الإجابة في المجرى المتبقي، إلا أنها تثبت في النهاية أن هذه الجمعية المحلية لا تُمكّن من ضغط مطالبات الدور في متجه واحد مخزن مؤقتاً لأن التوليد المشروط بالشخصية يعتمد على آلية انتباه موزعة لا يمكن محاكاتها عن طريق الاستبدال المحلي للمجرى المتبقي.

Eric Xu2026-05-25
💰 quantitative finance

Generative AI and the Reorganization of Labor Demand

باستخدام قاعدة بيانات وطنية لإعلانات الوظائف في الولايات المتحدة ومسار عمل مبتكر لنماذج لغوية كبيرة، تجد هذه الورقة أن الشركات تتكيف مع الذكاء الاصطناعي التوليدي من خلال عملية ديناميكية من إعادة التشكيل التنظيمي، وذلك أساساً عبر إعادة تخصيص الطلب على العمالة عبر الوظائف (52%) وثانوياً من خلال إعادة تصميم المهام داخل الوظائف (39.5%)، مع تباين أنماط التعديل بشكل كبير حسب مستوى الأقدمية.

Fangyan Wang, Zaiyan Wei, Yang Wang2026-05-25
💬 NLP

Autonomous Frontier-Based Exploration with VLM Guidance

تقدم هذه الورقة مسار استكشاف ذاتي خفيف الوزن وخالٍ من التدريب، يستفيد من النماذج اللغوية الرؤيوية للقيام باتخاذ قرارات استراتيجية عالية المستوى من خلال تحليل المطالبات متعددة الوسائط للخرائط والصور المرئية، مما يؤدي إلى تحسين تغطية الخرائط بنسبة تصل إلى 24% مقارنة بالطرق الهندسية الاستدلالية الحالية في البيئات غير المعروفة.

Aarush Aitha, Avideh Zakhor2026-05-25
🤖 AI

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

تقدم هذه الورقة البحثية PoisonForge، وهو معيار مرجعي يوضح أن تسميم البيانات على مستوى المهام باستخدام 1% فقط من الأمثلة المصممة يمكن أن ينجح في إجبار النماذج اللغوية الكبيرة المضبوطة بالتعليمات على تضمين كيانات محددة من قبل المهاجم في مخرجات المهام المستهدفة مع الحفاظ على الأداء الطبيعي في مجالات أخرى، مما يكشف أن خيارات تصميم التسميم وليس حجم النموذج هي المحركات الأساسية لنجاح الهجوم.

Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea2026-05-25
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

تكشف هذه الورقة عن فجوة حرجة في معايير تقييم الاستدلال في السياقات الطويلة من خلال إثبات أن التقييمات السائدة تفشل في ضبط موضع المهمة، مما يؤدي إلى انخفاض كبير في الأداء عندما توضع المهام في منتصف السياقات الطويلة بسبب تداخل الحشو، وتقترح إطار عمل تقييم تعفن السياق (CRE) لمعالجة هذه النقطة العمياء الهيكلية.

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang2026-05-25
🤖 AI

Lipschitz Optimization for Formal Verification of Homographies

تقدم هذه الورقة إطار عمل للتحقق الرسمي يستنتج حدوداً خطية محكمة لقيم البكسل تحت اضطرابات حركة الكاميرا ثلاثية الأبعاد من خلال الاستفادة من تحسين ليبشيتز والاستمرارية الجزئية للتحويلات الهوموجرافية، مما يتيح أول ضمانات متينة وصارمة لمتانة الشبكات الرؤيوية في المشاهد المستوية دون الاعتماد على عمليات محاكاة معقدة أو نماذج بديلة.

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio2026-05-25
🤖 AI

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

تقدم هذه الورقة GENSTRAT، وهو إطار عمل يستخدم بيئات استراتيجية مُولدة إجرائياً وملف تعريف قدرات متعدد المحاور لتقييم التفكير الاستراتيجي للنماذج اللغوية الكبيرة، مما يكشف أن النماذج ذات الأداء العام المتشابه يمكن أن تُظهر نقاط قوة متميزة وتقلبات سلوكية غير متوقعة في سيناريوهات محددة ذات صلة بالنشر.

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala2026-05-25
🤖 AI

Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks

تُظهر هذه الورقة أنه في حين تعاني النماذج اللغوية الكبيرة الرائدة من معدلات مرتفعة من الإيجابيات الكاذبة وانخفاض في تغطية الثغرات في مهام الأمن السيبراني، فإن النماذج المتخصصة في المجال التي توظف منهجيات اختبار هيكلية تحقق دقة فائقة، مما يشير إلى أن النماذج التأسيسية العمودية المبنية على بيانات متخصصة وسلاسل هجوم هيكلية تُعد ضرورية للتطبيقات الأمنية الفعالة.

Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri2026-05-25
🤖 machine learning

Enhancing Deep Neural Network Reliability with Refinement and Calibration

تقترح هذه الورقة إطار عمل RefCal، وهو إطار تدريب موحد يقدم خسارة تباين تحت إشراف مبتكرة لتحسين الدقة والمعايرة والتهذيب بشكل مشترك، مما يتغلب على المقايضة الشائعة حيث تعمل الطرق الحالية على تحسين المعايرة على حساب قدرة النموذج على التمييز بين التنبؤات الصحيحة والخاطئة.

Ramya Hebbalaguppe, Ajay Shastry, Soumya Suvra Ghosal, Chetan Arora2026-05-25
🤖 machine learning

Multi-Gate Residuals

تقترح الورقة البحثية بنية "البواقي متعددة البوابات" (MGR)، وهي بنية مبتكرة تعمل على تثبيت مقاييس التنشيط في الشبكات المتبقية العميقة باستخدام آلية تسجيل وبوابة مع تجميع الانتباه، مما يحقق تحسينات في الأداء دون عبء الاتصال المرتبط ببواقي الانتباه.

Zhizhan Zheng, Feiyun Zhang, Shuchun Liu, Tian Xia, Xi Liu, Dasheng Hu, Hongquan Zhou2026-05-25