💻 computer science

Behavioral Reprogramming of Open-Weights Models: Cognitive Plasticity and Alignment Bounds

تثبت هذه الورقة تجريبياً أن النماذج اللغوية الكبيرة ذات الأوزان المفتوحة يمكن إعادة برمجة سلوكها من مساعدين سلبيين إلى وكلاء سقراطيين مبادرين من خلال الضبط الدقيق كفء الحوسبة، مع تحديد حدود المعلمات الفائقة المثلى (رتبة LoRA 16، و2-3 حقب تدريبية) والتحقق من انتقال الشخصية القوي عبر اللغات باستخدام تحسين التفضيل المباشر.

Lucia Malíčková2026-08-14
💻 computer science

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

إن SPADE هو إطار عمل استدلال موزع يدمج فك التشفير التخميني عبر بيئات الحافة والسحابة، مستخدماً نموذج مسودة مدمجاً عند الحافة لتوليد الرموز (tokens) ومحقِّقاً سحابياً للتحقق منها بالتوازي، مما يقلل من استدعاءات النموذج السحابي بنسبة 76% ويخفض التكاليف مع الحفاظ على دقة النماذج اللغوية الكبيرة دون الحاجة لإعادة التدريب.

Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal2026-08-14
💻 computer science

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

تُعد SkillEvo إطار عمل يُمكّن من التطور المستدام لمهارات الوكيل عبر تحويل محاكاة المستخدم متعددة الأدوار إلى مولدات تغذية راجعة مستمرة للتحسينات المستهدفة، وإدخال طبقة حوكمة نشطة لإصلاح التدهور الهيكلي، مما يؤدي إلى التفوق على النهج الحالية القائمة على الدور الواحد أو التأمل الذاتي.

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu2026-08-14
💻 computer science

LigBench: A Unified and Human-Aligned Benchmark for LLM-based Research Idea Generation

تقدم هذه الورقة LigBench، وهو معيار مرجعي مؤتمت موحد ومتوافق مع المعايير البشرية لتقييم الأفكار البحثية التي تولدها النماذج اللغوية الكبيرة، إلى جانب مجموعة بيانات PAIR-IQ لتدريب نماذج الحكم الثنائي، للتغلب على التجزئة والذاتية في طرق التقييم الحالية.

Chenrun Wang, Mingxuan Zhu, Tiancheng Huang, Wenjie Li, Yujie Zhang, Zichen Zhu, Zhiying Zou, Kai Yu, Lu Chen2026-08-14
🤖 machine learning

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

تقدم هذه الورقة TRAPSBench ومقياس PECS لتوضيح أنه بينما تمتلك النماذج اللغوية البصرية القدرة الداخلية على اكتشاف متى تكون الأدلة المرئية غير كافية لاتخاذ قرار، إلا أنها تفشل باستمرار في التعبير عن هذا الكبح المعرفي، مما يكشف عن وجود عنق زجاجة حرج في توليد مخرجاتها بدلاً من إدراكها.

Fnu Pramono, John Cai, Sourabh Kulkarni2026-08-14
💻 computer science

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

تقدم هذه الورقة البحثية TsuGO، وهو معيار مرجعي جديد يستخدم مسائل "الحياة والموت" في لعبة "غو" (Go) لتقييم قدرات الاستنتاج لدى النماذج اللغوية الكبيرة من خلال قياس كفاءة البحث وتخصيص الموارد، مما يكشف أن النماذج الحالية غالبًا ما تعتمد على أنماط بحث غير موجهة بدلاً من التخطيط الاستراتيجي الفعال رغم سلاسل الأفكار الأطول.

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo2026-08-14
🤖 machine learning

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

تقترح هذه الورقة إطار عمل "حزمة القدرات" (capability sheaf) لتشخيص وإصلاح أطر عمل الوكلاء (agent harnesses) باستخدام الأساليب الكوهمولوجية، مظهرةً أنه في حين ينجح هذا النهج في ضمان الثبات تجاه ممثلي الحالة القديمة في التجارب المنضبطة، فإنه يفشل في تقديم ميزة ذات دلالة إحصائية مقارنة بالنماذج المرجعية غير الكوهمولوجية في اختبار جهد واقعي من نوع SWE-bench.

Saveliy Batruin2026-08-14
💻 computer science

Self-Referential Induction Increases Response Instability Relative to Unresolvable and Verifiable Questions in Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُبدي عدم استقرار في الاستجابة أعلى بكثير عند توليد تقارير ذاتية مرجعية للذات مقارنة بالأسئلة الفلسفية غير القابلة للحل أو الاستفسارات الواقعية القابلة للتحقق، مما يشير إلى أن التجارب الذاتية المستحثة تشغل منطقة متميزة وأقل استقراراً في توزيع مخرجات النموذج.

Paras Balani, Subhrakanta Panda2026-08-14
🤖 machine learning

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

تقدم هذه الورقة SciFigBench، وهو معيار شامل وإطار عمل "الممانعة-المقاومة-الحث" (A-R-I) لتقييم الموثوقية السلوكية لنماذج الرؤية واللغة تحت ظروف عدم اليقين في فهم الأشكال العلمية، مما يكشف أن دقة الإدراك والاستدلال العالية لا تضمن قدرة النموذج على الإقرار بنقص الأدلة أو مقاومة السياق المضلل.

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Z (…)2026-08-14
💻 computer science

Sovereign by necessity? Frontier AI export controls, cyber security, and the limits of national AI capability

تجادل هذه الورقة بأنه في ظل إعادة تشكيل المشهد العالمي من قبل ضواب تطير الصادرات الأمريكية والتهديدات السيبرانية المستقلة للذكاء الاصطنا finally، لا تستطيع معظم الدول تحقيق سيادة كاملة على الذكاء الاصطناعي بسبب التكاليف الباهظة وتركيز الموارد، مما يستلزم استراتيجية متعددة الطبقات من الوصول المتفاوض عليه، والسيادة على مستوى الاستدلال، والتجميع الإقليمي لإدارة مخاطر الاعتماد على النماذج الرائدة.

Alan Woodward, Andrew Rogoyski2026-08-14