💻 computer science

Asymmetric Collapse in Model Merging: When Refusal Over- writes Recognition

تُظهر هذه الورقة أن تقنيات دمج النماذج القياسية غالبًا ما تسبب انهيارًا غير متماثل حيث تُفقد قدرات التعرف على السلامة بينما يتم الحفاظ على سلوكيات الرفض الواسعة، ويرجع ذلك أساسًا إلى أن الضبط الدقيق للرفض يستحث مقادير لمتجهات المهام أكبر بكثير تهيمن على عملية الدمج رغم كون المتجهات شبه متعامدة.

Aarnav Choudhary, Matheus Fonseca Rocha, Jiwon Seo, Vasu Sharma, Maheep Chaudhary2026-07-31
💻 computer science

Enhancing Law-Enforcement Audio Transcription: A LoRA-Based Adaptation of Whisper for BWC Footage

تقدم هذه الورقة تكييفاً لنموذج Whisper يعتمد على تقنية LoRA، مما يتيح تحويلاً فعالاً وبإمكانيات الأجهزة الاستهلاكية للصوت الصادر من كاميرات الجسم التي تواجه تحديات في الوضوح إلى رسوم بيانية هيكلية للوقائع، وبذلك تعالج "مفارقة الرؤية" في العمل الشرطي الحديث عبر تحويل كميات هائلة من اللقطات غير المستغلة إلى أدلة قابلة للتنفيذ من أجل المساءلة.

Vivek Senthil, Zhiqiang Tao, Ernest Fokoué2026-07-31
💻 computer science

Divergence Decoding: Training-Free Capability Fusion

يُعد "فك التشفير بالتباعد" (Divergence Decoding) إطار عمل لا يتطلب تدريباً، يقوم بدمج الخبرة المعرفية للنماذج المتخصصة مع القدرة على الاستنتاج المنطقي للنماذج العامة ديناميكياً عبر استخدام تباعد "جنسن-شانون" لتوجيه توليد الرموز بشكل تكيفي، مما يجعله يتفوق على النماذج المرجعية أحادية النموذج في الاختبارات المعيارية العلمية.

Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan2026-07-31
💻 computer science

Do Context Files Help Coding Agents? A Two-Agent Ablation Study on Real Repositories

تقدم هذه الورقة دراسة استئصال مضبوطة تُثبت أن ملفات السياق المستمرة (مثل AGENTS.md) لا تُحسن بشكل ملموس من دقة الوكيل البرمجي لأن الإخفاقات تنبع من عجز في مهارات التنفيذ بدلاً من نقص المعرفة بالمستودع، مع تفسير النتائج المتناقضة السابقة أيضاً من خلال تباينات صعوبة المهام الخاصة بكل وكيل.

Prakhar Khatri2026-07-31
⚛️ quantum physics

LLM-Guided Initialization for Accelerated Hybrid Quantum-Classical Medical Image Classification

تُظهر هذه الورقة أن استخدام نموذج لغوي كبير لتهيئة المعلمات في خوارزمية كمية تباينية (AdaInit) يسرع التقارب بشكل كبير ويخفف من الهضاب القاحلة لتصنيف الصور الطبية على مجموعة بيانات DMR-IR، محققاً تدريباً أسرع بمقدار 160 مرة من التهيئة العشوائية مع الحفاظ على دقة مماثلة.

Riza Alaudin Syah, Irwan Alnarus Kautsar, Haza Nuzly Bin Abdull Hamed2026-07-31
💻 computer science

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

إن FAVA هو إطار عمل تفويض رسمي يضمن التنفيذ الآمن لوكلاء النماذج اللغوية الكبيرة (LLM) عن طريق ترجمة المهام المكتوبة باللغة الطبيعية إلى رسوم بيانية للأذونات مهيكلة، والتي يتم التحقق منها رياضياً مقابل سياسات الأمان باستخدام حلّال (SMT solver) لاعتراض الإجراءات غير المصرح بها قبل وقوعها.

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu2026-07-31
🤖 machine learning

Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents

تكشف هذه الورقة أنه بينما تشير المعايير القياسية إلى أن التكميم بـ 4 بت لا يتسبب في فقدان للمعلومات بالنسبة لوكلاء النماذج اللغوية الكبيرة متعددة الأدوار، إلا أنه في الواقع يضاعف أوضاع الفشل الموجودة بنسبة تصل إلى 2.5 ضعف ضمن ميزانية خطأ ثابتة، وهو تدهور خفي لا يصبح مرئياً إلا من خلال تحليل الخطأ لكل قناة ومعايير نجاح أكثر صرامة.

Jiwon Jang, Kisu Yang, Heuiseok Lim, Hyunwoo Park2026-07-31
🤖 machine learning

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

تجادل هذه الورقة الموقفية بأنه لكي يتم الادعاء بصرامة بوجود "فشل طويل الأمد"، يجب على المعايير المرجعية أن تقيس "بقايا الأفق" — وهي فجوة الأداء بين النجاح الفعلي للمهمة الكاملة والتنبؤ المرجعي المستمد من مهام قصيرة المدى متطابقة — للتمييز بين التدهور الحقيقي وبين مجرد تراكم الأخطاء العادية.

Chao Peng, Zhiheng Lyu, Peijie Dong, Hande Dong, Qiang Lin2026-07-31
💻 computer science

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

تقدم هذه الورقة البحثية PAUSE، وهو معيار مرجعي متمحور حول المستخدم صُمم لتقييم المساعدين الشخصيين القائمين على الذكاء الاصطناعي في بيئات خدمية واقعية وذات حالة مستمرة، وذلك من خلال معالجة أوجه القصور في المعايير المرجعية المجزأة الحالية عبر التقييم متعدد الأنظمة، وكشف حقيقة أن حتى النماذج الأكثر تطوراً تعاني في المهام التي تتطلب استدلالاً مستمراً للحالة وإدراكاً للإعدادات.

Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu2026-07-31
💻 computer science

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

يُعد SkillMentor إطار عمل مبتكر يُمكّن وكلاء النماذج اللغوية الكبيرة من التطور الذاتي عبر تعلم قدرة تشخيصية منفصلة لتحديد وتنسيق نقاط الضعف وتحويلها إلى مهارات قابلة لإعادة الاستخدام، مما يؤدي إلى تحسين أداء المنفذ بنسبة 44.2% دون تحديث أوزان المنفذ أو الاعتماد على الإشراف البشري.

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li2026-07-31