🤖 AI

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

يُعد Harness-Bench معياراً تشخيصياً يتألف من 106 مهمة واقعية ومعزولة، يعمل على تقييم كيفية تأثير تكوينات طبقة النظام المختلفة (الحواجز/البيئات التنفيذية) على أداء وكلاء النماذج اللغوية الكبيرة، كاشفاً أن نتائج التنفيذ تتباين بشكل كبير عبر الاقتران بين النموذج والحاجز، ومسلطاً الضوء على الحاجة إلى الإبلاغ عن قدرات الوكيل على مستوى التكوين بدلاً من نسبها حصرياً إلى النموذج الأساسي.

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, L (…)2026-05-28
⚛️ quantum physics

Do We Really Need Quantum Machine Learning?: A Multidimensional Empirical Study

تقدم هذه الورقة دراسة تجريبية متعددة الأبعاد تُظهر أنه في حين أن آلات المتجهات الداعمة الكمومية (QSVM) والشبكات العصبية التلافيفية الكمومية (QCNN) تتسبب عموماً في أوقات تشغيل حسابية أعلى من نظيراتها الكلاسيكية، إلا أنها توفر دقة تصنيف فائقة عند المقاييس الأكبر وكفاءة محسنة بشكل كبير في المعلمات والذاكرة، لا سيالما بالنسبة للشبكات العصبية التلافيفية الكمومية (QCNN).

Sudip Vhaduri, Ryan Gammon, Sayanton Dibbo2026-05-28
💬 NLP

Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations

تقيم هذه الورقة البحثية بشكل منهجي مجسات الخداع في عائلة نماذج Gemma 3، مظهرةً أنه بينما تنهار المجسات الخطية تحت تأثير التحولات الأسلوبية بسبب الضيق التوزيعي بدلاً من الحدود المعمارية، فإن المجسات متعددة الأبعاد المعززة بالأسلوب يمكنها استعادة الكشف شبه المثالي بقوة عبر مختلف المقاييس من خلال الاستفضاء بالميزات الموزعة دون العتبة.

Sachin Kumar2026-05-28
🤖 AI

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

تقدم الورقة البحثية ROVER، وهو ملحق خفيف الوزن وقابل للتعلم للنماذج اللغوية الكبيرة متعددة الوسائط، يعزز الاستدلال متعدد الصور القائم على التأسيس من خلال توجيه الأدلة البصرية المتمحورة حول الأشياء بكفاءة عبر آلية ثلاثية الرموز (token triplet) الخاصة بكل خطوة، محققاً أداءً هو الأفضل في فئته على اختبارات معيارية مثل MM-GCoT وVideoEspresso دون المساس بالفهم الشامل للمشهد.

Guannan Lv, Ren Nie, Hongjian Dou2026-05-28
🤖 AI

Geometry of Human Perceptual Domains Emerges Transiently in LLM Representations

تُظهر هذه الورقة البحثية أن الهندسات الإدراكية الشبيهة بالبشر عبر مجالات مثل اللون والعاطفة تظهر بشكل عابر ضمن الطبقات المتوسطة للنماذج اللغوية الكبيرة، متبعةً مساراً تطورياً متميزاً رغم غياب التدريب الإدراكي المباشر.

Simardeep Singh, Paras Chopra2026-05-28
💬 NLP

Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses

تقدم هذه الورقة البحثية "تنظيم التدفق الدلالي" (Semantic Flow Regularization - SFR)، وهو هدف تدريب خفيف الوزن يخفف من حدة "انهيار الأنماط المتعددة" (Cross-Style Collapse) في النماذج اللغوية الكبيرة التي تم ضبطها بدقة، وذلك عبر الإشراف على التدفق الدلالي باستخدام مطابقة التدفق الشرطي، مما يعزز بشكل كبير تنوع المخرجات، ودقة الأسلوب، والأداء في كل من مهام الحوار والبرمجة دون زيادة تكاليف الاستدلال.

Kerui Peng, Feifei Li, Xingyu Fan, Wenhui Que2026-05-28
💬 NLP

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

تقدم هذه الورقة إطارين عمل بشريين-آليين لبناء معايير مرجعية للكلام باللغة المستهدفة للتغلب على قيود التقييم المتمحور حول اللغة الإنجليزية، مما أدى إلى إصدار ثلاث مجموعات بيانات كورية (KVoiceBench وKOpenAudioBench وKMMAU) تكشف عن فجوات كبيرة ونقاط ضعف تكميلية في نماذج اللغات الكلامية (SpeechLMs) الحديثة عند تقييمها في مهام الأسئلة والأجوبة المنطوقة باللغة الكورية وفهم الصوت.

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee2026-05-28
🤖 AI

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

تقدم الورقة البحثية AsyncTool، وهو معيار مرجعي مبتكر مصمم لتقييم قدرات استدعاء الأدوات غير المتزامنة للوكلاء القائمين على النماذج اللغوية الكبيرة في سيناريوهات متعددة المهام مع محاكاة زمن الاستجابة، مما يكشف عن معاناة النماذج الحالية مع التنسيق الزمني والكفاءة عند التعامل مع استجابات الأدوات المتأخرة.

Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shi (…)2026-05-28
💬 NLP

Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models

تقدم هذه الورقة Meow2X وTRNE، وهما إطاران عمل لا يتطلبان إعادة التدريب يعملان على تحديد موقع السمية في طبقات MLP المبكرة لبعض النماذج اللغوية عبر تحليل التنشيط، وكبحها من خلال التوسع أثناء الاستدلال أو تعديلات طفيفة في الأوزان، مما يحقق تحسينات مستمرة في السلامة دون المساس بجودة اللغة.

Himanshu Beniwal, Mayank Singh2026-05-28
🤖 AI

Learning to Assign Prediction Tasks to Agents with Capacity Constraints

تقدم هذه الورقة إطاراً نظرياً وخوارزميات استكشاف-استغلال متسلسلة لتعيين مهام التنبؤ ديناميكياً لوكلاء بشريين أو وكلاء ذكاء اصطناعي مع قيود السعة، وتُظهر من خلال التجارب أن هذه الأساليب تتفوق بشكل كبير على النماذج المرجعية غير السياقية عبر التعلم لتحسين خبرة الوكيل وسياق المهمة.

Shang Wu, Saatvik Kher, Padhraic Smyth2026-05-28