🤖 AI

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

تقدم هذه الورقة إطاراً إحصائياً صارماً باستخدام إحصاءات-U والمقاييس القائمة على النواة للتمييز بين القدرات الجوهرية لوكيل الذكاء الاصطناعي ومتانة تنفيذه، مما يثبت أن مقاييس الاتساق على مستوى المسار توفر حساسية تشخيصية متفوقة على معدلات pass@1 التقليدية لتحديد مشكلات الموثوقية في البيئات عالية المخاطر.

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar2026-05-12
🤖 AI

Infinite Mask Diffusion for Few-Step Distillation

تقترح هذه الورقة نموذج انتشار القناع اللانهائي (IMDM)، الذي يستخدم قناعاً عشوائياً ذا حالة لانهائية للتغلب على حد خطأ التفكيك النظري لنماذج الانتشار المقنعة القياسية، مما يتيح تقطيراً فعالاً لعدد قليل من الخطوات وأداءً فائقاً في مهام توليد النصوص بعدد قليل من الخطوات.

Jaehoon Yoo, Wonjung Kim, Chanhyuk Lee, Seunghoon Hong2026-05-12
🤖 AI

DuetFair: Coupling Inter- and Intra-Subgroup Robustness for Fair Medical Image Segmentation

تقترح الورقة البحثية DuetFair، وهو إطار عمل ثنائي المحاور يتميز بخوارزمية FairDRO التي تجمع بين خليط الخبراء المدرك للتوزيع والتحسين المتين للتوزيع المشروط بالمجموعات الفرعية لمعالجة التفاوتات بين المجموعات الفرعية والإخفاقات الخفية داخل المجموعات الفرعية في آن واحد في تقسيم الصور الطبية، محققةً عدالة فائقة وأداءً أفضل في الحالات الأسوأ عبر العديد من المعايير.

Yiqi Tian, Sangjoon Park, Bo Zeng, Pengfei Jin, Yujin Oh, Quanzheng Li2026-05-12
🤖 machine learning

HH-SAE: Discovering and Steering Hierarchical Knowledge of Complex Manifolds

تقدم الورقة البحثية بنية "المشفر التلقائي المعتمد على التناثر الهجين الهرمي" (HH-SAE)، وهي بنية مبتكرة تعالج صراعات كثافة الميزات في المجالات عالية الأبعاد من خلال تحليل المتشعبات إلى مستويات سياقية، وذرية، وتكوينية، مما يتيح كشفاً متفوقاً للاحتيال بصفر من البيانات التدريبية وتوليداً عالي الدقة موجهاً بالمعرفة من خلال إعطاء الأولوية للابتكار الآلي على الوكلاء البيئيين.

Honghan Wu, Tianyan Wang, Jiacong Mi, Zhoyang Jiang, Yunsoo Kim2026-05-12
🤖 AI

Agent-First Tool API: A Semantic Interface Paradigm for Enterprise AI Agent Systems

تقترح هذه الورقة وتتحقق من صحة نموذج "واجهة برمجة تطبيقات الأدوات الموجهة للوكيل أولاً" (Agent-First Tool API)، والذي يستبدل واجهات الـ CRUD التقليدية الموجهة للبشر ببروتوكول دلالي مكون من ستة أفعال ومعلومات وصفية مهيكلة لدعم اتخاذ القرار، وذلك لتعزيز معدلات نجاح مهام الوكلاء المستقلين والتعافي من الأخطاء في أنظمة الإنتاج المؤسسية بشكل كبير.

Kai Pan2026-05-12✓ Author reviewed ⓘ
🤖 AI

LLM Jaggedness Unlocks Scientific Creativity

تقدم هذه الورقة معيار SciAidanBench لتوضيح أن التطور غير المتكافئ، أو "المسنن"، لقدرات النماذج اللغوية الكبيرة عبر المجالات العلمية يمكن استغلاله استراتيجيًا من خلال أساليب التجميع لتعزيز الإبداع العلمي المدفوع بالذكاء الاصطناعي بشكل كبير بما يتجاوز حدود أي نموذج منفرد.

Shray Mathur, J. Anibal Boscoboinik, Esther H. R. Tsai, Kevin G. Yager2026-05-12
🤖 AI

CrackMeBench: Binary Reverse Engineering for Agents

تقدم هذه الورقة CrackMeBench، وهو معيار مرجعي جديد مصمم لتقييم قدرات وكلاء النماذج اللغوية في إجراء الهندسة العكسية الثنائية بشكل مستقل لاستعادة منطق التحقق وتوليد مدخلات صالحة لتحديات نمط CrackMe التعليمية، مما يظهر مستويات متفاوتة من النجاح عبر النماذج المختلفة في كل من المهام العامة والمولدة.

Isaac David, Arthur Gervais2026-05-12
🤖 machine learning

Fairness vs Performance: Characterizing the Pareto Frontier of Algorithmic Decision Systems

تُوصّف هذه الورقة جبهة باريتو لأنظمة اتخاذ القرار الخوارزمية من خلال إثبات أن المقايضات المثلى بين المنفعة والعدالة الجماعية تتحقق عبر قواعد عتبة حتمية خاصة بكل مجموعة على احتمالات النجاح، وهي نتيجة تظل قائمة عبر مختلف مقاييس العدالة، ودوال المنفعة، ومراحل المعالجة الخوارزمية.

Mieke Wilms, Christoph Heitz2026-05-12
🤖 AI

Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings

تتقصى هذه الورقة مدى قدرة تضمينات النماذج اللغوية الفرنسية على التقاط واستبقاء السمات الأسلوبية للمؤلف بعد إعادة الكتابة، مبرهنةً على أن هذه الإشارات تستمر وتُظهر أنماطاً خاصة بكل نموذج، مما يفتح آفاقاً جديدة للكشف عن محاكاة التأليف.

Benjamin Icard, Lila Sainero, Alice Breton, Evangelia Zve, Jean-Gabriel Ganascia2026-05-12
🤖 AI

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

إنَّ PRISM هو آلية دفاع في الوقت الفعلي لأنظمة النماذج اللغوية الكبيرة متعددة الوكلاء، تعمل على الحد من تسريب الأسرار عبر اكتشاف ديناميكيات التوليد المبكرة، مثل انهيار الإنتروبيا وتركيز اللوغيت، للتدخل لكل رمز (token) قبل إعادة بناء المعلومات الحساسة بالكامل، محققاً دقة مثالية وصفر تسريب في اختبار مرجعي هجومي شامل.

Riya Tapwal, Abhishek Kumar, Carsten Maple2026-05-12