🤖 AI

Position: Evaluation Scores Are Perishable Knowledge Claims

تجادل هذه الورقة بأن درجات التقييم هي ادعاءات معرفية قابلة للتلف وعرضة لـ "تضخم الثقة" عند تجميعها عبر المتوسط، وتقترح بدلاً من ذلك نهج "الحلقة الأضعف" التحفظي الذي يتتبع صراحةً رسمية الدرجة ونطاقها ونافذة صلاحيتها لمنع التصنيفات المضللة.

Sankalp Gilda, Shlok Gilda2026-07-30
💻 computer science

Model-Driven Requirements Configuration with Three-Valued Uncertainty Scoring

تقدم هذه الورقة بنيةً عصبية-رمزية متعددة الوكلاء تجمع بين نموذج لغوي كبير ومُدقق رمزي حتمي وإطار عمل لتقييم عدم اليقين ثلاثي القيم للقضاء على التناقضات الهيكلية في المتطلبات المُولدة بواسطة النماذج اللغوية الكبيرة، مع التحديد الرسمي لعدم يقين القرار من أجل نشر أكثر أماناً في هندسة المتطلبات.

Ahmed Ibrahim2026-07-30
🤖 machine learning

Entity Resolution in Practice: Lessons from a Self-Serve Pipeline

تقدم هذه الورقة نظاماً للخدمة الذاتية لربط الكيانات تم تقييمه عبر ستة معايير مرجعية، مستخلصةً ثلاثة دروس عملية بالغة الأهمية: ضرورة الاختيار التلقائي للخوارزمية نظراً لعدم وجود فائز واحد، والحاجة إلى استراتيجيات متميزة لتحسين الدقة والاستدعاء، وأهمية إعادة التحقق من عمليات الدمج المتعدية لمنع انتشار الأخطاء.

Kaushik Pavani, Ganga Aluri, Pravin Jadhav, Neeraj Prasad, Kiran Sanka2026-07-30
💬 NLP

AgentGUI: An Interface for Observing and Steering Long-Running AI Agents

تقدم الورقة البحثية AgentGUI، وهي واجهة رسومية مستضافة محلياً مصممة لتعزيز الإشراف البشري على وكلاء الذكاء الاصطناعي الذين يعملون لفترات طويلة من خلال تصورات غنية للمسارات وقدرات التوجيه، والتي أظهرت دراسة مستخدمين أنها تحسن بشكل كبير سرعة تحليل المسار ومعدلات إكمال المهام.

Xuan Zhao, Jiwoong Sohn, Qinyue Zheng, Michael Moor2026-07-30
🤖 AI

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

تقدم هذه الورقة البحثية StealthBench، وهو معيار لتقييم التخفي العملياتي في وكلاء الأمن الهجومي المستقلين عبر ستة أبعاد، كاشفةً أن النماذج الحالية تفشل بشكل منهجي في الحفاظ على أساليب العمل الاحترافية (بتحقيق أقل من 54% من النجاح الآمن) رغم نجاحها في تحديد الثغرات الأمنية.

Ads Dawson, Adrian Wood2026-07-30
💬 NLP

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

تقدم هذه الورقة "التوصيف التشخيصي المعرفي" (CDP)، وهو إطار عمل يعتمد على التعلم الصفري، يقوم بتوجيه النماذج اللغوية الكبيرة لمحاكاة ملفات تعريف معرفية متنوعة للممتحنين، مما يحسن بشكل كبير من توافقها مع المختبرين البشريين عبر توزيعات القدرة، وأنماط الإتقان، وصعوبات الفقرات لتمكين المعايرة السيكومترية العملية وفعالة التكلفة.

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson2026-07-30
🤖 AI

Pramana: A Composable, Domain-Specific Backend for Empirical Networking Research

يقدم هذا البحث "برامانا" (Pramana)، وهو خلفية برمجية قابلة للتركيب ومتخصصة في مجال معين، تعمل على سد الفجوة بين التفكير البحثي وتوليد البيانات في مجال الشبكات التجريبية من خلال استخدام مواصفات نية موحدة لتفكيك التجارب إلى محاور مستقلة تشمل النية، والبنية التحتية، والآلية، مما يتيح تشغيل تعريف تجربة واحدة عبر بيئات تنفيذ متنوعة ويتفوق بشكل كبير على الأدوات الحالية في تلبية المتطلبات البحثية الواقعية.

Jaber Daneshamooz, Eugene Vuong, Alagappan Ramanathan, Manni Moghimi, Haarika Manda, Satyam Kumar, Snithik Thode, Satyan (…)2026-07-30
🤖 machine learning

High-Order Markov Blanket Discovery via a k-Order Relaxation of the Faithfulness Assumption

تقدم هذه الورقة نوعاً من الاسترخاء من الرتبة k لفرضية الأمانة لمعالجة الانتهاكات الناتجة عن التبعيات من الرتب العليا مثل علاقات XOR، وتقترح خوارزمية الغطاء الماركوفي من الرتبة k (kOMB) لاكتشاف الأغطية الماركوفية الرسومية بفعالية في ظل انتهاكات الأمانة الحقيقية والتجريبية على حد سواء.

Loong Kuan Lee, Ragavi Krishnamoorthy, Nico Piatkowski2026-07-30
🤖 machine learning

Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

تقترح هذه الورقة إطاراً قائماً على نظرية الألعاب يفسر المقايضة في التعلم المعزز المنظم بمعامل كولباك - ليبلر (KL) باعتبارها لعبة متسلسلة بين وكيل ومراقب، مما يوفر طريقة منهجية لتحديد معامل التنظيم الأمثل تلقائياً من خلال تعظيم المكافأة لكل وحدة من التمايز الإحصائي.

Keegan Harris, Brian W. Lee, Ian Waudby-Smith, Philip Amortila, Nika Haghtalab, Michael I. Jordan2026-07-30
💬 NLP

Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

تقترح هذه الورقة أن عدم الاتساق الناشئ في النماذج اللغوية الضبطية يتجلى في شكل تحول في الشخصية، حيث تُظهر تطبيق ناقلات سمات الشخصية الخمس الكبرى كشف توقيع ثابت يتمثل في انخفاض الطيبة والضمير، إلى جانب ارتفاع الانبساطية والعصابية عبر مختلف مجموعات البيانات والنماذج غير المتسقة.

Hasibur Rahman, Smit Desai2026-07-30