💬 NLP

VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation

يُعد VLAA-GUI إطار عمل معياري لوكلاء واجهة المستخدم الرسومية (GUI) المستقلين، يعالج مشكلات الإنهاء المبكر والحلقات التكرارية من خلال دمج التحقق الإلزامي من الاكتمال، وكسارة حلقات متعددة المستويات، ووكيل بحث عند الطلب، محققاً بذلك أداءً هو الأفضل في فئته على معايير OSWorld وWindowsAgentArena.

Qijun Han, Haoqin Tu, Zijun Wang, Haoyue Dai, Yiyang Zhou, Nancy Lau, Alvaro A. Cardenas, Yuhui Xu, Ran Xu, Caiming Xion (…)2026-04-24
💬 NLP

Differentially Private De-identification of Dutch Clinical Notes: A Comparative Evaluation

تقدم هذه الورقة أول دراسة مقارنة للخصوصية التفاضلية، والتعرف على الكيانات المسماة، والنماذج اللغوية الكبيرة لإزالة تحديد الهوية من الملاحظات السريرية الهولندية، مما يثبت أنه بينما تؤدي الخصوصية التفاضلية وحدها إلى تقليل فائدة البيانات بشكل كبير، فإن النهج الهجين الذي يجمع بينها وبين المعالجة المسبقة القائمة على النماذج اللغوية الكبيرة يحقق توازناً متفوقاً بين الخصوصية والفائدة.

Michele Miranda, Xinlan Yan, Nishant Mishra, Rachel Murphy, Ameen Abu-Hanna, Sébastien Bratières, Iacer Calixto2026-04-24
💬 NLP

Decoupled DiLoCo for Resilient Distributed Pre-training

تقدم الورقة البحثية Decoupled DiLoCo، وهو إطار عمل للتدريب الموزع غير المتزامن يقوم بتقسيم الحوسبة عبر متعلمين مستقلين ويستخدم التجميع القائم على النصاب القانوني (quorum-based aggregation) للقضاء على توقفات المزامنة العالمية، مما يحقق انعدام وقت التوقف العالمي وتحسين الكفاءة في البيئات المعرضة للفشل مع الحفاظ على أداء تنافسي للنموذج.

Arthur Douillard, Keith Rush, Yani Donchev, Zachary Charles, Nova Fallen, Ayush Dubey, Ionel Gog, Josef Dean, Blake Wood (…)2026-04-24
💬 NLP

AI-Gram: When Visual Agents Interact in a Social Network

تقدم الورقة البحثية AI-Gram، وهي منصة حية تتفاعل فيها الوكلاء المدفوعون بالنماذج اللغوية الكبيرة عبر الصور، كاشفةً أنه بينما يشكل هؤلاء الوكلاء تلقائياً هياكل تواصل بصري غنية، فإنهم يحافظون في الوقت ذاته على سيادة جمالية فردية ويقاومون التقارب الأسلوبي.

Andrew Shin2026-04-24
💬 NLP

Reasoning Primitives in Hybrid and Non-Hybrid LLMs

تشير هذه الدراسة إلى أنه بينما يعمل تعزيز الاستدلال على توسيع نطاق التشغيل الفعال للنماذج اللغوية الكبيرة بشكل كبير، فإن البنى الهجينة التي تجمع بين الاسترجاع القائم على الانتباه وتحديثات الحالة المتكررة تحافظ على متانة فائقة مقارنة بنماذج المحولات القائمة على الانتباه فقط في المهام التي تتطلب تتبع حالة تسلسلية معقدة واستدعاءً.

Shivam Rawat, Lucie Flek, Florian Mai, Nicholas Kluge Corrêa2026-04-24
💬 NLP

Cross-Domain Data Selection and Augmentation for Automatic Compliance Detection

تبحث هذه الورقة في كيفية قدرة استراتيجيات اختيار البيانات المستهدفة — وتحديداً أخذ العينات العشوائية، وفرق الإنتروبيا المتقاطعة، والوزن الأهمي، والاسترجاع القائم على التضمين — على التخفيف من حدة النقل السلبي وتحسين تعميم نماذج الكشف الآلي عن الامتثال التنظيمي عبر المجالات القانونية المتنوعة.

Fariz Ikhwantri, Dusica Marijan2026-04-24
💬 NLP

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

تقدم هذه الورقة إطاراً مضبوطاً ومتعدد الأبعاد للتقييم الزوجي لأنظمة تحويل النص إلى كلام (TTS) متعددة اللغات في 10 لغات هندية، وذلك باستخدام أكثر من 120,000 مقارنة بشرية لإنشاء لوحة صدارة موثوقة، وتحليل المقايضات الإدراكية، وتفسير تفضيلات النماذج من خلال نمذجة "برادلي-تيري" وتحليل "SHAP".

Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandy (…)2026-04-24
🤖 machine learning

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

تقدم الورقة البحثية TaNOS، وهو إطار عمل للتدريب المسبق المستمر يعزز متانة وقابلية نقل الاستدلال العددي في الجداول المتخصصة من خلال الجمع بين إخفاء هوية العناوين، ومخططات العمليات، والتعلم الذاتي القائم على البرامج أولاً للتغلب على قيود الضبط الدقيق الخاضع للإشراف وتحولات النطاق.

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee2026-04-24
💬 NLP

From Tokens to Concepts: Leveraging SAE for SPLADE

تقترح هذه الورقة نموذج SAE-SPLADE، وهو نموذج استرجاع مبتكر يستبدل المفردات التقليدية بمفاهيم دلالية يتم تعلمها عبر المشفرات التلقائية المتفرقة (Sparse Auto-Encoders) للتغلب على قيود المفردات مع الحفاظ على أداء مماثل وتحسين الكفاءة.

Yuxuan Zong, Mathias Vast, Basile Van Cooten, Laure Soulier, Benjamin Piwowarski2026-04-24
💬 NLP

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

تقيم هذه الورقة بشكل منهجي موثوقية نماذج الرؤية واللغة المستخدمة كمقيمين لمهام تحويل الصور إلى نصوص والنصوص إلى صور، كاشفةً عن وجود نقاط عمياء كبيرة لديها — لا سيما في اكتشاف الهلوسة، والأخطاء المكانية، والتناقضات الواقعية — حيث تفشل غالباً في تحديد الاضطرابات المسببة لتدهور الجودة في أكثر من 50% من الحالات.

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra2026-04-24