🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

تقدم PhoneWorld مساراً قابلاً للتوسع يقوم تلقائياً بتحويل مسارات واجهة مستخدم الهاتف المحمول الحقيقية إلى بيئات تدريب قابلة للتحكم والتحقق عبر 34 تطبيقاً، مما يحسن بشكل كبير من أداء الوكيل في العديد من الاختبارات المرجعية من خلال نقل التركيز من بناء الاختبارات المرجعية يدوياً إلى الإنتاج الضخم لبيئات استخدام الهاتف.

Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Wein (…)2026-05-29
💻 computer science

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

تحدد هذه الورقة وتعالج عنق الزجاجة في مرحلة ما بعد التدريب، حيث تتحسن نماذج الرؤية واللغة في القدرة على الاستنتاج أكثر من الإدراك، وذلك عبر تقديم إطار تشخيصي يكشف عن أسباب متباينة لهذا التباين في الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي، وتقترح تدخلات مستهدفة مثل إعادة وزن الخسارة الديناميكي والمكافآت المدركة للإدراك لتعزيز الأداء النهائي بشكل كبير.

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng2026-05-29
🤖 AI

Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation

تقترح الورقة البحثية "التعلم التعزيزي الدلالي المرتكز على المصدر" (SG-SRL)، وهو إطار عمل يستفيد من البيانات أحادية اللغة الوفيرة للغة المصدر لتعزيز توليد اللغة المستهدفة منخفضة الموارد من خلال التعلم التعزيزي الخالي من المراجع مع مكافآت دلالية عابرة للغات، يليه مرحلة استرداد خفيفة لتصحيح الإطناب مع الحفاظ على الدقة الواقعية.

Zeli Su, Ziyin Zhang, Zewei Pan, Zhou Liu, Dingcheng Huang, Dehan Li, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Jun Zhou (…)2026-05-29
🤖 machine learning

DynaGraph: Lightweight Multi-Model Interaction Framework via Dynamic Topological Reconfiguration

تُعد DynaGraph إطار عمل خفيف الوزن متعدد النماذج يستخدم إعادة التشكيل الطوبولوجي الديناميكي ومهايئات الضبط الدقيق للنماذج الأساسية (PEFT) القائمة على تقسيم الوقت على نموذج أساسي مشترك لتحقيق قدرات استدلال بمستوى 72 مليار معلمة، مع تقليل زمن الاستجابة واستهلاك الرموز (tokens) بشكل كبير، وتجاوز قيود خطوط الإمداد الثابتة والوكلاء الديناميكيين غير المقيدين.

Yanxing Guo, Zihao Zheng, Fangzhou Wu, Ling Liang, Lin Bao, Zongwei Wang, Yimao Cai2026-05-29
💻 computer science

World Models in Words: Auditing Physical State-Transition Commitments in Vision-Language Models

تقدم هذه الورقة \wmw، وهو إطار تقييم ومجموعة بيانات \tracebank التي تدقق نماذج الرؤية واللغة من خلال مطالبتها بتوليد تتبعات انتقال حالة فيزيائية محددة النوع، مما يكشف عن إخفاقات الاستدلال الخفية ويُمكّن من تحسين الاتساق الفيزيائي الذي تغفله المعايير التقليدية التي تكتفي بالإجابات فقط.

Emmanuelle Bourigault2026-05-29
💻 computer science

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

تقدم هذه الورقة البحثية "DiffSpot"، وهو معيار قائم على الكود يوضح أن حتى نماذج الرؤية واللغة المتطورة تواجه صعوبة في اكتشاف الفروق البصرية دقيقة التفاصيل في واجهات الويب، حيث تحقق معدلات استدعاء منخفضة حتى في التغييرات البسيطة، وتُظهر أن صعوبة الاكتشاف تتباين بشكل كبير بناءً على خاصية CSS وليس بناءً على مقدار البكسل أو المسافة الدلالية.

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou2026-05-29
🤖 AI

DLM-SWAI: Steering Diffusion Language Models Before They Unmask

تقترح الورقة البحثية DLM-SWAI، وهي طريقة للتحكم أثناء الاستدلال لا تتطلب تدريباً، تعمل على توجيه نماذج اللغة الانتشارية نحو أساليب وخصائص سلامة مرغوبة من خلال تحيز توزيعات الرموز (tokens) باستخدام درجات محسوبة مسبقاً أثناء عملية إزالة الضجيج، مما يحقق تحكماً فعالاً دون إعادة تدريب أو عبء حوسبي كبير.

Hyeseon An, Yo-Sub Han2026-05-29
💻 computer science

Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR

تقدم الورقة البحثية IndicKLAR، وهو معيار لـ 18 لغة هندية ومتغيراتها المختلطة برمجياً، كاشفةً أن المدخلات المختلطة برمجياً تسد بشكل كبير فجوة اتساق المعرفة عبر اللغات بين الإنجليزية واللغات الأصلية، وغالباً ما تضاهي أداء اللغة الإنجليزية دون تدخل من النموذج.

Debajyoti Mazumder, Divyansh Pathak, Prashant Kodali, Aditya Joshi, Akshay Agarwal, Jasabanta Patro2026-05-29
💻 computer science

Classification of non-analyzable word types in web documents to implement an effective Korean e-learning system

تقترح هذه الورقة استخدام رسوم بيانية للقواعد المحلية (LGG) لتصنيف ومعالجة التعبيرات الكورية غير الرسمية غير القابلة للتحليل الموجودة في وثائق الويب بفعالية، مما يعزز قدرات أنظمة التعلم الإلكتروني الكورية عالية المستوى.

Sang-Taek Park, Ae-Lim Ahn, Eric Laporte, Jee-Sun Nam2026-05-29
🤖 machine learning

Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content

تقدم هذه الورقة البحثية Opir، وهي عائلة من نماذج الحماية القائمة على المشفرات متعددة المهام والفعالة والمبنية على بنية GLiClass، والتي تحقق أداءً تنافسياً في تصنيف السلامة عبر كشف السمية، ومحاولات الاختراق (jailbreaks)، والمحتوى الضار، مع الحفاظ على بصمة نشر أصغر بكثير من أنظمة الحماية الضخمة الحالية.

Ihor Stepanov, Aleksandr Smechov2026-05-29