← أحدث الأبحاث
🤖 machine learning

PhoneWorld: Scaling Phone-Use Agent Environments

تقدم PhoneWorld مساراً قابلاً للتوسع يقوم تلقائياً بتحويل مسارات واجهة مستخدم الهاتف المحمول الحقيقية إلى بيئات تدريب قابلة للتحكم والتحقق عبر 34 تطبيقاً، مما يحسن بشكل كبير من أداء الوكيل في العديد من الاختبارات المرجعية من خلال نقل التركيز من بناء الاختبارات المرجعية يدوياً إلى الإنتاج الضخم لبيئات استخدام الهاتف.

المؤلفون الأصليون: Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Huawen Shen, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Pen
نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhengyang Tang, Yuxuan Liu, Xin Lai, Junyi Li, Pengyuan Lyu, Jason, Yiduo Guo, Zhengyao Fang, Yang Ding, Yi Zhang, Weinong Wang, Huawen Shen, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Rui Yan, Ji-Rong Wen, Chengquan Zhang, Han Hu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيفية استخدام الهاتف الذكي. يحتاج الروبوت إلى رؤية الشاشة، وفهم وظائف الأزرار، ومعرفة كيفية إنجاز المهام، مثل حجز رحلة طيران، أو طلب طعام، أو إرسال رسالة.

المشكلة الكبرى، وفقًا لهذه الورقة البحثية، ليست في أن الروبوت "غبي"، بل في أننا لا نملك ما يكفي من ميادين التدريب ليتعلم فيها. تطبيقات الهواتف الحقيقية فوضوية؛ فهي تتغير باستمرار، ويصعب إعادة ضبطها إلى "حالة البداية"، ومن المكلف تحويلها إلى ساحة تدريب آمنة. الأمر يشبه محاولة تعليم شخص ما القيادة من خلال السماح له بالتدريب فقط على طرق سريعة حقيقية ومزدحمة، دون أي وسيلة لإيقاف الوقت أو الرجوع للوراء إذا تعرض لحادث.

PhoneWorld هو الحل الذي بناه المؤلفون. لا تنظر إليه كمجرد اختبار واحد، بل كـ مصنع يبني ميادين تدريب.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

١. المخطط (التعلم من الحياة الواقعية)

بدلاً من التخمين لشكل تطبيق الهاتف، راقب الفريق أشخاصاً حقيقيين يستخدمون تطبيقات حقيقية. لقد سجلوا الشاشات التي نظر إليها الناس والمسارات التي اتخذوها (مثل الانتقال من الشاشة الرئيسية إلى شريط البحث، ثم إلى صفحة منتج).

  • التشبيه: تخيل أنك تريد بناء نسخة طبق الأصل لمطعم شهير من أجل حصة تعليم طبخ. بدلاً من التخمين بشأن قائمة الطعام، تراقب مئات الزبائن الحقيقيين، لترى أي الطاولات يجلسون عليها، وماذا يطلبون، وكيف يتحرك النادل بين المطبخ وصالة الطعام. يقوم PhoneWorld بذلك مع التطبيقات.

٢. بناء التطبيقات "المزيفة"

باستاستخدام تلك الملاحظات، يقوم PhoneWorld تلقائيًا ببناء نسخ مزيفة من تطبيقات حقيقية (مثل نسخة مزيفة من تطبيق QQ، أو تطبيق تسوق مزيف، أو تطبيق سفر مزيف).

  • السحر: هذه التطبيقات المزيفة تبدو وتعمل مثل التطبيقات الحقيقية، لكنها قابلة لإعادة الضبط. إذا ارتكب الروبوت خطأً، يمكنك الضغط على "إعادة ضبط"، ويعود التطبيق تمامًا إلى حالته الأولى.
  • قاعدة البيانات: داخل هذه التطبيقات المزيفة، توجد "لوحة نتائج" مخفية (قاعدة بيانات). إذا نجح الروبوت في إرسال رسالة أو إضافة عنصر إلى السلة، يتم تحديث لوحة النتائج تلقائيًا. هذا يسمح للكمبيوتر بمعرفة النتيجة فورًا: "نعم، لقد فعل الروبوت ذلك بشكل صحيح"، دون الحاجة لمراقبة بشرية.

٣. حلقة التدريب

بسبب كون هذه البيئات آمنة وقابلة لإعادة الضبط، يمكن للروبوت التدرب آلاف المرات.

  • العملية: يحاول الروبوت إكمال مهمة (مثل: "ابحث عن فيلم واشترِ تذكرة"). إذا نجح، يقوم النظام بحفظ هذا النجاح كدرس. وإذا فشل، يحاول مرة أخرى.
  • النطاق: بنى الفريق ٣٤ تطبيقًا مزيفًا مختلفًا تغطي ١٦ فئة مختلفة (تسوق، وسائل تواصل اجتماعي، سفر، إلخ). وهذا يمنح الروبوت تنوعًا هائلاً من "دروس القيادة" ليتعلم منها.

ماذا وجدوا (النتائج)

أجرى الفريق تجارب لمعرفة ما إذا كان هذا "مصنع ميادين التدريب" قد جعل الروبوت أكثر ذكاءً بالفعل. قارنوا بين روبوت تم تدريبه على بيانات قديمة وروبوت تم تدريبه باستخدام بيانات PhoneWorld الجديدة.

  • اختبار "الخلط والمطابقة": أخذوا روبوتًا قويًا واستبدلوا جزءًا صغيرًا فقط من بيانات تدريبه القديمة (١٠,٠٠٠ خطوة) بتدريب جديد من PhoneWorld.
    • النتيجة: أصبح الروبوت أفضل بشكل ملحوظ في كل شيء. لم يصبح أفضل في التطبيقات المزيفة فحسب، بل أصبح أفضل أيضًا في الاختبارات الواقعية. كان الأمر أشبه باستبدال بضع ساعات من القيادة على مضمار هادئ ببضع ساعات من القيادة في محاكاة لمدينة مزدحمة؛ فقد تعلم الروبوت كيفية التعامل مع حركة المرور الحقيقية بشكل أفضل.
  • اختبار "الأكثر هو الأفضل": وجدوا أن مجرد إضافة المزيد من تدريبات PhoneWorld ساعد، ولكن إضافة المزيد من أنواع التطبيقات ساعد أكثر.
    • التشبيه: الأمر لا يتعلق فقط بالتدرب على القيادة لمدة ١٠٠ ساعة على طريق مستقيم واحد. بل يتعلق بالتدرب على طريق سريع، وطريق ترابي، وشارع ممطر، وموقف سيارات. التنوع في البيئات كان هو السر.

الخلاية الأساسية

تجادل الورقة البحثية بأنه لجعل الروبوتات التي تستخدم الهواتف أكثر ذكاءً، لا ينبغي لنا فقط بناء نماذج أكبر أو جمع المزيد من البيانات الثابتة. بدلاً من ذلك، نحتاج إلى زيادة عرض ميادين التدريب.

PhoneWorld هو أداة تحول الاستخدام الواقعي إلى صالة ألعاب رياضية للتدريب قابلة لإعادة الاستخدام، وإعادة الضبط، والعمل التلقائي. إنه يسمح لنا ببناء العديد من "عوالم الهواتف" بسرعة، مما يمنح الروبوتات التنوع والأمان والتدريب اللامتناهي الذي يحتاجونه لإتقان الواقع.

باخت-صار: PhoneWorld هو مصنع يبني نسخ ألعاب فيديو آمنة وقابلة لإعادة الضبط لتطبيقات الهواتف الحقيقية، مما يسمح لروبوتات الذكاء الاصطناعي بالتدرب ملايين المرات حتى يتمكنوا في النهاية من استخدام الهواتف الحقيقية دون وقوع حوادث.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →