← أحدث الأبحاث
🤖 AI

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

تُعد OpenMobile إطار عمل مفتوح المصدر يعمل على توليد تعليمات مهام ومسارات وكلاء عالية الجودة من خلال خط أنابيب استكشاف قابل للتوسع واستراتيجية تبديل السياسات، مما يمكّن الوكلاء الذين يتم تدريبهم على بياناتها من تحقيق أداء تنافسي في الاختبارات المعيارية للهواتف المحمولة مع ضمان استناد النتائج إلى وظائف واسعة النطاق بدلاً من الإفراط في التخصيص.

المؤلفون الأصليون: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

نُشر 2026-04-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت خادم كيفية استخدام هاتفك الذكي للقيام بأمور مثل "حجز رحلة طيران"، أو "ضبط تذكير"، أو "البحث عن صورة محددة".

في الوقت الحالي، الروبوتات المساعدة الأكثر تقدمًا (مثل تلك التي تنتجها شركات التكنولوجيا الكبرى) ذكية للغاية؛ حيث يمكنها تنفيذ هذه المهام بنسبة نجاح تصل إلى 70% تقريبًا. لكن هناك مشكلة: فهي عبارة عن "صناديق سوداء". نحن لا نعرف بالضبط كيف تم تعليمها، فقد تعلمت من بيانات سرية وخاصة لا يستطيع أحد غيرهم رؤيتها.

من ناح أخرى، يعاني مجتمع "المصدر المفتوح" (الهواة والباحثون الذين يشاركون أعمالهم)؛ فهم يحاولون تعليم روبوتاتهم باستخدام كتب مدرسية قديمة وغير منظمة (مجموعات بيانات عامة)، ولا تنجح روبوتاتهم إلا بنسبة 30% تقريبًا. إنهم عالقون في الظلام، يحاولون تخمين الطريقة التي اتبعها المحترفون.

إليك "OpenMobile".

فكر في "OpenMobile" كأنه "مدرسة روبوتات" مفتوحة المصدر وشفافة يمكن لأي شخص الانضمام إليها. إنه إطار عمل جديد مصمم لتعليم الوكلاء المتنقلين (الروبوتات التي تستخدم الهواتف) عبر إنشاء مواد تدريبية عالية الجودة خاصة به من الصفر.

إليك كيف يعمل، باستخدام بعض التشبيهات البسيطة:

1. "مكتبة كل شيء" (توليد المهام)

المشكلة: حاولت الطرق القديمة تعليم الروبوت من خلال مراقبته وهو يتجول داخل تطبيق ما لمرة واحدة، ثم التخمين: "أوه، ربما يحاول القيام بـ هذا؟". هذا يشبه محاولة تعلم خريطة مدينة كاملة عبر المشي في شارع واحد فقط وتخمين ما يوجد في الأحياء الأخرى. ستفقد الكثير من التفاصيل.

حل OpenMobile:
بدلاً من التخمين، يرسل OpenMobile الروبوت في رحلة بحث عن الكنز أولاً.

  • الخطوة 1: يتجول الروبوت عبر 20 تطبيق أندرويد مختلفًا، ينقر على الأزرار ويتنقل بين الشاشات لمجرد معرفة ما هو ممكن. يقوم ببناء "ذاكرة عالمية" ضخمة (مثل فهرس مكتبة عملاق) لكل ميزة في كل تطبيق.
  • الخطوة 2: بمجرد بناء المكتبة، ينظر "معلم" (ذكاء اصطناعي) إلى الفهرس ويكتب واجبات منزلية جديدة ومبتكرة.
    • التشبيه: بدلاً من قول "انقر على الزر الأحمر"، يقول المعلم: "ابحث عن وصفة 'التاكو الحار' في تطبيق الطبخ، ثم أرسل المكونات في رسالة نصية إلى والدتك، وأخيرًا اضبط مؤقتًا لمدة 20 دقيقة".
    • ولأن المعلم يمتلك المكتبة بأكملها، يمكنه إنشاء مهام معقدة ومتعددة الخطوات مبنية على الواقع، وليس مجرد تخمينات عشوائية.

2. "المدرب والطالب" (توليد المسارات)

المشكلة: عادةً، أنت تعلم الروبوت من خلال إظهار مثال مثالي ("خبير") يقوم بالمهمة بشكل مثالي. يقوم الروبوت بتقليد الخبير. ولكن ماذا يحدث عندما يرتكب الروبوت خطأً؟ إذا رأى أمثلة مثالية فقط، فلن يعرف كيفية إصلاح الخطأ. سيصاب بالذعر ويفشل.

حل OpenMobile:
يستخدم OpenMobile استراتيجية "تبديل السياسة" (Policy-Switching). تخيل طالبًا (المتعلم) ومدربًا بارعًا (الخبير) يعملان معًا.

  • يحاول الطالب القيام بالمهمة.
  • يراقبه المدرب عن كثب. وطالما أن الطالب يسير بشكل جيد، يستمر الطالب في العمل.
  • اللحظة السحرية: في اللحظة التي يبدأ فيها الطالب بالخروج عن المسار الصحيح (على سبيل المثال، نقر الزر الخطأ)، يتدخل المدرب فورًا، ويصلح الخطأ، ويوجه الطالب للعودة إلى المسار الصحيح.
  • النتيجة: يتعلم الروبوت ليس فقط كيفية النجاح، بل كيفية التعافي من الفشل. يتعلم أن ارتكاب خطأ ليس نهاية العالم، بل هو مجرد فرصة لتصحيح المسار. هذا هو "السر" الذي تفتقده معظم طرق المصدر المفتوح الأخرى.

3. النتائج: سد الفجوة

استخدم الفريق هذه الطريقة لإنشاء مجموعة بيانات تضم 2,800 مهمة معقدة و34,000 خطوة إجرائية. قاموا بتدريب روبوتاتهم على هذه البيانات واختبروها في ثلاثة اختبارات رئيسية (مثل "الأولمبياد" للروبوتات المتنقلة).

  • قبل: كانت روبوتات المصدر المفتوح تسجل حوالي 30%.
  • بعد: سجلت روبوتاتهم 51.7% وحتى 64.get% في أصعب الاختبارات.
  • الحكم النهائي: لقد أصبحوا الآن منافسين للعمالقة ذوي المصادر المغلقة من شركات التكنولوجيا الكبرى، مما يثبت أنك لست بحاجة إلى "صندوق أسود" لبناء روبوت فائق الذكاء.

لماذا هذا مهم؟

تناولت الورقة البحثية أيضًا مخاوف كبيرة: "هل غشوا من خلال حفظ أسئلة الاختبار؟".
لقد أجروا "فحصًا للسرقة الأدبية" ووجدوا أنه بينما كانت بيانات التدريب الخاصة بهم مرتبطة بتطبيقات الاختبار، إلا أنها لم تكن تنسخ أسئلة الاختبار المحددة. لقد تحسنت الروبوتات لأنها تعلمت كيف تفكر وكيف تصحح الأخطاء، وليس لأنها حفظت الإجابات.

باختًا، OpenMobile هو مجموعة أدوات تتيح لأي شخص بناء روبوت خادم ذكي، وقابل للتكيف، ويعرف كيفية التعافي عندما تسوء الأمور، وكل ذلك دون الحاجة إلى الوصول إلى بيانات الشركات السرية. إنه يشبه إعطاء الجميع وصفة الكعكة المثالية، بدلاً من مجرد بيع الكعكة لهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →