← أحدث الأبحاث
💬 NLP

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

تقدم الورقة البحثية Video2GUI، وهو إطار عمل مؤتمت يقوم بتخليق مجموعة بيانات ضخمة تضم 12 مليون مسار تفاعل مع واجهات المستخدم الرسومية (GUI) من فيديوهات إنترنت غير مصنفة للتغلب على ندرة البيانات وتعزيز أداء تعميم وكلاء واجهات المستخدم الرسومية متعددي الوسائط بشكل كبير.

المؤلفون الأصليون: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

نُشر 2026-05-15
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تعليم روبوت كيفية استخدام جهاز كمبيوتر، أو هاتف، أو موقع إلكتروني. للقيام بذلك، يتعين عليك إطلاعه على ملايين الأمثلة لأشخاص ينقرون على الأزرار، ويكتبون النصوص، ويتصفحون الصفحات.

المشكلة تكمن في أن العثور على هذه الأمثلة أمر صعب للغاية. عادةً، يضطر الباحثون إلى استئجار أشخاص لتسجيل وتصنيف كل نقرة يدويًا، وهو أمر بطيء ومكلف، ويجعلهم مقتصرين على أنواع قليلة فقط من التطبيقات. الأمر يشبه محاولة تعلم لغة عن طريق قراءة صفحات قليلة فقط من القاموس.

يقوم نظام Video2GUI بحل هذه المشكلة عبر تحويل الإنترنت بأكمله إلى فصل دراسي ضخم ومجاني. إليك كيف يعمل، باستخدام بعض الاستعارات البسيطة:

١. المصفاة الكبرى (العثيد على الفيديوهات المناسبة)

الإنترنت مليء بالفيديوهات، لكن معظمها غير مفيد لتعليم الروبوت (مثل برامج الطبخ أو فيديوهات القطط). بدأ الباحثون بـ ٥٠٠ مليون فيديو من يوتيوب.

  • الغربلة الأولية: أولاً، استخدموا ذكاءً اصطناعيًا ذكيًا لمسح العناوين والأوصاف. هذا يشبه أمين مكتبة يتفحص بسرعة أعلام الكتب ليرى ما إذا كانت تتحدث عن "الحواسيب" قبل حتى أن يفتحها. هذا قلل المجموعة إلى ٢٠ مليونًا.
  • الغربلة الدقيقة: بعد ذلك، استخدموا ذكاءً اصطناعيًا أكثر تقدمًا "لمشاهدة" الدقيقة الأولى من تلك الفيديوهات. تحققوا مما يلي: هل الشاشة واضحة؟ هل الصوت يشرح الخطوات بشكل جيد؟ هل يعرض بالفعل كيفية استخدام البرمجيات؟ هذا يشبه معلمًا صارمًا يصحح الفيديوهات لضمان جودتها العالية كدروس تعليمية.
  • النتيجة: انتهى بهم المطاف بـ ٤.٢ مليون فيديو تعليمي عالي الجودة.

٢. المترجم (تحويل الفيديو إلى تعليمات)

الآن أصبح لديهم الفيديوهات، لكن الروبوت لا يمكنه مجرد "مشاهدة" فيديو وفهمه كما يفعل البشر. يجب ترجمة الفيديو إلى قائمة منظمة من التعليمات.

  • العملية: استخدموا ذكاءً اصطناعيًا قويًا (مثل مترجم فائق الذكاء) لمشاهدة الفيديوهات وتفكيكها. حدد الذكاء الاصطناعي الهدف (مثلاً: "شراء أحذية")، والخطوات المتخذة، واللحظة الدقيقة التي حدثت فيها كل نقرة.
  • السحر: لم يقم الذكاء الاصطناعي بالتخمين فحسب؛ بل نظر إلى إطارات الفيديو للعثور على الإحداثيات الدقيقة للأزرار التي يتم النقر عليها. لقد حول فيديو مدته ١٠ دقائق لشخص يتسوق عبر الإنترنت إلى خريطة دقيقة وخطوة بخطوة: "عند الثانية ٠:٠٥، انقر على شريط البحث. عند الثانية ٠:١٠، اكتب 'أحذية رياضية'."

٣. المكتبة (WildGUI)

تم جمع كل هذه التعليمات المترجمة في مكتبة جديدة ضخمة تسمى WildGUI.

  • النطاق: تحتوي هذه المكتبة على ١٢ مليون مسار تفاعل (مسارات حركة) تغطي أكثر من ١,٥٠٠ تطبيق وموقع إلكتروني مختلف.
  • التنوع: تشمل كل شيء، من أجهزة سطح مكتب ويندوز إلى هواتف أندرويد وأجهزة ماك. إنها تشبه امتلاك مكتبة تحتوي على كل طريقة ممكنة استخدم بها البشر الكمبيوتر على الإطلاق، وكلها منظمة وجاهزة ليدرسها الروبوت.

٤. التدريب (تعليم الروبوت)

أخذ الباحثون نموذجين موجودين بالفعل من الذكاء الاصطناعي (Qwen2.5-VL و Mimo-VL) و"أطعموهما" هذه المكتبة الجديدة.

  • النتيجة: بعد دراسة هذه المجموعة الضخمة من البيانات، أصبح الروبوتات أفضل بشكل ملحوظ. لقد تحسنوا بنسبة ٥٪ إلى ٢٠٪ في اختبارات متنوعة.
  • الدليل: أصبح بإمكانهم الآن العثور على الأزرار، والنقر على الأشياء الصحيحة، والتنقل في المواقع الإلكترية المعقدة بشكل أفضل بكثير من السابق، مما يضاهي أو يتفوق على أفضل الروبوتات الموجودة حاليًا.

الخلاصة

يزعم البحث أنه من خلال أتمتة عملية تحويل فيديوهات الإنترنت إلى بيانات تدريب، قاموا بإنشاء مجموعة بيانات ضخمة ومتنوعة تجعل وكلاء الذكاء الاصطناعي أكثر ذكاءً في استخدام أجهزة الكمبيوتر. هم لم يخترعوا نوعًا جديدًا من الروبوتات؛ بل قدموا للروبوتات الموجودة بالفعل كتابًا مدرسيًا أفضل وأكبر وأكثر تنوعًا للدراسة منه.

لقد أطلقوا مجموعة البيانات هذه والأدوات المستخدمة لبنائها حتى يتمكن الباحثون الآخرون من استخدامها لبناء وكلاء ذكاء اصطناعي أفضل في المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →