← أحدث الأبحاث
💬 NLP

VeriOS: Query-Driven Proactive Human-Agent-GUI Interaction for Trustworthy OS Agents

تقدم الورقة البحثية VeriOS، وهو إطار عمل وعميل قائم على الاستعلام يعزز موثوقية أتمتة أنظمة التشغيل من خلال الاستعلام الاستباقي من البشر في السيناريوهات غير الموثوقة، محققاً تحسناً كبيراً بنسبة 19.72% في معدلات النجاح لكل خطوة مقارنة بالنماذج المرجعية دون المساس بالأداء الطبيعي.

المؤلفون الأصليون: Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

نُشر 2026-04-06
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zheng Wu, Heyuan Huang, Xingyu Lou, Xiangmou Qu, Pengzhou Cheng, Zongru Wu, Weiwen Liu, Weinan Zhang, Jun Wang, Zhaoxiang Wang, Zhuosheng Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً وسريعاً للغاية، يمكنه النظر إلى شاشة هاتفك أو حاسوبك والقيام بأشياء نيابة عنك. يمكنه النقر على الأزرار، وكتابة الرسائل، وفتح التطبيقات بمجرد الاستماع إلى أوامرك الصوتية. هذا ما يسميه الباحثون "وكيل نظام التشغيل" (OS Agent).

ومع ذلك، هناك مشكلة كبيرة: هذا الروبوت واثق من نفسه أكثر من اللازم.

المشكلة: الروبوت المتحمس بزيادة

تخيل أنك قلت لروبوتك: "أرسل رسالة نصية إلى أمي".

  • في العالم المثالي: سيقوم الروبوت بفتح تطبيق المراسلة، والعثور على أمك، وإرسال النص. أمر سهل!
  • في العالم الحقيقي: فجأة، تظهر نافذة منبثقة تسأل: "هل تريد مشاركة موقعك؟" أو يتوقف التطبيق عن العمل، أو كانت تعليماتك غامضة (مثل "أرسل رسالة نصية إلى شخص ما").

الروبوت العادي قد يصاب بالذعر، أو الأسوأ من ذلك، قد يبدأ بالتخمين فقط. قد يشارك موقعك مع شخص غريب عن طريق الخطأ أو يرسل رسالة إلى الشخص الخطأ. وهذا ما يسمى "الإفراط في التنفيذ" (Over-execution). إنه يفعل أشياء لا ينبغي له فعلها لأنه لا يعرف متى يتوقف ويطلب المساعدة.

تحاول الروبوتات الحالية حل هذه المشكلة عن طريق التحقق من "درجة الثقة". إذا لم تكن متأكدة بنسبة 100%، فإنها تتوقف وتنتظر فقط. لكن هذا يشبه طالباً يتوقف عن حل مسألة رياضية لمجرد أنه ليس متأكداً من الإجابة، بدلاً من أن يطلب تلميحاً من المعلم. هذا ليس ذكاءً حقيقياً.

الحل: VeriOS (الروبوت الذي "يسأل أولاً")

يقدم البحث نظاماً جديداً يسمى VeriOS. فكر في VeriOS ليس كروبوت يقوم بالأشياء فحسب، بل كـ شريك ذكي يعرف تماماً متى يقول: "مهلاً، أنا أحتاج لمساعدتك في هذا الأمر".

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. "المحقق" مقابل "المنفذ"

معظم الروبوتات تحاول أن تكون "المحقق" (الذي يستنتج ما يحدث) و"المنفذ" (الذي ينقر على الأزرار) في نفس الوقت، وغالباً ما تصاب بالارتباك.

يقوم VeriOS بتقسيم هذا إلى قوتين خارقتين يتعلم كل منهما على حدة، ثم يجمعهما:

  • القوة الخارقة أ (المحقق): "هل هذا موقف آمن؟" ينظر إلى الشاشة ويتساءل: "هل هناك نافذة منبثقة؟ هل التعليمات غامضة؟ هل هذا إجراء حساس؟"
  • القوة الخارقة ب (المنفذ): "حسناً، الآن بعد أن عرفت ما يحدث، أي زر يجب أن أنقر؟"

2. "التدريب ثلاثي المراحل" (المدرسة)

لتعليم VeriOS هذه المهارات، لم يلقِ به الباحثون في أعماق المياه مباشرة. بل استخدموا طريقة تدريب خاصة مكونة من ثلاث خطوات:

  • الخطوة 1: "الفصل" (فصل المهارات): أخذوا آلاف الأمثلة وقسموها. بعض الأمثلة كانت تتعلق فقط بـ تحديد المشكلة (مثلاً: "هذه نافذة منبثقة خطيرة"). وأخرى كانت تتعلق بـ حل المشكلة (مثلاً: "انقر على 'سماح'").
  • الخطوة 2: "الممارسة المتداخلة" (الخلط بينهما): بدلاً من تعليم الروبوت "مهارات المحقق" لمدة أسبوع ثم "مهارات المنفذ" لمدة أسبوع، قاموا بخلط الأمور. علموا الروبوت التبديل بينهما بسرعة فائعة. يساعد هذا الروبوت على فهم الارتباط بين رصد المشكلة وحلها.
  • الخطوة 3: "نظام المكافآت" (تقرير الدرجات): قدموا للروبوت اختباراً. إذا حدد موقفاً صعباً بشكل صحيح وسأل الإنسان السؤال الصحيح، يحصل على نجمة ذهبية. وإذا خمن بشكل خاطئ أو لم يسأل عندما كان يجب عليه ذلك، يحصل على علامة حمراء. مع مرور الوقت، تعلم أن يكون مثالياً في معرفة متى يطلب المساعدة.

كيف يعمل في الحياة الواقعية؟

إليك المسار الجديد للتفاعل:

  1. أنت تقول: "احجز رحلة طيران إلى باريس."
  2. VeriOS ينظر إلى الشاشة: يرى نافذة منبثقة تطلب الإذن للوصول إلى جهات اتصالك.
  3. VeriOS (المحقق) يتحدث: "انتظر! هذا موقف حساس. لا يمكنني النقر على 'سماح' دون إذنك. هل تريد مني مشاركة جهات اتصالك؟"
  4. أنت تقول: "لا، فقط ألغِ النافذة المنبثقة."
  5. VeriOS (المنفذ) يتحرك: ينقر على "إلغاء" ويستمر في حجز الرحلة.

إذا كانت الشاشة عادية (لا توجد نوافذ منبثقة)، لكان VeriOS قد حجز الرحلة فوراً دون إزعاجك.

لماذا يعد هذا أمراً مهماً؟

اختبر الباحثون VeriOS مقابل أفضل الروبوتات المتاحة حالياً.

  • النتيجة: كان VeriOS أفضل بنسبة 20% في التعامل مع المواقف الصعبة والمعقدة (مثل النوافذ المنبثقة أو التعليمات الغامضة) دون ارتكاب أخطاء.
  • الميزة الإضافية: لم يصبح أبطأ أو أسوأ في المهام البسيطة. إنه يشبه سائقاً بارعاً في السباقات على الحلبة، ولكنه يعرف أيضاً متى يبطئ ويسأل عن الاتجاهات في مدينة ضبابية.

الملخص

VeriOS هو نوع جديد من المساعدين الحاسوبيين الذين تعلموا أهم درس على الإطلاق: لا بأس في طلب المساعدة.

بدلاً من التخمين الأعمى عندما تصبح الأمور فوضوية، فإنه يسألك استباقياً: "هل هذا موافق؟". هذا يجعله أكثر أماناً وموثوقية للاستخدام في العالم الحقيقي، حيث تتعطل الحواسيب، وتظهر النوافذ المنبثقة، ولا تكون التعليمات واضحة دائماً. إنه الفرق بين روبوت يتسبب في حادث سيارة لأنه لم يرَ لوحة "قف"، وروبوت يربت على كتفك بلطف ويقول: "مهلاً، أعتقد أننا بحاجة للتوقف هنا".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →