InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction
تقدم الورقة البحثية InfantAgent-Next، وهو وكيل عام متعدد الوسائط عالي الوحدات يدمج القدرات القائمة على الأدوات والقدرات البصرية البحتة لتمكين التفاعل الحاسوبي التعاوني خطوة بخطوة، محققاً أداءً هو الأفضل في فئته في مختلف الاختبارات المرجعية بما في ذلك OSWorld وGAIA وSWE-Bench.
المؤلفون الأصليون:Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding
تخيل أن لديك مساعداً شخصياً ذكياً جداً، ولكنه أخرق قليلاً، يدعى InfantAgent-Next.
في عالم أتمتة الحاسوب، معظم المساعدين اليوم يشبهون المتخصصين الذين يعرفون القيام بشيء واحد فقط بإتقان، أو عامّين يحاولون فعل كل شيء لكنهم غالباً ما يصابون بالارتباك.
بعض المساعدين يشبهون الأمناء (المكتبيين): هم بارعون في استخدام قائمة محددة من الأدوات (مثل "البحث في الويب" أو "فتح ملف")، ولكن إذا طلبت منهم النقر على زر على الشاشة لم يروه من قبل، يتجمدون لأنهم لا يملكون أداة لذلك الزر تحديداً.
ومساعدون آخرون يشبهون الفنانين: يمكنهم النظر إلى الشاشة و"رؤية" ما يوجد بها، لكنهم يعانون في القيام بعمليات حسابية معقدة أو كتابة الأكواد البرمجية لأنهم يحاولون القيام بكل ذلك بأعينهم فقط، دون آلة حاسبة أو محرر نصوص.
InfantAgent-Next مختلف. إنه يشبه توظيف فريق "السكين السويسري" بدلاً من شخص واحد.
كيف يعمل: فريق "العقل واليدين"
بدلاً من وجود عقل واحد ضخم يحاول فعل كل شيء، يقوم InfantAgent-Next بتفكيك كل مهمة إلى خطوات صغيرة ويرسل كل خطوة إلى الخبير الأنسب لها.
المدير (المخطط): عندما تطلب منه "احفظ هذه الصفحة في الإشارات المرجعية الخاصة بي"، يقرأ نموذج "مدير" رفيع المستوى طلبك. هو لا يحاول النقر بالفأرة بنفسه، بل يقول: "حسناً، نحتاج لفتح المتصفح، وإيجاد زر الإشارات المرجعية، والنقر عليه".
المتخصصون: يقوم المدير بعد ذلك باستدعاء الخبير المناسب للمهمة:
العين (التأسيس البصري): إذا كانت المهمة هي "انقر على الزر الأحمر"، فإن نموذج رؤية متخصص ينظر إلى الشاشة، ويجد إحداثيات البكسل الدقيقة لهذا الزر الأحمر، ويخبر النظام بمكان النقر. إنه يشبه مراقباً حاد العين يوجه رامياً معصوب العينين.
الآلة الحاسبة (تنفيذ الكود): إذا كانت المهمة هي "تحليل ملف إكسل هذا"، فيقوم المدير بتسليم الملف إلى خبير برمجي يكتب نصاً برمجياً (Script) للقيام بالعمليات الحسابية فوراً، بدلاً من محاولة عد الصفوف بمجرد النظر إلى الشاشة.
الأذن (التحليل الصوتي): إذا قمت برفع تسجيل وسألت: "ما رقم الصفحة المذكور؟"، فإن نموذجاً صوتياً متخصصاً يستمع إلى الملف ويستخرج الإجابة.
الذاكرة: يحتفظ النظام بدفتر ملاحظات مشترك. في كل مرة ينهي فيها متخصص ما خطوة، يقوم بتدوينها. المتخصص التالي يقرأ ما حدث ويكمل القصة. هذا يضمن أن الفريق لن يفقد مسار الهدف.
لماذا هذا مهم (خدع "السحر")
يسلط البحث الضوء على مشكلتين رئيسيتين يحلهما هذا النظام:
مشكلة "النقر": العديد من وكلاء الذكاء الاصطناعي سيئون في النقر على المكان الصحيح في الشاشة. قد ينقرون على بُعد 5 بكسلات إلى اليسار ويفشلون في إصابة الزر. يستخدم InfantAgent-Next تقنية "التكبير" (Zoom-In). إذا كان بحاجة للنقر على زر، فهو لا يخمن فقط. بل يأخذ صورة للشاشة، يجد المنطقة العامة، يقص تلك المنطقة ليجعلها أكبر، يجد الزر مرة أخرى، يقصها مرة أخرى، ثم ثم ينقر. إنه كاستخدام عدسة مكبرة للعثور على إبرة في كومة قش، مما يضمن دقة النقر.
مشكلة "التعديل": عند تعديل ملف نصي، غالباً ما يخطئ الذكاء الاصطناعي في أرقام الأسطر (مثلاً: "غير السطر 5" بينما يجب أن يكون السطر 6). يمتلك InfantAgent-Next نظام "التحقق المزدوج". هو يقترح تغييراً، ثم ينظر إلى النص الفعلي للتحقق: "هل السطر 5 يقول فعلاً ما أعتقد أنه يقوله؟". إذا لم يكن كذلك، فإنه يعدل خطته قبل إجراء التعديل، مما يمنع الأخطاء الفوضوية.
ما يمكنه فعله (الدليل)
اختبر الباحثون هذا "الفريق من المتخصصين" مقابل وكلاء ذكاء اصطناعي رفيعي المستوى في ثلاثة أنواع من التحديات:
مهام سطح المكتب في العالم الحقيقي (OSWorld): طلبوا من الوكيل القيام بأشياء مثل "تحميل ملف"، "تعديل مستند"، و"التنقل في موقع إلكتروني". تفوق InfantAgent-Next على وكيل "Claude Computer Use" الشهير بنسبة 7.27%. لقد كان أفضل في إنجاز المهمة فعلياً دون مساعدة بشرية.
البرمجة وإصلاح الأخطاء (SWE-Bench): طلبوا من الوكيل إصلاح أكواد برمجية معطلة في مشاريع برمجية حقيقية. قدم أداءً يضاهي أو يتفوق على العديد من الوكلاء التجاريين المغلقين والمكلفين.
المعرفة العامة والمنطق (GAIA): طرحوا أسئلة معقدة تتطلب البحث في الويب، وقراءة الملفات، والاستنتاج المنطقي. احتل InfantAgent-Next المركز الثاني بين جميع الوكلاء مفتوحي المصدر، مما يثبت قدرته على التعامل مع المنطق المعقد متعدد الخطوات.
الخلاصة
ليس InfantAgent-Next مجرد نموذج ذكاء اصطناعي واحد ضخم يحاول أن يكون كل شيء. إنه مايسترو نموذجي يعرف تماماً متى يستدعي "العين"، أو "الأذن"، أو "المبرمج"، أو "الناقر بالفأرة". ومن خلال السماح لكل متخصص بالقيام بما يبرع فيه، يصبح النظام بأكمله أكثر ذكاءً، ودقة، وقدرة على التعامل مع المهام الفوضوية التي نواجهها يومياً على حواسيبنا.
لقد جعل الباحثون الكود المصدري لهذا "الفريق من المتخصصين" متاحاً لأي شخص لاستخدامه ودراسته، آملين في المساعدة في بناء مساعدين حاسوبيين أفضل في المستقبل.
إليك ملخص تقني مفصل لورقة البحث بعنوان "InfantAgent-Next: وكيل عام متعدد الوسائط للتفاعل الحاسوبي الآلي."
1. بيان المشكلة
تواجه الوكلاء الآليون الحاليون المعتمدون على الذكاء الاصطناعي للتفاعل مع الحاسوب مقايضة جوهرية بين العمومية والدقة:
الوكلاء القائمون على الأدوات: (مثل OpenHands، AutoGPT) يعتمدون على أدوات محددة مسبقاً (أكواد، بحث) لتعزيز الدقة في مهام معينة. ومع ذلك، فإنهم يتطلبون دمجاً يدوياً للأدوات لكل سيناريو جديد، مما يجعلهم هشين ومحدودي النطاق. وغالباً ما يفشلون عند مواجهة برمجيات لا تغطيها مجموعة أدواتهم.
وكلاء الرؤية الصرفة: (مثل UI-TARS، Aguvis) يستخدمون نماذج اللغات والرؤية الكبيرة (vLLMs) للتحكم في واجهات المستخدم الرسومية (GUIs) مباشرة دون أدوات. وبينما يتميزون بقدرة عالية على العمومية، إلا أنهم يعانون في التفكير عالي الدقة، حيث يخطئون غالباً في تحديد مواقع عناصر واجهة المستخدم (النقر على إحداثيات خاطئة) أو يفشلون في المهام الدقيقة مثل تحرير الملفات ومعالجة الأكواد حيث قد تكفي استدعاءات الأدوات البسيطة.
الفجوة: تفتقر الحلول الحالية إما إلى المرونة للتعامل مع المهام المتنوعة وغير المنظمة، أو تفتقر إلى الدقة لتنفيذ العمليات المعقدة التي تعتمد بكثافة على الأدوات بشكل موثوق. هناك حاجة إلى نموذج هجين يوحد دقة التنفيذ القائم على الأدوات مع قدرة التكيف الخاصة بالتحكم القائم على الرؤية الصرفة.
2. المنهجية: بنية InfantAgent-Next
يقدم InfantAgent-Next وكيلاً عاماً متعدد الوسائط وعالي النمطية يدمج النهجين القائم على الأدوات والرؤية الصرفة ضمن سياق حواري موحد. وبدلاً من الاعتماد على نموذج واحد ضخم، يقوم بتوجيه المهام الفرعية إلى نماذج متخصصة بناءً على نقاط قوتها.
البنية الأساسية
يعمل النظام في حلقة تكرارية تتكون من ثلاثة أدوار متميزة، يمكن تشغيل كل منها بواسطة نموذج مختلف:
المخطط (Planner): يحلل طلب المستخدم والحالة الراهنة لإنشاء خطة مهمة رفيعة المستوى.
محدد الأدوات (Tool Selector): يختار ديناميكياً مجموعة الأدوات الأكثر ملاءمة (مثل تحرير الملفات، تصفح الويب، استخدام الحاسوب) من مكتبة منسقة.
المنفذ (Executor): يستدعي الأدوات المختارة ويجمع التعليقات من البيئة.
المكونات التقنية الرئيسية:
سير العمل النمطي والذاكرة: يحافظ الوكيل على سجل حواري موحد ولكنه يقوم بتحليل الاستجابات باستخدام علامات خاصة (<thought>, <task>, <toolkit>, <execute_bash>, إلخ). وهذا يسمح للنظام بإعادة بناء السياق خصيصاً للمهمة الفرعية الحالية (التخطيط مقابل التنفيذ)، مما يمنع تضخم نافذة السياق وتوليد محتوى غير ذي صلة.
مجموعة الأدوات الديناميكية: يصنف النظام الأدوات إلى سبع مجموعات (قراءة الملفات، البحث، التحرير، تصفح الويب، استخدام الحاسوب، تنفيذ الأكواد، الأدوات المتقدمة). ويختار ديناميكياً مجموعة فرعية من الأدوات ذات الصلة لكل خطوة لتقليل تكلفة الاستدلال والعبء الإدراكي على النموذج اللغوي الكبير (LLM).
التكامل متعدد الوسائط: يدعم الوكيل النصوص والصور والصوت والفيديو. ويمكنه توجيه تحليل الصوت إلى نماذج صوتية متخصصة، والتأسيس البصري (visual grounding) إلى نماذج الرؤية، والاستدلال المنطقي إلى نماذج لغوية كبيرة متقدمة.
التحسينات المبتكرة
تقدم الورقة خوارزميات محددة لمعالجة نقاط الفشل المعروفة في وكلاء الذكاء الاصطناعي المتطورين (SOTA):
القص الإقليمي التكراري للنقرات بالفأرة (الخوارزمية 1): لحل مشكلة "التأسيس البصري" حيث تخطئ النماذج في تحديد الإحداثيات:
يأخذ الوكيل لقطة شاشة كاملة.
يتنبأ نموذج التأسيس البصري بإحداثيات مرشحة.
يقوم النظام بقص منطقة أصغر حول تلك الإحداثيات.
تتكرر هذه العملية n من المرات (تضييق منطقة البحث بشكل تكراري).
تُستخدم الإحداثيات النهائية المنقحة للنقر. هذا يقلل بشكل كبير من التشتت الناتج عن البكسلات غير ذات الصلة.
التحرير القوي للملفات (الخوارزمية 2): للتعامل مع الأخطاء في تحرير الملفات القائم على أرقام الأسطر:
ينشئ الوكيل خطة تتضمن أسطر البداية والنهاية والمحتوى المتوقع.
يتحقق مما إذا كان محتوى الملف الفعلي يطابق الحدود المتوقعة.
إذا حدث عدم تطابق (على سبيل المثال، خطأ بمقدار واحد)، فإنه ينتقل إلى استراتيجية الاحتياط (fallback strategy): حيث يقوم بعملية "التحليل الضبابي" (fuzzifying) لسلاسل المحتوى المتوقعة ويبحث في الملف عن أفضل نطاق مطابق، ويقوم بتحديث طلب التحرير ديناميكياً قبل تطبيق التغيير.
3. المساهمات الرئيسية
إطار عمل InfantAgent-Next: وكيل عام متعدد الوسائط مفتوح المصدر، يجسّر الفجوة بين نماذج الرؤية الصرفة والنماذج القائمة على الأدوات، ويدعم مدخلات النص والصورة والصوت والفيديو.
النمطية التفصيلية: بنية مبتكرة تفصل بين التخطيط واختيار الأدوات والتنفيذ، مما يسمح للنماذج المختلفة (الاستدلال، التأسيس البصري، تحليل الصوت) بالتعاون بسلاسة ضمن سياق موحد.
آليات تنفيذ محسنة: تقديم القص الإقليمي التكراري للتفاعل عالي الدقة مع واجهات المستخدم الرسومية، والاحتياط بالبحث الضبابي لتحرير ملفات موثوق، لمعالجة أهم نمطي فشل لوكلاء الذكاء الاصطناعي الحاليين.
مجموعة أدوات مفتوحة المصدر: إصدار مجموعة من أدوات الوكيل المحسنة وبيئة تنفيذ معزولة (قائمة على الآلات الافتراضية VM) لدعم الأبحاث المستقبلية.
4. النتائج التجريبية
تم تقييم الوكيل في ثلاث اختبارات معيارية كبرى تغطي الرؤية والمنطق والمهام العامة:
OSWorld (الاستدلال البصري):
المعيار: الدقة في 369 مهمة سطح مكتب مفتوحة النهاية.
النتيجة: حقق InfantAgent-Next دقة بنسبة 35.3% (50 خطوة)، متفوقاً على Claude-Computer-Use (26.0%) بنسبة 7.27%، وتجاوز أطر العمل مفتوحة المصدر الأخرى مثل Agent-S2. وقد أظهر قدرة فائقة على ربط التعليمات اللغوية الطبيعية بعناصر واجهة المستخدم الرسومية.
SWE-Bench (الاستدلال المنطقي والأكواد):
المعيار: حل مشكلات GitHub الواقعية. * النتيجة: في الجزء الخاص بـ SWE-Bench-Verified (50 حالة)، حقق دقة بنسبة 66%، متفوقاً على العديد من الوكلاء مغلقي المصدر (مثل Amazon Q Developer Agent الذي حقق 54%). وفي SWE--Lite، حقق 31.67%، ليحتل مرتبة ضمن أفضل الوكلاء مفتوحي المصدر.
GAIA (أداء المهام العامة):
المعيار: أسئلة مفتوحة النهاية عبر ثلاثة مستويات من الصعوبة.
النتيجة: احتل InfantAgent-Next المركز الثاني بين الوكلاء مفتوحي المصدر (بمتوسط 56.97%)، متأخراً فقط عن OWL، وحقق أداءً هو الأفضل في فئته (SOTA) في أسئلة المستوى الثاني (المتوسط).
دراسات الاستئصال (Ablation Studies):
أظهرت آلية القص الإقليمي التكراري أنها تصل إلى التقارب في الدقة عند التكرار الثالث، حيث قدم التكراران الثاني والثالث أفضل توازن بين الأداء والتكلفة.
حقق منطق تحرير الملفات معدل نجاح إجمالي بنسبة 90.4% في مهام SWE-Bench، حيث نجح في إصلاح 84.3% من المحاولات الفاشلة (مثل إصلاح أخطاء الخطأ بمقدار واحد في أرقام الأسطر).
5. الأهمية
يمثل InfantAgent-Next خطوة كبيرة للأمام في مجال الوكلاء الحاسوبيين العامين. فمن خلال الابتعاد عن نهج "النموذج الواحد الذي يفعل كل شيء" أو "سلسلة الأدوات الجامدة"، يثبت أن البنية النمطية متعددة النماذج يمكن أن تحقق دقة عالية في التنفيذ (عبر التأسيس المتخصص ومنطق التحرير) وقدرة واسعة على التكيف (عبر اختيار الأدوات الديناميكي والفهم متعدد الوسائط).
يؤكد العمل على أن:
الهجنة هي المفتاح: الجمع بين قوة الاستدلال للنماذج اللغوية الكبيرة ودقة وحدات الرؤية والأدوات المتخصصة يتفوق على النماذج أحادية البنية.
التحسين التكراري فعال: التحسينات الخوارزمية البسيطة (مثل القص التكراري) يمكن أن تحل جذرياً مشكلة "الإحداثيات المهلوسة" التي تعاني منها وكلاء الرؤية.
القابلية للتوسع: الإطار قوي بما يكفي للتعامل مع سير عمل معقد متعدد الخطوات يتضمن الأكواد، وتصفح الويب، ومعالجة الملفات، مما يجعله مرشحاً قابلاً للتطبيق في مهام الأتمتة الواقعية.
إن إتاحة الكود والنماذج وسكريبتات التقييم كمصادر مفتوحة يوفر أساساً قوياً للمجتمع العلمي لمواصلة تطوير أنظمة الوكلاء متعددة الوسائط.