← أحدث الأبحاث
🤖 AI

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

تقدم الورقة البحثية InfantAgent-Next، وهو وكيل عام متعدد الوسائط عالي الوحدات يدمج القدرات القائمة على الأدوات والقدرات البصرية البحتة لتمكين التفاعل الحاسوبي التعاوني خطوة بخطوة، محققاً أداءً هو الأفضل في فئته في مختلف الاختبارات المرجعية بما في ذلك OSWorld وGAIA وSWE-Bench.

المؤلفون الأصليون: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً شخصياً ذكياً جداً، ولكنه أخرق قليلاً، يدعى InfantAgent-Next.

في عالم أتمتة الحاسوب، معظم المساعدين اليوم يشبهون المتخصصين الذين يعرفون القيام بشيء واحد فقط بإتقان، أو عامّين يحاولون فعل كل شيء لكنهم غالباً ما يصابون بالارتباك.

  • بعض المساعدين يشبهون الأمناء (المكتبيين): هم بارعون في استخدام قائمة محددة من الأدوات (مثل "البحث في الويب" أو "فتح ملف")، ولكن إذا طلبت منهم النقر على زر على الشاشة لم يروه من قبل، يتجمدون لأنهم لا يملكون أداة لذلك الزر تحديداً.
  • ومساعدون آخرون يشبهون الفنانين: يمكنهم النظر إلى الشاشة و"رؤية" ما يوجد بها، لكنهم يعانون في القيام بعمليات حسابية معقدة أو كتابة الأكواد البرمجية لأنهم يحاولون القيام بكل ذلك بأعينهم فقط، دون آلة حاسبة أو محرر نصوص.

InfantAgent-Next مختلف. إنه يشبه توظيف فريق "السكين السويسري" بدلاً من شخص واحد.

كيف يعمل: فريق "العقل واليدين"

بدلاً من وجود عقل واحد ضخم يحاول فعل كل شيء، يقوم InfantAgent-Next بتفكيك كل مهمة إلى خطوات صغيرة ويرسل كل خطوة إلى الخبير الأنسب لها.

  1. المدير (المخطط): عندما تطلب منه "احفظ هذه الصفحة في الإشارات المرجعية الخاصة بي"، يقرأ نموذج "مدير" رفيع المستوى طلبك. هو لا يحاول النقر بالفأرة بنفسه، بل يقول: "حسناً، نحتاج لفتح المتصفح، وإيجاد زر الإشارات المرجعية، والنقر عليه".
  2. المتخصصون: يقوم المدير بعد ذلك باستدعاء الخبير المناسب للمهمة:
    • العين (التأسيس البصري): إذا كانت المهمة هي "انقر على الزر الأحمر"، فإن نموذج رؤية متخصص ينظر إلى الشاشة، ويجد إحداثيات البكسل الدقيقة لهذا الزر الأحمر، ويخبر النظام بمكان النقر. إنه يشبه مراقباً حاد العين يوجه رامياً معصوب العينين.
    • الآلة الحاسبة (تنفيذ الكود): إذا كانت المهمة هي "تحليل ملف إكسل هذا"، فيقوم المدير بتسليم الملف إلى خبير برمجي يكتب نصاً برمجياً (Script) للقيام بالعمليات الحسابية فوراً، بدلاً من محاولة عد الصفوف بمجرد النظر إلى الشاشة.
    • الأذن (التحليل الصوتي): إذا قمت برفع تسجيل وسألت: "ما رقم الصفحة المذكور؟"، فإن نموذجاً صوتياً متخصصاً يستمع إلى الملف ويستخرج الإجابة.
  3. الذاكرة: يحتفظ النظام بدفتر ملاحظات مشترك. في كل مرة ينهي فيها متخصص ما خطوة، يقوم بتدوينها. المتخصص التالي يقرأ ما حدث ويكمل القصة. هذا يضمن أن الفريق لن يفقد مسار الهدف.

لماذا هذا مهم (خدع "السحر")

يسلط البحث الضوء على مشكلتين رئيسيتين يحلهما هذا النظام:

  • مشكلة "النقر": العديد من وكلاء الذكاء الاصطناعي سيئون في النقر على المكان الصحيح في الشاشة. قد ينقرون على بُعد 5 بكسلات إلى اليسار ويفشلون في إصابة الزر. يستخدم InfantAgent-Next تقنية "التكبير" (Zoom-In). إذا كان بحاجة للنقر على زر، فهو لا يخمن فقط. بل يأخذ صورة للشاشة، يجد المنطقة العامة، يقص تلك المنطقة ليجعلها أكبر، يجد الزر مرة أخرى، يقصها مرة أخرى، ثم ثم ينقر. إنه كاستخدام عدسة مكبرة للعثور على إبرة في كومة قش، مما يضمن دقة النقر.
  • مشكلة "التعديل": عند تعديل ملف نصي، غالباً ما يخطئ الذكاء الاصطناعي في أرقام الأسطر (مثلاً: "غير السطر 5" بينما يجب أن يكون السطر 6). يمتلك InfantAgent-Next نظام "التحقق المزدوج". هو يقترح تغييراً، ثم ينظر إلى النص الفعلي للتحقق: "هل السطر 5 يقول فعلاً ما أعتقد أنه يقوله؟". إذا لم يكن كذلك، فإنه يعدل خطته قبل إجراء التعديل، مما يمنع الأخطاء الفوضوية.

ما يمكنه فعله (الدليل)

اختبر الباحثون هذا "الفريق من المتخصصين" مقابل وكلاء ذكاء اصطناعي رفيعي المستوى في ثلاثة أنواع من التحديات:

  1. مهام سطح المكتب في العالم الحقيقي (OSWorld): طلبوا من الوكيل القيام بأشياء مثل "تحميل ملف"، "تعديل مستند"، و"التنقل في موقع إلكتروني". تفوق InfantAgent-Next على وكيل "Claude Computer Use" الشهير بنسبة 7.27%. لقد كان أفضل في إنجاز المهمة فعلياً دون مساعدة بشرية.
  2. البرمجة وإصلاح الأخطاء (SWE-Bench): طلبوا من الوكيل إصلاح أكواد برمجية معطلة في مشاريع برمجية حقيقية. قدم أداءً يضاهي أو يتفوق على العديد من الوكلاء التجاريين المغلقين والمكلفين.
  3. المعرفة العامة والمنطق (GAIA): طرحوا أسئلة معقدة تتطلب البحث في الويب، وقراءة الملفات، والاستنتاج المنطقي. احتل InfantAgent-Next المركز الثاني بين جميع الوكلاء مفتوحي المصدر، مما يثبت قدرته على التعامل مع المنطق المعقد متعدد الخطوات.

الخلاصة

ليس InfantAgent-Next مجرد نموذج ذكاء اصطناعي واحد ضخم يحاول أن يكون كل شيء. إنه مايسترو نموذجي يعرف تماماً متى يستدعي "العين"، أو "الأذن"، أو "المبرمج"، أو "الناقر بالفأرة". ومن خلال السماح لكل متخصص بالقيام بما يبرع فيه، يصبح النظام بأكمله أكثر ذكاءً، ودقة، وقدرة على التعامل مع المهام الفوضوية التي نواجهها يومياً على حواسيبنا.

لقد جعل الباحثون الكود المصدري لهذا "الفريق من المتخصصين" متاحاً لأي شخص لاستخدامه ودراسته، آملين في المساعدة في بناء مساعدين حاسوبيين أفضل في المستقبل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →