← أحدث الأبحاث
💬 NLP

FlowBot: Inducing LLM Workflows with Bilevel Optimization and Textual Gradients

تقدم هذه الورقة FlowBot، وهو إطار عمل قائم على البيانات يقوم تلقائياً باستنتاج وتحسين سير عمل النماذج اللغوية الكبيرة (LLM) من خلال صياغة العملية كمسألة تحسين ثنائي المستوى تُحل عبر تدرجات نصية نمطية، محققاً أداءً منافساً للنماذج المرجعية المصممة بشرياً.

المؤلفون الأصليون: Hongyeon Yu, Young-Bum Kim, Yoon Kim

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hongyeon Yu, Young-Bum Kim, Yoon Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم فريق من الروبوتات المتخصصة كيفية حل لغز صعب للغاية. في الماضي، كان على البشر الجلوس وكتابة دليل تعليمات صارم لكل روبوت يدوياً، وتحديد الترتيب الذي يجب أن يعملوا به والكلمات المحددة التي يجب أن يقولها كل منهم لزميله. هذا الأمر بطيء، ومكلف، ويصعب توسيع نطاقه.

تقدم هذه الورقة البحثية FLOWBOT، وهي طريقة جديدة تسمح للروبوتات بتعليم نفسها كيفية تنظيم التواصل فيما بينها، دون الحاجة إلى كتابة إنسان لدليل التعليمات أولاً.

إليك كيف يعمل ذلك، باستخدام تشبيه بسيط:

نظام التدريب ذو المستويين

فكر في FLOWBOT كمنظومة تدريب تتكون من مستويين: مدرب رئيسي ومدرب مركز.

1. المدرب الرئيسي (الحلقة الخارجية): "إصلاح خطة اللعب"
ينظر المدرب الرئيسي إلى الصورة الكبيرة. هو لا يهتم بالكلمات المحددة التي يقولها اللاعب، بل يهتم بـ بنية اللعبة.

  • المشكلة: ربما يحاول الفريق حل مسألة رياضية عن طريق محاولة رسم صورة أولاً، وهذا ترتيب خاطئ. أو ربما يفتقدون خطوة كاملة، مثل "التحقق من النتيجة".
  • الحل: ينظر المدرب الرئيسي إلى مكان فشل الفريق ويقول: "حسناً، نحتاج إلى إضافة خطوة للتحقق من النتيجة قبل محاولة رسم الصورة"، أو "لنقم بإزالة خطوة الرسم تماماً".
  • في الورقة البحثية: هذه هي الحلقة الخارجية (Outer Loop). إنها تعمل على تحسين "مخطط سير العمل" (workflow sketch). فهي تقرر عدد الخطوات، والترتيب الذي تحدث به، وما إذا كان سيتم إضافة أو إزالة أدوات (مثل محركات البحث).

2. مدرب المركز (الحلقة الداخلية): "تحسين كتيب التعليمات"
بمجرد أن يضع المدرب الرئيسي خطة اللعب، يعمل مدرب المركز مع اللاعبين الأفراد (نداءات نماذج اللغة الكبيرة - LLM calls) لإتقان تعليماتهم الخاصة.

  • المشكلة: اللاعب يعرف ماذا يفعل (مثلاً: "ابحث عن الحقائق")، لكنه يؤدي المهمة بشكل سيء. ربما يهلوس (يختلق معلومات) أو يغفل عن تفصيل رئيسي.
  • الحل: بدلاً من الاكتفاء بالقول "افعل الأفضل"، يستخدم مدرب المركز حيلة خاصة تسمى التدرجات النصية (Textual Gradients).
    • تخيل أن الإجابة النهائية خاطئة. يسأل مدرب المركز حكماً ذكياً (AI judge): "لماذا حدث هذا؟"
    • يقدم الحكم تعليقاً نصياً: "لقد ارتكبت خطأً لأنك لم تتحقق من مصدرك."
    • يتم تمرير هذا التعليقبشكل عكسي إلى اللاعب السابق، الذي يقول: "أوه، يجب أن أتأكد من أن مصدري واضح للشخص التالي."
    • يستمر هذا المسار نزولاً حتى نصل إلى أول لاعب.
  • في الورقة البحثية: هذه هي الحلقة الداخلية (Inner Loop). وهي تستخدم "الانتشار العكسي النصي" (Textual Backpropagation). تماماً كما تستخدم الشبكة العصبية الرياضيات لتعديل الأرقام، يستخدم FLOWBOT التغذية الراجعة باللغة الطبيعية لتعديل النصوص الإرشادية (prompts) لكل خطوة.

سحر "التدرج النصي"

في علوم الحاسوب التقليدية، إذا كانت عملية حسابية خاطئة، يستخدم الكمبيوتر الرياضيات لمعرفة مقدار تعديل الأرقام بالضبط لإصلاحها. تسمى هذه العملية "الانتشار العكسي" (backpropagation).

لكن نماذج اللغة الكبيرة (LLMs) لا تفهم الرياضيات بنفس الطريقة؛ فهي تفهم اللغة. لذا، ابتكر FLOWBOT التدرجات النصية.

  • بدلاً من رقم مثل +0.5، يحصل النظام على جملة مثل: "كانت إجابتك خاطئة لأنك افترضت (س)، ولكن الأدلة تظهر (ص). يرجى التحقق من مصادرك في المرة القادمة."
  • يقوم النظام بتمرير هذه الجملة عكسياً عبر سلسلة الروبوتات. يقرأ كل روبوت التغذية الراجعة، ويفهم ما حدث خطأ في الخطوات التي تلتهم، ويعيد كتابة تعليماته الخاصة لمنع وقوع هذا الخطأ في المستقبل.

ماذا وجدوا؟

اختبر الباحثون FLOWBOT في مهام عديدة، مثل الإجابة على أسئلة عامة معقدة، وكتابة الأكواد البرمجية، واتباع تعليمات صارمة.

  • يعمل من الصفر: على عكس الطرق الأخرى التي تحتاج إلى إنسان ليعطيها خطة بداية جيدة، يمكن لـ FLOWBOT البدء من لوحة فارغة واكتشاف أفضل سير عمل بنفسه.
  • يتفوق على المنافسين: لقد حقق أداءً يضاهي (أو يتفوق على) الأنظمة التي يقضي فيها البشر وقتاً طويلاً في صياغة سير عمل مثالي يدوياً.
  • يوفر المال: نظرًا لأنه يتعلم بكفاءة عالية، فإنه يتطلب عددًا أقل من "نداءات الواجهة البرمجية" (API calls) - والتي تكلف مالاً - للوصة إلى الحل الصحيح مقارنة بالطرق الآلية الأخرى.

الخلاصة

FLOWBOT يشبه خط تجميع ذاتي التحسين. فهو لا يكتفي فقط بتعديل تعليمات الآلات، بل يعيد أيضاً تنظيم ترتيب الآلات نفسها. ومن خلال استخدام التغذية الراجعة باللغة الطبيعية لـ "الانتشار العكسي" للأخطاء، فإنه يكتشف تلقائياً أفضل طريقة لتنظيم فريق من نماذج الذكاء الاصطناي لحل المشكلات المعقدة، مما يلغي الحاجة إلى وجود البشر كمهندسين لكل سير عمل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →