LBM: Hierarchical Large Auto-Bidding Model via Reasoning and Acting
تقترح هذه الورقة نموذج LBM، وهو نموذج مزاد تلقائي كبير هرمي يدمج وحدة LLM-Think القائمة على الاستنتاج مع وحدة LBM-Act لتوليد الإجراءات، مستفيداً من آلية تضمين مزدوجة والضبط الدقيق للتعلم التعزيزي غير المتصل بالإنترنت (GQPO) للتغلب على الهلوسة وتحسين أداء المزايدة في مزادات الإعلانات الديناميكية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير كشك ليمون ضخم وعالي المخاطر في مدينة يمر بها ملايين الأشخاص يوميًا. لديك ميزانية محدودة من الليمون والسكر، وتريد بيع أكبر عدد ممكن من الأكواب دون إنفاق أكثر مما يمكنك تحمله.
في الماضي، كنت توظف مديرًا بشريًا لمراقبة الحشود وتعديل أسعارك كل بضع دقائق. ولكن الآن، أصبحت المدينة ضخمة جدًا والمنافسة شرسة للغاية، لدرجة أن البشر لا يمكنهم الاستجابة بالسرعة الكافية أو رؤية جميع الأنماط. لذا، قمت ببناء مدير آلي (روبوت).
المشكلة في الروبوتات الحالية
الروبوتات التي نمتلكها اليوم (القائمة على "التعلم التعزيزي" التقليدي) تشبه الطلاب الذين يتعلمون فقط عن طريق حفظ كتاب مدرسي للمبيعات الماضية. هم جيدون في اتباع الأنماط التي رأوها من قبل، لكنهم عبارة عن "صناديق سوداء". إذا حدث موقف غريب — مثل عاصفة مطرية مفاجئة أو مرور شخصية مشهورة — فقد يصابون بالذعر ويتخذون قرارًا سخيفًا، مثل رفع الأسعار في حين يجب خفضها. هم لا "يفهمون" لماذا يفعلون ما يفعلونه؛ هم فقط يخمنون بناءً على الرياضيات.
الحل الجديد: LBM (الـ "مفكر" والـ "منفذ")
يقترح مؤلفو هذه الورقة نوعًا جديدًا من مديري الروبوتات يسمى LBM (نموذج المزايدة الآلي الضخم). بدلًا من روبوت واحد يحاول القيام بكل شيء، قاموا بتقسيم المهمة إلى دورين متميزين، مثل الجنرال والجندي.
1. الجنرال: LBM-Think (المُفكّر)
تخيل جنرالًا حكيمًا يجلس في مركز قيادة مع خريطة للمدينة بأكملها.
- ماذا يفعل: هو لا يلمس الليمون. بدلاً من ذلك، ينظر إلى التاريخ: "لقد أنفقنا الكثير من المال بالأمس"، أو "الزحام كبير جدًا الآن".
- القوة الخارقة: هذا الجنرال مدعوم بـ نموذج لغوي كبير (LLM). فكر في هذا الأمر كأنه مستشار فائق الذكاء قرأ ملايين الكتب التجارية، والمقالات الإخبارية، وأدلة الاستراتيجية. يمكنه "التفكير" بلغة بشرية بسيطة.
- المخرج: يكتب الجنرال مذكرة قصيرة (تسمى سلسلة الأفكام - Chain-of-Thought) تقول: "مهلاً، الحشد يتضاءل، ولدينا ميزانية كافية متبقية. يجب أن نخفض أسعارنا قليلاً لجذب المزيد من الناس، لكن لا تنخفض كثيرًا حتى لا نخسر المال."
- لماذا يهم ذلك: لأن هذا الجنرال يمكنه التفكير باللغة، فهو يفهم السياق. هو يعرف أن "المطر" يعني "عددًا أقل من الناس"، وهو أمر قد يفتقده روبوت الرياضيات البحتة.
2. الجندي: LBM-Act (المنفذ)
الآن، تخيل جنديًا مدربًا تدريبًا عاليًا على الأرض، ممسكًا بلوحة الأسعار.
- ماذا يفعل: يتلقى مذكرة الجنرال و البيانات الحية من الشارع (كم عدد الأشخاص الذين يمرون الآن، وكم من المال تبقى في الصندوق).
- التحدي: يحتاج الجندي إلى تحديد السعر بدقة (على سبيل المثال $2.43، وليس مجرد "رخيص" أو "غالٍ"). إذا أخطأ في الحساب ولو بسنت واحد، فقد يخسر عملية البيع.
- الابتكار: قدمت الورقة تقنية خاصة تسمى "التمثيل المزدوج" (Dual Embedding). تخيل أن الجندي يرتدي زوجين من النظارات:
- الزوج الأول يقرأ مذكرة الجنرال (اللغة).
- والزوج الآخر يقرأ الأرقام الحية (الرياضيات).
يرتدي الجندي كلا الزوجين في وقت واحد، ليدمج حكمة النص مع دقة الأرقام لتحديد السعر المثالي.
التدريب: كيف يتعلمون؟
لا يمكنك ترك هذه الروبوتات تجرب في كشك الليمون الحقيقي الخاص بك؛ فإذا ارتكبوا خطأً، ستخسر المال. لذا، قام المؤلفون بتدريبهم بطريقة خاصة:
- المرحلة الأولى (التوجيه اللغوي): علموا الجندي (LBM-Act) كيف يستمع إلى الجنرال. عرضوا عليهم آلاف الأمثلة حيث قدم الجنرال نصيحة، وتعلم الجندي كيفية ترجمة تلك النصيحة إلى السعر المثالي.
- المرحلة الثانية (لعبة "ماذا لو"): هذا هو الجزء الذكي. تم استخدام تقنية تسمى GQPO. تخيل أن الجنرال يُطلب منه كتابة ثلاث مذكرات مختلفة لنفس الموقف.
- مذكرة (أ): "ارفع الأسعار".
- مذكرة (ب): "اخفض الأسعار".
- مذكرة (ج): "حافظ على الأسعار كما هي".
ثم يقوم النظام بمحاكاة ما سيحدث إذا اتبع الجندي كل مذكرة. يقوم بحساب "درجة" لكل منها. إذا أدت المذكرة (ب) إلى أكبر عدد من المبيعات، يخبر النظام الجنرال: "عمل رائع في المذكرة (ب)! اكتب مثلها في المرة القادمة."
هذا يسمح للجنرال بأن يصبح أكثر ذكاءً دون أن يخاطر أبدًا بأموال حقيقية في العالم الحقيقي.
لماذا يعد هذا أمرًا مهمًا؟
- لا مزيد من حيرة "الصندوق الأسود": إذا قام الروبوت بحركة غريبة، يمكنك سؤال الجنرال: "لماذا فعلت ذلك؟" وسيشرح لك الأمر بلغة بسيطة.
- أفضل في التعامل مع المجهول: نظرًا لأن الجنرال قد "قرأ" الكثير (بفضل الـ LLM)، فإنه يستطيع التعامل مع المواقف الغريبة والجديدة بشكل أفضل من الروبوتات التي حفظت البيانات القديمة فقط.
- الدقة: يضمن الجندي تحويل النصيحة "الغامضة" من الجنرال إلى سعر مثالي من الناحية الرياضية.
باخت_صار:
تقدم الورقة فريقًا حيث يقوم جنرال ذكي ومفكر (يفهم الصورة الكبيرة ويمكنه التحدث إليك) بتوجيه جندي دقيق ومركز على الرياضيات (ينفذ الخطوات بدقة). ومن خلال تدريبهما معًا باستخدام طريقة "المحاكاة" التي لا تخاطر بأموال حقيقية، فإنهم يخلقون نظام مزايدة آلية أكثر ذكاءً، وأمانًا، وقدرة على التكيف من أي شيء امتلكناه من قبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.