Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs
تُعد SEAM وحدة برمجية خفيفة الوزن وقابلة للإضافة، تقوم بتخزين الخبرات ضمن معاملاتها الخاصة وتوليد إرشادات مهيكلة ومُحسّنة من حيث المنفعة للنماذج اللغوية الكبيرة المجمدة في تمريرة أمامية واحدة، مما يحسن أداء الاستدلال دون التأخير أو الضجيج الناتج عن الطرق التقليدية القائمة على الاسترجاع.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طاهٍ عالمي المستوى (المُنفذ - LLM Executor). أنت ماهر للغاية، لكن لديك مشكلة بسيطة: ليس لديك ذاكرة طويلة المدى. في كل مرة يدخل فيها زبون ويطلب طبقاً، عليك أن تبدأ من الصفر. حتى لو كنت قد أعددت للتو "سوفليه" معقداً قبل خمس دقائق وأدركت أنك أضفت الكثير من الملح، ففي اللحظة التي يأتي فيها الطلب التالي، ستنسى هذا الخطأ وقد تكرره مرة أخرى.
حالياً، يحاول معظم الناس مساعدة الطهاة عبر إعطائهم كتاب طهي ضخم وعلي الغبار (هذا هو RAG/Retrieval). عندما يحتاج الطاهي للمساعدة، يضطر للتوقف والتقليب بين آلاف الصفحات، بحثاً عن وصفة "تبدو" مشابهة، ثم يحاول اتباعها. هذه العملية بطيئة، وأحياناً يعطي الكتاب وصفة "تشبه إلى حد ما" الطبق، لكنها في الواقع تجعل الطبق أسوأ.
تقدم هذه الورقة البحثية نظام SEAM، وهو يغير قواعد اللعبة تماماً.
المفهوم: "مساعد الطاهي الشخصي"
بدلاً من كتاب طهي ضخم وبطيء، منح الباحثون الطاهي مساعد طاهٍ (Sous-Chef) صغيراً وسريع الاستجال بشكل خاطف (SEAM).
هذا المساعد لا يحمل مكتبة من الكتب؛ بل إنه "تعلم" عادات الطاهي الخاصة، ونقاط قوته، وأخطاءه الشائعة من خلال الممارسة. عندما يأتي طلب جديد، لا يذهب المساعد للبحث في مكتبة، بل يهمس بملاحظة سريعة ومنظمة في أذن الطاهي.
هذه الملاحظة ليست مجرد وصفة، بل هي "ورقة غش" تحتوي على ثلاثة أشياء:
- "التنبيه": "انتبه، هذا الطبق حساس جداً تجاه درجة الحرارة." (تحليل المشكلة)
- "نصيحة الخبير": "تذكر، في المرة الأخيرة التي صنعنا فيها هذا، نسينا تسخين المقلاة مسبقاً." (إبراز الخبرات)
- "خطة العمل": "أولاً التقطيع، ثم التشويح، ثم الغلي الهادئ." (الخطة المرجعية)
كيف يتعلم مساعد الطاهي (التدريب)
لم يكتفِ الباحثون بإخبار المساعد بما يجب قوله، بل استخدموا طريقة تسمى GRPO، وهي تشبه معسكراً تدريبياً عالي الكثافة.
تعمل هذه الطريقة كالتالي:
- التجربة والخطأ: يقترح المساعد ثلاث "أوراق غش" مختلفة لطبق ما.
- الاختبار: يحاول الطاهي طهي الطبق باستخدام كل ورقة غش.
- التغذية الراجعة: إذا كان طعم الطبق رائعاً، يحصل المساعد على "نجمة ذهبية". وإذا كان الطبق كارثياً، يحصل المساعد على "بطاقة حمراء".
- التطور: بمر مرور الوقت، يتعلم المساعد بالضبط أي نوع من النصائح يساعد هذا الطاهي تحديداً على النجاح.
لماذا يعد هذا أفضل؟
- أسرع: لا يوجد بحث في مكتبة؛ المساعد يتحدث فوراً.
- أذكى: النصيحة لا تعتمد على "ما يبدو مشابهاً"، بل على "ما يعمل بالفعل". إنها محسنة من أجل المنفعة، وليس مجرد التشابه.
- شخصي: يتعلم المساعد السمات الخاصة بالطاهي. إذا كان الطاهي بارعاً في التقطيع ولكنه سيء في ضبط الوقت، فإن المساعد يركز على ضبط الوقت.
- خفيف الوزن: لا يتعين عليك إعادة تدريب الطاهي الرئيسي (وهو أمر مكلف وصعب)، بل تقوم فقط بتدريب المساعد الصغير.
الخلاية
في عالم الذكاء الاصطناعي، نحاول عادةً جعل "الدماغ" (LLM) أكبر وأكبر. تقترح هذه الورقة مساراً مختلفاً: حافظ على الدماغ كما هو، ولكن أعطه مساعداً متخصصاً وذكياً يحول أخطاء الماضي إلى حكمة فورية وقابلة للتنفيذ.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.