How Many Tools Should an LLM Agent See? A Chance-Corrected Answer
تقدم هذه الورقة مقياساً مصححاً للاحتمالية يسمى "البتات فوق العشوائية" (Bits-over-Random - BoR) لتحسين عدد الأدوات المقدمة لوكلاء النماذج اللغوية الكبيرة ديناميكياً، حيث تثبت من خلال التعلم التعزيزي أن القوائم المختصرة التكيفية تحسن دقة اختيار الأدوات وتغطيتها بشكل كبير مقارنة بالنهج ثابت الحجم عبر اختبارات معيارية متنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طاهٍ (الوكيل الذكي) تحاول طهي طبق معين (الإجابة على سؤال مستخدم). لديك مخزن ضخم من المكونات (سجل الأدوات) يحتوي على آلاف المكونات (الأدوات). وقبل أن تبدأ في الطهي، يجب على مساعد الطاهي (نظام الاسترجاع) أن يقرر أي المكونات سيقدمها لك.
السؤال الكبير الذي تطرحه هذه الورقة البحثية هو: كم عدد المكونات التي يجب على مساعد الطاهي وضعها أمامك على الطاولة؟
- إذا قدم لك الكثير منها: ستشعر بالتشتت والارتباك، وقد تمسك بالتوابل الخاطئة.
- إذا قدم لك القليل منها: قد لا يتوفر لديك المكون المحدد الذي تحتاجه بالفعل، مما يؤدي إلى فشل الطبق.
معظم المطابخ اليوم تستخدم قاعدة ثابتة: "قدم للطاهي دائماً 5 مكونات بالضبط"، بغض النظر عن سهولة أو صعوبة الوصفة. تجادل هذه الورقة بأن هذه فكرة سيئة، وتقترح نظاماً أذكى وقادراً على التكيف ذاتياً.
إليك تفصيل حلهم باستخدام تشبيهات بسيطة:
1. مشكلة "القواعد الثابتة"
تخيل مكتبة حيث تحتاج إلى العثور على كتاب محدد.
- القاعدة الثابتة: أمين المكتبة يقدم لك دائماً كومة من 5 كتب.
- استعلام سهل: كنت تحتاج كتاباً عن "التفاح". قدم لك أمين المكتبة 5 كتب، وكان الكتاب الأول عن التفاح. رائع! لكنك أضعت وقتاً في قراءة الكتب الأربعة الأخرى.
- استعلام صعب: كنت تحتاج كتاباً عن "الفطريات النادرة في القرن الثامن عشر". قدم لك أمين المكتبة 5 كتب، لكن الكتاب الصحيح هو الكتاب الثاني عشر في المكتبة. تحصل على 0 من الكتب الصحيحة.
تقول الورقة إننا بحاجة إلى طريقة لقياس ما إذا كان أمين المكتبة يقوم بعمل جيد، ليس فقط من خلال عدد الكتب التي يقدمها لك، بل من خلال مدى تفوقه على مجرد اختيار الكتب بشكل عشوائي.
2. الحل: "البتات فوق العشوائية" (Bits-over-Random - BoR)
قدم المؤلفون مقياساً يسمى "البتات فوق العشوائية" (BoR). فكر في هذا كـ "درجة حظ".
- الخط المرجعي العشوائي: إذا قام أمين المكتبة بجلب الكتب عشوائياً من الرف، فما هي احتمالات حصوله على الكتاب الصحيح؟
- درجة BoR: تقيس مدى تفوق أمين المكتبة مقارنة بهذا الحظ الأعمى.
- إذا قدم لك كتاباً واحداً وكان هو الصحيح، فهذا فوز كبير (لأن فرصة الحظ العشوائي في إصابة الهدف بكتاب واحد نادرة جداً).
- إذا قدم لك 100 كتاب وكان الكتاب الصحيح من ضمنها، فهذا فوز أصغر (لأن الحظ العشوائي كان سيجد الكتاب على أي حال مع 100 محاولة).
الخدعة السحرية: تستخدم الورقة "درجة الحظ" هذه كمكافأة لروبوت تعلم (وكيل تعزيز التعلم - RL agent).
- إذا توقف الروبوت مبكراً ووجد الأداة، فإنه يحصل على مكافأة كبيرة (لأنه تغلب على الاحتمالات بسهولة).
- إذا استمر الروبوت في إضافة المزيد من الأدوات إلى القائمة، فإن المكافأة تتقلص طبيعياً (لأن العثور على الأدا في كومة ضخمة هو أمر أقل إثارة للإعجاب؛ فمن السهل أن تصيب بالحظ في هذه الحالة).
هذا يعني أن الروبوت يتعلم التوقف عن إضافة الأدوات بمجرد أن يصبح واثقاً من أنه يمتلك الأداة الصحيحة، دون الحاجة إلى إنسان يخبره: "توقف عند 5!"
3. النتائج: مساعد الطاهي الذكي
اختبر الباحثون "مساعد الطاهي الذكي" هذا مقابل "القاعدة الثابتة" (تقديم 5 أدوات دائماً) في ثلاثة مطابخ اختبارية مختلفة:
المطبخ الصغير (BFCL - 370 أداة):
- القاعدة الثابتة: تعرض دائماً 50 أداة لتكون في أمان. تجد الأداة الصحيحة بنسبة 90.8% من الوقت.
- الشيف الذكي: يعرض 7 أدوات فقط في المتوسط. ومع ذلك، يجد الأداة الصحيحة بنسبة 90.3% من الوقت.
- النتيجة: وفر الشيف الذكي مساحة هائلة من "مساحة الطاولة" (الرموز/Tokens) مع عدم وجود أي خسارة تذكر في النجاح.
المستودع العملاق (ToolBench - 3,251 أداة):
- القاعدة الثابتة: تعرض دائماً 5 أدوات. تجد الأداة الصحيحة بنسبة 64.7% من الوقت.
- الشيف الذكي: يعرض حوالي 4.4 أداة في المتوسط. يجد الأداة الصحيحة بنسبة 61.9% من الوقت.
- التحول المفاجئ: في الأسئلة الصعبة حقاً (حيث تكون الأداة الصحيحة مدفونة بعمق في المستودع)، تجد القاعدة الثابتة 0% من تلك الأدوات. أما الشيف الذكي، فبإدراكه أن الأدوات الأولى لم تكن تعمل، فإنه يبحث بعمق أكبر قليلاً (يعرض 5.7 أداة) ويجد 16.7% من تلك الأسئلة الصعبة. بينما تستسلم القاعدة الثابتة مبكراً.
4. لماذا "الأقل هو الأكثر" (تأثير "الزحام")
اختبرت الورقة أيضاً ما يحدث عندما يحاول الذكاء الاصطناعي فعلياً اختيار الأداة.
- النتيجة: عندما يُعرض على الذكاء الاصطنا الاصطناعي قائمة ضخمة من الأدوات (مثل 50)، فإنه يصاب بالارتباك ويختار الأداة الخاطئة بشكل متكرر.
- التشبيه: إذا سألت صديقاً، "أي من هذه الصور الـ 50 هي لكلبي؟" فقد يخمن خطأً بسبب كثرة الخيارات. إذا عرضت عليه صورتين فقط، فمن المرجح جداً أن يختار الصورة الصحيحة.
- الدليل: عندما عرض الشيف الذكي عدداً أقل من الأدوات، اختار الذكاء الاصطنا- الاصطناعي الأداة الصحيحة بنسبة 93.1% من المرات. بينما عندما أُجبر على رؤية 5 أدوات (القاعدة الثابتة)، اختار بشكل صحيح بنسبة 87.1% فقط.
الملخص
تثبت هذه الورقة أننا لسنا بحاجة إلى رقم "واحد يناسب الجميع" لعدد الأدوات التي يجب عرضها على الذكاء الاصطناعي.
- الطريقة القديمة: "اعرض 5 أدوات". (قليلة جداً للمهام الصعبة، وكثيرة جداً للمهام السهلة).
- الطريقة الجديدة: استخدم "درجة الحظ" (BoR) لتعليم النظام التوقف عن إضافة الأدوات في اللحظة التي يمتلك فيها فرصة جيدة للنجاح.
- الفائدة: توفر قوة الحوسبة، وتقلل من ارتباك الذكاء الاصطناعي، وتساعد فعلياً الذكاء الاصطناعي في العثور على الإجابة الصحيحة في الأسئلة الصعبة التي تفشل القواعد الثابتة في حلها.
لقد بنى المؤلفون "روبوت استطلاع" بسيطاً لاختبار هذه الفكرة، وليس نظاماً كاملاً للإنتاج، لكن النتائج تشير إلى أن ترك الذكاء الاصطناعي يقرر مقدار ما ينظر إليه هو أمر أكثر ذكاءً بكثير من إجباره على النظر إلى كمية ثابتة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.