Internalizing Tool Knowledge in Small Language Models via QLoRA Fine-Tuning
تُثبت هذه الورقة أن الضبط الدقيق باستخدام تقنية QLoRA الموفرة للمعلمات يمكنه استيعاب معرفة الأدوات داخل النماذج اللغوية الصغيرة، مما يمكّنها من التفوق على النماذج المرجعية الأكبر والأكثر اعتماداً على الوصف في تخطيط الأدوات، مع تقليل عبء الاستدلال واستهلاك الرموز بشكل كبير.
إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.
الفكرة الكبرى: تعليم الروبوت حفظ صندوق أدواته
تخيل أنك تقوم بتعيين مساعد ذكي لإصلاح آلة معقدة. هذه الآلة تحتوي على صندوق أدوات ضخم يضم 23 أداة مختلفة (مثل المستشعرات، وأطقم الإصلاح، وأجهزة الفحص التشخيصي).
الطريقة القديمة (المشكلة): في كل مرة تسأل فيها المساعد سؤالاً، يتعين عليك تسليمه دليلاً إرشادياً ضخماً يتكون من 2,200 كلمة، يسرد كل أداة وكيفية عملها والأزرار التي يجب الضغط عليها.
المشكلة: يشعر المساعد بالارتباك بسبب هذا الدليل. فهو يقضي وقتاً طويلاً جداً في قراءة قائمة الأدوات لدرجة أنه ينسى الإجابة على سؤالك فعلياً. أيضاً، إذا أردت استخدام مساعد "أصغر" (أقل تكلفة)، فلن يتمكن من التعامل مع دليل ضخم كهذا على الإطلاق. الأمر يشبه محاولة وضع مكتبة كاملة في حقيبة ظهر فقط للعثين على مفك براغي واحد.
الطريقة الجديدة (الحل): بدلاً من تسليم الدليل في كل مرة، أنت تعطي المساعد دورة تدريبية مكثفة. أنت تدربه حتى يحفظ صندوق الأدوات بالكامل وكيفية استخدامه.
النتيجة: الآن، عندما تسأل سؤالاً، لا تحتاج إلى الدليل. المساعد يعرف بالفعل أي أداة سيأخذ وكيف يستخدمها. يمكنه الإجابة بشكل أسرع، واستهلاك طاقة أقل، ويمكن للمساعدين "الأصغر" القيام بالمهمة بنفس كفاءة المساعدين الكبار.
كيف فعلوا ذلك (طريقة "QLoRA")
استخدم الباحثون تقنية تسمى ضبط QLoRA الدقيق. فكر في هذا الأمر كأنك تعطي المساعد مجموعة من الملاحظات اللاصقة (المهايئات/Adapters) لتلصقها على دماغه، بدلاً من إعادة كتابة دماغه بالكامل.
أخذوا نموذجين صغيرين مفتوحي المصدر (اسمهما Gemma و Qwen، وكلاهما بحجم تطبيق هاتف ذكي قياسي).
غدّوا النماذج بنحو 1,700 مثال من الأسئلة و"خطط الأدوات" الصحيحة لحلها.
تعلمت النماذج استيعاب معرفة الأدوات داخلياً، ونقلها من "الدليل الخارجي" إلى "ذاكرتها الداخلية".
النتائج: السرعة مقابل الذاكرة
اختبر الباحثون هذه النماذج المدربة مقابل "الطريقة القديمة" (حيث كان الدليل لا يزال مرفقاً).
توفير هائل: من خلال إزالة الدليل، خفضوا كمية المعلومات التي يتعين على الكمبيوتر معالجتها بنسبة 82.6%. الأمر يشبه الانتقال من قراءة رواية إلى قراءة رسالة نصية قصيرة.
أداء أفضل: للمفاجأة، كانت النماذج التي لم تملك الدليل تؤدي وظيفة أفضل في التخطيط من تلك التي كانت تملكه.
لماذا؟ عندما كان الدليل موجوداً، كان يزاحم السؤال الفعلي. بدون الدليل، استطاع النموذج التركيز بنسبة 100% على مشكلتك المحددة.
النموذجين:
Gemma: قام بأفضل مهمة تخطيط (حقق أعلى الدرجات)، لكنه كان أبطأ قليلاً واستخدم ذاكرة كمبيوتر أكثر.
Qwen: كان أسرع بـ 2.5 مرة واستخدم ذاكرة أقل بنسبة 62% من Gemma. كان جيداً جداً في التخطيط أيضاً، مما يجعله خياراً فعالاً للغاية.
الفخ: مقايضة "النسيان"
هناك جانب سلبي لهذا التدريب المكثف. فعندما تجبر النموذج على حفظ مجموعة محددة من الأدوات بدقة شديدة، فإنه أحياناً ينسى أشياء أخرى كان يعرفها سابقاً.
التشبيه: تخيل طالباً يدرس بجد شديد لامتحان رياضيات معين لدرجة أنه ينسى كيف يتحدث لغته الأم أو يحل الألغاز المنطقية البسيطة.
النتائج:
Gemma: نسي القليل من معرفته العامة (احتفظ بنحو 80% من ذكائه القديم).
Qwen: نسي الكثير (احتفظ بنحو 61% فقط من ذكائه القديم).
الإصلاح: وجد الباحثون "مقبضاً" يمكنهم تدويره (يسمى LoRA rank).
إذا قمت بتدوير المقبض إلى درجة عالية، يصبح النموذج بارعاً في التخطيط ولكنه ينسى المزيد من المعرفة العامة.
إذا قمت بتدوير المقبض إلى درجة منخفضة، يظل النموذج أقل مثالية في التخطيط ولكنه يتذكر الكثير من معرفته العامة.
ملخص ادعاءات الورقة البحثية
لا تحتاج إلى الدليل: يمكن تدريب نماذج الذكاء الاصطناعي الصغيرة على "معرفة" أدواتها دون الحاجة لكتابة أوصاف الأدوات في كل طلب (Prompt).
إنه أسرع وأرخص: إزالة أوصاف الأدوات يوفر قدراً هائلاً من وقت الكمبيوتر والمال.
إنه يعمل بشكل أفضل: في هذا الاختبار المحدد، تفوقت النماذج التي حفظت الأدوات على النماذج التي كانت تقرأ الدليل فقط.
هناك مقايضة: جعل النموذج مخططاً أفضل يمكن أن يجعله ينسى بعض معرفته العامة، ولكن يمكنك ضبط التدريب لموازنة ذلك.
ما لا تدعيه الورقة البحثية:
هي لا تقول إن هذا يعمل لكل الأدوات الممكنة في العالم (لقد نجح ذلك فقط مع مجموعة ثابتة مكونة من 23 أداة).
لا تدعي أن النماذج أصبحت مثالية في إجراء عمليات الإصلاح الفعلية (هي جيدة في التخطيط للإصلاحات).
لا تقترح أن هذا جاهز للاستخدام الطبي أو الاستخدامات الحيوية المنقذة للحياة بعد؛ إنها مجرد إثبات لمفهوم (Proof-of-concept) لصيانة الأصول الصناعية.
ملخص تقني: استيعاب معرفة الأدوات في النماذج اللغوية الصغيرة عبر الضبط الدقيق باستخدام QLoRA
بيان المشكلة
تواجه الأنظمة الوكيلة (agentic systems) الحالية التي تعتمد على النماذج اللغوية الكبيرة (LLMs) لتخطيط استخدام الأدوات عدم كفاءة كبيرة. تتطلب مسارات العمل القياسية تضمين مخططات الأدوات الكاملة (الأوصاف، وتواقيع الوسائط، وأنواع القيم المرتجعة) في كل مطالبة (prompt). وهذا يخلق عبئاً هائلاً في عدد الرموز (tokens) — حيث يشكل ما يصل إلى 82.6% من رموز الإدخات في الإعداد النهائي الذي وضعه المؤلفون — ويجبر النظام على الاعتماد على نماذج ضخمة ومكلفة. غالباً ما تفشل النماذج الأصغر (2-5 مليار بارامتر) في تنفيذ تخطيط موثوق للأدوات دون هذه المطالبات المكثفة، مما يحد من عمليتها في البيئات ذات الموارد المحدودة. التحدي الجوهري هو ما إذا كان بإمكان نموذج لغوي صغير استيعاب كتالوج أدوات ثابت من خلال الضبط الدقيق الفعال للمعلمات، مما يتيح "الاستدلال الخالي من الوصف" حيث يقوم النموذج بتوليد خطط مهيكلة دون الحاجة لوصف صريح للأدوات أثناء وقت التشغيل.
المنهجية
يقترح المؤلفون مسار عمل للضبط الدقيق الخاضع للإشراف باستخدام QLoRA (التكيف منخفض الرتبة المكمم) لنقل معرفة استخدام الأدوات من سياق المطالبة إلى أوزان النموذج.
الاختبار والبيانات: تستخدم الدراسة AssetOpsBench، وهو اختبار مرجعي لعمليات الأصول الصناعية يحتوي على 152 سيناريو تم إنشاؤها بشرياً. تم بناء مجموعة بيانات التدريب (~1,741 مثالاً) باستخدام النموذج المعلم Gemini 2.5 Flash. تتضمن البيانات ثلاثة أنواع من الأمثلة:
معرفة الأداة/الوكيل: تعليم الارتباطات بين الوكيل والأداة، ومخططات الوسائط، والتمييز بين الأدوات المتشابهة.
السؤال إلى الخطة: ربط الاستعلامات باللغة الطبيعية بخطط تنفيذ مهيكلة (المهمة/الوكيل/الأداة/الوسائط/التبعيات).
النماذج: تم تقييم نموذجين مفتوحي المصدر مضبوطين للتعليم: Gemma 4 E4B (4.5 مليار بارامتر نشط) و Qwen3-4B (4.0 مليار بارامتر).
تكوين التدريب: تم ضبط كلا النموذجين باستخدام 8-bit QLoRA على وحدة معالجة رسومات واحدة من نوع A100. استخدم التكوين الأساسي رتبة LoRA (r) تبلغ 32، و α=64، ومعدل تعلم قدره 2×10−4.
بروتوكول التقييم:
إعدادات الاستدلال: تم اختبار النماذج تحت ثلاثة ظروف: (1) المُطلع (وجود أوصاف كاملة للأدوات في المطالبة)، (2) الأساس الخالي من الوصف (لا توجد أوصاف للأدوات، غير مضبوط بدقة)، و (3) المضبوط بدقة والخالي من الوصف (لا توجد أوصاف للأدوات، مضبوط بدقة).
المقاييس: تم قياس الأداء عبر مقاييس هيكلية (AT-F1 لاختيار الوكيل/الأداة، و ArgKey-F1) وجودة دلالية عبر تقييم LLM-as-judge (باستما استخدام Gemini 2.5 Flash) على ستة أبعاد (الصحة، التوجيه، الاختيار، الوسائط، الكفاءة، التبعيات).
تحليل النسيان: تم تقييم النسيان الكارثي باستخدام 100 سؤال من نوع الاختيار من متعدد من MMLU و ARC-Challenge و HellaSwag.
المساهمات الرئيسية
صياغة التخطيط الخالي من الوصف: تحدد الورقة إعداداً يجب فيه على النموذج توليد خطط استخدام أدوات مهيكلة وصحيحة لكتالوج ثابت دون تلقي أوصاف للأدوات في وقت الاستدلال.
إثبات الاستيعاب: يظهر المؤلفون أن الضبط الدقيق باستخدام QLoRA على حوالي 1,700 مثال يمكن نماذج بـ 4 مليارات بارامتر من التفوق على "الأساس المُطلع" (الذي يتضمن مخططات الأدوات الكاملة) في كل من الدقة الهيكلية ودرجات التخطيط الدلالي، رغم حذف أوصاف الأدوات تماماً.
المقارنة المعمارية: يكشف التحليل المقارن بين Gemma 4 E4B و Qwen3-4B أن Qwen3 يحقق جودة تخطيط مماثلة مع ذاكرة أقل بنسبة 62% واستدلال أسرع بمقدار 2.5 ضعف، رغم أنه يظهر نسياناً كارثياً أعلى.
المفاضلة بين الجودة والاحتفاظ: تقيس الدراسة المفاضلة بين جودة التخطيط والاحتفاظ بالمعرفة العامة، حيث تظهر أن رتب LoRA الأصغر (r=8) تحافظ على المزيد من المعرفة العامة مع حد أدنى من الخسارة في الجودة مقارنة بالرتبة المثلى للجودة (r=32).
توصيف المسار (Pipeline Profiling): قام المؤلفون بتوصيف مسار التدريب والاستدلال، وحددوا عملية ضرب المصفوفات 8-bit (MatMul8bitLt) كعنق زجاجة سائد في CUDA (بنسبة 56.3% من الوقت) وقدروا التكلفة الإجمالية للتجربة بحوالي 62 دولاراً.
النتائج التجريبية
مكاسب الأداء: حقق أفضل نموذج Gemma مضبوط بدقة AT-F1 قدره 0.65 و درجة تقييم LLM تبلغ 3.88، متفوقاً على الأساس المُطلع (AT-F1 0.47، وتقييم 2.88). حقق نموذج Qwen3 المضبوط بدقة درجة تقييم قدرها 3.78.
كفاءة الرموز (Tokens): خفض الاستدلال الخالي من الوصف طول الإدخال من ~2,400 رمز إلى ~128 رمزاً، أي انخفاضاً بنسبة 82.6%.
الكفاءة: عمل نموذج Qwen3-4B أسرع بمقدار 2.5 ضعف عند الاستدلال واستخدم ذاكرة أساسية أقل بنسبة 62% من Gemma 4 E4B، مع الوصول إلى خسائر تقييم نهائية مماثلة.
تأثير رتبة LoRA: بلغت جودة التخطيط ذروتها عند r=32 (التقييم 3.88، AT-F1 0.65) وانخفضت قليلاً عند r=64. حافظت الرتب الأصغر (r=8) على المزيد من المعرفة العامة ولكنها أعطت درجات تخطيط أقل قليلاً.
النسيان الكارثي:
Gemma: احتفظ بـ 79.8% من أدائه الأساسي في اختبارات الاختيار من متعدد عند r=32.
Qwen3: احتفظ بـ 61.3% فقط من أدائه الأساسي عند r=32، مع تدهور شديد في المنطق والاستنتاج العام.
تركيبة البيانات: أدى التدريب على بيانات "الخطة فقط" (حيث تكون معرفة الأداة ضمنية في الخطة) إلى درجات أعلى (3.90) مقارنة ببيانات "الأداة + الخطة" (3.60)، مما يشير إلى أن التعلم القائم على العرض (demonstration-based learning) أكثر فعالية من حقن المعرفة التصريحية لهذه المهمة.
الأهمية والادعاءات
تدعي الورقة أنه بالنسبة لـ كتالوجات الأدوات الثابتة، يمكن للضبط الدقيق باستخدام QLoRA استيعاب معرفة الأدوات بنجاح من سياق المطالبة إلى أوزان النموذج. يوفر هذا النهج مساراً قابلاً للتطبيق لنشر نماذج أصغر وأكثر كفاءة في الأنظمة الوكيلية من خلال إلغاء العبء الإضافي للرموز الناتج عن تكرار أوصاف المخططات.
يضع المؤلفون هذا العمل كـ إثبات مفهوم يوضح أن:
النماذج الصغيرة يمكنها استيعاب مخططات الأدوات المعقدة للتفوق على النماذج الأساسية الأكبر والمزودة بالمخططات.
هناك مفاضلة قابلة للضبط بين جودة التخطيط والاحتفاظ بالمعرفة العامة عبر اختيار رتبة LoRA.
النهج متاح حاسوبياً (تكلفة منخفضة، تدريب على وحدة معالجة رسومات واحدة).
تظل الورقة متواضعة فيما يتعلق بالتعميم، حيث تشير إلى أن النتائج خاصة بنطاق AssetOpsBench ومجموعة ثابتة من الأدوات. وهي تقر بالقيود المتعلقة بالقوة الإحصائية (تشغيل بذرة واحدة فقط، مجموعة اختبار صغيرة محجوزة) ولا تدعي أن الطريقة تعمم على أدوات غير مرئية أو كتالوجات ديناميكية دون مزيد من التدريب. تكمن الأهمية الأساسية في القدرة على تقليل زمن انتقال الاستدلال والتكاليف التشغيلية في تدفقات العمل الصناعية الوكيلية من خلال استيعاب معرفة الأدوات.