MinT: Managed Infrastructure for Training and Serving Millions of LLMs
تُعد MinT نظام بنية تحتية مُدارة تُمكّن من التدريب والتشغيل الفعال لملايين سياسات النماذج اللغوية الكبيرة القائمة على تقنية LoRA، وذلك عبر إبقاء نموذج أساسي ضخم واحد مقيماً في الذاكرة مع إدارة مراجعات المحولات خفيفة الوزن ديناميكياً، مما يحقق تحسينات كبيرة في قابلية التوسع، وكفاءة الذاكرة، وسرعة النشر عبر البنى الكثيفة وبنى الخبراء (MoE).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير مكتبة ضخمة وباهظة الثمن للغاية من الكتب (هذا هو النموذج الأساسي - Base Model). هذه الكتب ضخمة، تشغل غرفة كاملة، ومن الصعب جداً تحريكها.
في الطريقة القديمة، إذا أردت تعليم كتابٍ ما مهارة جديدة — مثل حل المسائل الرياضية أو كتابة العقود القانونية — كان عليك تصوير الكتاب بأكمله، وكتابة الملاحظات الجديدة في الهوامش، ثم نقل تلك النسخة الجديدة الثقيلة بالكامل إلى غرفة أخرى لعرضها على الناس. إذا أردت تعليم الكتاب 1,000 مهارة مختلفة، فستحتاج إلى 1,000 نسخة ثقية من الكتاب، مما يستهلك مساحة هائلة من الوقت والمكان لنقلها.
MinT (MindLab Toolkit) يغير قواعد اللعبة. فبدلاً من تحريك الكتاب بأكمله، يقول MinT: "دعونا نترك الكتاب الثقيل في مكانه، مغلقاً داخل المكتبة. سنقوم فقط بكتابة المهارات الجديدة على قصاصات ورقية صغيرة وخفيفة الوزن (تسمى LoRA adapters)."
إليك كيف يعمل MinT، مقسماً إلى ثلاث أفكاء بسيطة:
1. نظام "القصاصات الورقية" (تقليص الحجم - Scale Down)
بدلاً من نقل موسوعة تزن 100 رطل، أنت تنقل فقط قصاصة ورقية تزن أونصة واحدة.
- الطريقة القديمة: لتحديث نموذج ما، يجب عليك دمج الملاحظات مرة أخرى في الكتاب، مما ينتج عنه ملف جديد ثقيل. هذا يستغرق وقتاً طويلاً جداً للحفظ والنقل.
- طريقة MinT: تبقي الكتاب الثقيل (النموذج الأساسي) مستقراً في ذاكرة الكمبيوتر. وعندما تتعلم مهارة جديدة، تقوم فقط بحفظ القصاصة الورقية الصغيرة.
- النتيجة: نقل "التحديث" سريع للغاية. وجدت الورقة البحثية أن نقل مجرد القصاصة الورقية كان أسرع بـ 18 مرة لنموذج متوسط الحجم وأسرع بـ 3 مرات تقريباً لنموذج ضخم، مقارنة بنقل الكتاب بأكمله. الأمر يشبه إرسال رسالة نصية بدلاً من إرسال طوبة بالبريد.
2. "محطات التبديل" (زيادة السعة - Scale Up)
تخيل أن لديك آلة ضخمة ومعقدة (حاسوب فائق) لا يمكنها استيعاب سوى كتاب ثقيل واحد في كل مرة.
- المشكلة: عادةً، إذا أردت تدريب 5 نسخ مختلفة من سياسة معينة (مثل: واحدة للرياضيات، واحدة للبرمجة، واحدة للقانون)، فستحتاج إلى 5 أجهزة مختلفة، كل منها يحمل نسخة من الكتاب الثقيل. هذا هدر للمال.
- حل MinT: يعمل MinT كلوحة تحويل ذكية. فهو يبقي الكتاب الثقيل محملاً في الجهاز. وعندما يحين وقت تدريب نسخة "الرياضيات"، يقوم باستبدال القصاصة الورقية الخاصة بالرياضيات. وعندما يحين وقت "البرمجة"، يقوم بإخراج ملاحظة البرمجة ووضع ملاحظة "الرياضيات" مكانها.
- النتيجة: يمكنك تدريب العديد من "السياسات" المختلفة على نفس الجهاز دون الحاجة إلى المزيد من أجهزة الكمبيوتر. أظهرت الورقة البحثية أن هذا جعل التدريب أسرع بمقدار 1.77 مرة لنموذج بـ 4 مليارات معلمة (parameter)، وأسرع بمقدار 1.45 مرة لنموذج بـ 30 مليار معلمة، وكل ذلك دون الحاجة إلى ذاكرة إضافية.
3. "الكتالوج الذكي" (التوسع الخارجي - Scale Out)
تخيل مكتبة بها مليون قصاصة ورقية مختلفة، لكن مكتب القراءة الخاص بك يتسع لعدد قليل منها فقط في كل مرة.
- المشكلة: إذا طلب مستخدم قصاصة معينة، ولم تكن موجودة على المكتب، فعليك الذهاب إلى غرفة التخزين، والعثور عليها، وإحضارها. إذا طلب 1,000 شخص 1,000 قصاصة مختلفة في وقت واحد، فستزدحم غرفة التخزين، وسينتظر الجميع في طابور طويل.
- حل MinT: ينظم MinT هذا الأمر مثل خدمة توصيل ذكية.
- الكتالوج (Catalog): يمكنه تتبع مليون قصاصة ورقية (سياسة) مختلفة.
- الذاكرة المؤقتة (Cache): يحتفظ بالقصاصات الأكثر شيوعاً على رف قريب من المكتب (ذاكرة CPU cache) لتكون جاهزة فوراً.
- خدعة "التعبئة" (Packing): في بعض الأحيان، تتكون القصاصة الورقية من آلاف القطع الصغيرة جداً (مثل قطع الأحجية/البازل). يقوم MinT بلصق هذه القطع معاً في حزمة واحدة مرتبة قبل إرسالها إلى المكتب. هذا يجعل عملية التوصيل أسرع بـ 8.5 مرة لأن شاحنة التوصيل لن تضطر للتوقف 37,000 مرة لالتقاط قطع الأحجية الصغيرة؛ بل ستلتقط صندوقاً واحداً فقط.
الصورة الكبيرة
MinT هو في الأساس مدير لتدريب الذكاء الاصطناعي. فهو يمنعك من إضاعة الوقت والمال عبر تحريك الملفات الضخمة ذهاباً وإياباً. بدلاً من ذلك، يبقي "العقل" الثقيل (النموذج الأساسي) في مكان واحد، ويدير آلاف "المهارات" الصغيرة (المحولات/Adapters) التي يمكن إلحاقها به.
- بالنسبة للتدريب: يتيح لك التبديل بين المهارات المختلفة بسرعة دون الحاجة لإعادة تحميل "العقل" بالكامل.
- بالنسبة للخدمة (Serving): يتيح لك تقديم ملايين المهارات المختلفة للمستخدمين، مع تحميل المهارات المحددة المطلوبة في تلك اللحظة بالضبط فقط، والقيام بذلك بطريقة لا تسبب ازدحاماً في النظام.
باخت️صر: لا تحرك الفيل؛ بل حرك الفأر فقط. يجعل MinT من الممكن تشغيل ملايين الشخصيات المختلفة للذكاء الاصطناعي على أساس مشترك ومكلف دون أن يضطر هذا الأساس للتحرك أبداً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.