DeltaBox: Scaling Stateful AI Agents with Millisecond-Level Sandbox Checkpoint/Rollback
تقدم هذه الورقة نظام DeltaBox، وهو نظام رملي (sandbox) مبتكر يستفيد من تجريدات مستوى نظام التشغيل DeltaFS وDeltaCR لتحقيق نقاط فحص واستعادة للحالة (checkpoint and rollback) بمستوى الميلي ثانية عبر تكرار تغييرات الحالة فقط بدلاً من حالات النظام الكاملة، مما يتيح الاستكشاف عالي التردد للوكلاء المعتمدين على الذكاء الاصطناعي والمدعومين بالنماذج اللغوية الكبيرة (LLM).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تلعب لعبة فيديو معقدة للغاية حيث تحاول حل لغز صعب. أنت عبارة عن وكيل ذكاء اصطناعي، ولكي تفوز، عليك تجربة آلاف الاستراتيجيات المختلفة. أحياناً تجرب تحريك قطعة ما، ثم تكتشف أنها كانت حركة سيئة. تحتاج حينها إلى "التراجع" فوراً عن تلك الحركة وتجربة مسار مختلف.
في عالم الواقع الخاص بوكلاء البرمجة بالذكاء الاصطناعي، زر "التراجع" هذا بطيء للغاية ومرهق. فعادةً، للعودة إلى الوراء، يتعين على الكمبيوتر حفظ نسخة كاملة وضخمة من عالم اللعبة بأكمله (كل الملفات، جميع البرامج المفتوحة، والذاكرة) قبل تجربة حركة جديدة. هذا يستغرق ثوانٍ. وإذا اضطررت للقيام بذلك مئات المرات، فسيقضي الذكاء الاصطناعي وقتاً في الحفظ والتحميل أكثر مما يقضيه في التفكير الفعلي.
DeltaBox هو نظام جديد صُمم لإصلاح هذه المشكلة. إنه يعمل كـ "آلة زمن" فائقة السرعة لوكلاء الذكاء الاصطناعي، مما يسمح لهم بحفظ واستعادة حالتهم في طرفة عين (أجزاء من الثانية).
إليك كيف يعمل، باستخدام تشبيهات بسيطة:
الفكرة الجوهرية: "احفظ التغييرات فقط"
تعمل معظم الأنظمة مثل مصور فوتوغرافي يلتقط صورة كاملة لغرفة فوضوية في كل مرة تحرك فيها كتاباً واحداً. يستغرق التقاط الصورة وقتاً طويلاً، كما يستغرق إعادة الغرفة كما كانت وقتاً أطول.
أدرك DeltaBox أنه عندما تحرك كتاباً واحداً، فإن 99% من الغرفة لم يتغير. بدلاً من التقاط صورة جديدة للغرفة بأكملها، فإنه يكتفي بكتابة ملاحظة صغيرة تقول: "الكتاب انتقل من الطاولة إلى الكرسي". للعودة إلى الوراء، يكفي فقط قراءة الملاحظة وإعادة الكتاب إلى مكانه. هذه هي "الرؤية الجوهرية": لا تكرر الحالة بأكملها؛ بل كرر التغييرات فقط.
السحر المزدوج
لجعل هذا الأمر ممكناً، بنى الباحثون أداتين خاصتين (آليات على مستوى نظام التشغيل) تعملان معاً:
1. DeltaFS: نظام ملفات "الكعكة متعددة الطبقات"
تخيل أن ملفات جهاز الكمبيوتر الخاص بك هي كعكة متعددة الطبقات.
- الطريقة التقليدية: إذا أردت حفظ حالة الكعكة، عليك نسخ الكعكة بأكملها ووضعها في صندوق جديد. إذا أردت العودة، عليك رمي الكعكة الحالية وإحضار الصندوق القديم.
- طريقة DeltaBox: الكعكة موضوعة على مجموعة من الصواني الشفافة.
- الصينية السفلية هي الكعكة الأصلية (للقراءة فقط).
- عندما تقوم بتغيير ما (مثل إضافة حبة كرز)، فأنت لا تلمس الكعكة السفلية. بدلاً من ذلك، تضع صينية جديدة فارغة فوقها وتضع حبة الكرز هناك.
- عند نقطة التحقق (الحفظ): تقوم ببساطة بتجميد الصينية العلوية الحالية وتمرير صينية جديدة فارغة فوقها. يستغرق الأمر جزءاً من الثانية.
- عند التراجع (العودة): تقوم فقط بسحب الصينية العلوية وإزالة الطبقة التي تحتها. ستختفي حبة الكرز، وتصبح الكعكة تماماً كما كانت قبل ذلك. لا يوجد نسخ، ولا مجهود شاق.
2. DeltaCR: مدير الذاكرة "النسخة المجمدة"
الآن تخيل أن وكيل الذكاء الاصطناعي هو شخص يركض في سباق. لحفظ تقدمه، يتعين عليك عادةً إيقافه، وكتابة كل فكرة خطرت بباله، وتجميد جسده. ولإعادة التشغيل، عليك قراءة الملاحظات وإيقاظه. هذا أمر بطيء.
يستخدم DeltaBox خدعة تسمى "التفرع من قالب مجمد" (Forking from a Frozen Template).
- الإعداد: عندما يتوقف الذكاء الاصطناعي للتفكير، يقوم DeltaBox بإنشاء "نسخة مستنسخة مجمدة" لعقل الوكيل (الذاكرة) ويجمدها في مكانها. الأمر يشبه أخذ لقطة لعقل الشخص أثناء حبس أنفاسه.
- الحفظ: يقوم أيضاً بكتابة ملاحظة صغيرة حول ما تغير (الفرق أو الـ "delta") في مكان آمن.
- التراجع: عندما يحتاج الذكاء الاصطناعي للعودة، بدلاً من إيقاظ شخص نائم وقراءة قائمة طويلة من الملاحظات، يقوم DeltaBox ببساطة بـ استنساخ فوري للعقل المجمد. ولأن النسخة المستنسخة مجمدة بالفعل في الحالة الصحيحة تماماً، فإنها تستيقظ فوراً.
- شبكة الأمان: إذا أصبحت النسخة المجمدة قديمة جداً أو تم التخلص منها لتوف توفير المساحة، فإن النظام لديه خطة بديلة لقراءة الملاحظات وإعادة بناء العقل، لكن هذه العملية أبطأ. يحاول النظام الاحتفاظ بعدد كافٍ من النسخ المجمدة جاهزة بحيث يستخدم الطريقة الفورية دائماً تقريباً.
لماذا يهم هذا الأمر؟
اختبر الباحثون هذا النظام على مهام برمجة حقيقية (إصلاح الأخطاء في برمجيات مثل Django أو SymPy).
- الطريقة القديمة: استغرق الحفظ والاستعادة مئات الملي ثانية إلى ثوانٍ. كان هذا بطيئاً جداً لدرجة أنه منع الذكاء الاصطناعي من استكشاف استراتيجيات عميقة.
- طريقة DeltaBox: يستغرق الحفظ حوالي 14 مللي ثانية والاستعادة حوالي 5 مللي ثانية.
النتيجة:
بسبب سرعة زر "التراجع" الآن، يمكن للذكاء الاصطناعي استكشاف مسارات أكثر بكثير في نفس الوقت. إنه يشبه الفرق بين لاعب شطرنج لا يمكنه التفكير إلا في نقلة واحدة للأمام لأن إعادة ضبط اللوحة تستغرق منه ساعة، مقابل لاعب يمكنه إعادة ضبط اللوحة فوراً وتجربة 100 نقلة مختلفة في الوقت الذي كان يستغرقه لتجربة نقلة واحدة.
ملخص
DeltaBox هو نظام يسمح لوكلاء الذكاء الاصطناعي بلعب ألعاب "ماذا لو" ببيئة الكمبيوتر الخاصة بهم. من خلال إدراك أن معظم التغييرات صغيرة، فإنه يتوقف عن نسخ العالم بأكمله ويكتفي بحفظ الاختلافات الضئلة فقط. هذا يحول عملية ثقيلة وبطيئة إلى عملية فائقة السرعة، مما يسمح للذكاء الاصطناعي بحل مشكلات أصعب عبر تجربة المزيد من الحلول.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.