AgentIR: A Workload-Adaptive Cascade Retrieval Substrate for Long-Term Conversational Memory
يقدم AgentIR ركيزة استرجاع متتالية متكيفة مع عبء العمل للذاكرة الحوارية طويلة المدى، والتي تتخطى ديناميكياً عملية الاسترجاع الكثيف المكلفة بناءً على عتبات الثقة وتستخدم فهرساً مقسماً زمنياً لتحقيق زمن انتقال يقل عن 10 مللي ثانية وتسريعاً يصل إلى 132 ضعفاً مع الحفاظ على دقة الاسترجاع أو تحسينها عبر مختلف المعايسات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إليك شرح لورقة بحث AgentIR، مترجم إلى لغة بسيطة باستخدام التشبيهات.
الصورة الكبيرة: أمين مكتبة ذكي لوكلاء الذكاء الاصطناعي
تخفيل أن لديك مساعداً ذكياً جداً يعمل بالذكاء الاصطناعي ("وكيل") يساعدك لشهور أو حتى لسنوات. مع مرور الوقت، يجمع هذا الوكيل مذكرات هائلة من المحادثات، واستخدامات الأدوات، والخطط—ملايين الصفحات من الملاحظات.
في كل مرة يتخذ فيها الوكيل خطوة لحل مشكلة ما، يتعين عليه البحث في هذه المذكرات للعثور على المعلومات الصحيحة. إذا اتخذ الوكيل 20 خطوة، فإنه يحتاج للبحث في هذه المذكرات 20 مرة متتالية. وإذا استغرق البحث ولو جزءاً بسيطاً من الثانية أكثر مما ينبغي، فسيشعر المستخدم البشري أن المحادثة بأكملها "متوقفة" أو بطيئة.
المشكلة؟ الأدوات التي نستخدمها عادةً للبحث في المكتبات (مثل محركات البحث القياسية) صُممت للبحث في الإنترنت بأكمله، وليس للبحث في مذكرات واحدة تنمو باستمرار حيث تكون الملاحظات الأكثر أهمية هي تلك التي كُتبت الآن للتو.
AgentIR هو محرك بحث متخصص وجديد تم بناؤه خصيصاً لوكلاء الذكاء الاصطناعي هؤلاء. إنه أسرع، وأذكى في تحديد ما يبحث عنه، ويتوسع في الحجم دون أن يتباطأ.
1. رفوف "السفر عبر الزمن" (التقسيم الزمني - Temporal Partitioning)
المشكلة: تخيل مكتبة تُضاف إليها الكتب في كل ثانية. إذا طلبت كتاباً، فقد يضطر أمين المكتبة العادي إلى فحص الرفوف من أقدم كتاب إلى أحدث كتاب، واحداً تلو الآخر. ومع نمو المكتبة لتصل إلى ملايين الكتب، يصبح هذا البحث أبطأ فأبطأ.
حل AgentIR: يقوم AgentIR بتنظيم المكتبة بشكل مختلف. بدلاً من صف واحد ضخم من الكتب، يضعها على رفوف بناءً على متى كُتبت.
- التشبيه: فكر في الأمر كأنها مكتبة "سفر عبر الزمن". الكتب الأحدث توضع على رف خاص سهل الوصول إليه في المقدمة. أما الكتب الأقدم فيتم دفعها إلى الخلف.
- كيف يعمل: نظرًا لأن وكلاء الذكاء الاصطناعي يحتاجون عادةً إلى معلومات من المحادثات الأخيرة (مثل "ما الذي أصلحناه للتو؟")، فإن النظام ينظر فقط إلى الرفوف الأمامية أولاً. إذا وجد الإجابة هناك، يتوقف فوراً. إنه لا يضيع الوقت في فحص الرفوف الخلفية المتربة.
- النتيجة: حتى لو نمت المكتبة 1,000 ضعف، فإن وقت البحث لا يزداد إلا قليلاً. الأمر يشبه العثور على إبرة في كومة قش، لكن الإبرة موجودة دائماً في أعلى 1% من القش.
2. استراتيجية "الأداتين" (البحث الهجين - Hybrid Search)
المشكلة: أحياناً تحتاج للبحث عن كلمات دقيقة (مثل البحث عن رمز خطأ محدد)، وأحياناً تحتاج للبحث عن المعنى (مثل البحث عن محادثة حول "إصلاح خلل" حتى لو لم تُستخدم كلمة "خلل" حرفياً).
- الأداة (أ) (BM25): ممتازة في مطابقة الكلمات الدقيقة، وسريعة جداً.
- الأداة (ب) (Dense/Vector): ممتازة في فهم المعنى، لكنها بطيئة وثقيلة.
حل AgentIR: لا يجبرك AgentIR على استخدام الأداتين لكل سؤال. إنه يعمل مثل شرطي مرور ذكي.
- التشبيه: تخيل أنك تبحث عن عنصر معين في متجر.
- إذا سألت: "أين المطرقة الحمراء؟"، سيعرف النظام أنك تحتاج فقط للنظر في ممر "المطارق" (الأداة أ). وبذلك يتخطى الماسح الضوئي "للمعنى" المكلف والبطيء.
- إذا سألت: "أين الشيء الذي يصلح الباب الذي يصدر صريراً؟"، سيعرف النظام أنه بحاجة إلى ماسح "المعنى" (الأداة ب) لفهم المفهوم.
- التتابع (The Cascade): يحاول النظام استخدام الأداة السريعة أولاً. إذا كان واثقاً جداً من أنه وجد الإجابة، يتوقف عند ذلك الحد. إذا كان غير متأكد، حينها يستدعي الأداة الثقيلة والبطيئة. هذا يوفر قدراً هائلاً من الوقت.
3. استراتيجية "تغيير الشكل" (التكيف مع عبء العمل - Workload-Adaptive)
المشكلة: أنواع مختلفة من الأسئلة تتطلب استراتيجيات بحث مختلفة.
- في مجموعة بيانات واحدة (LongMemEval)، كان خلط مطابقة الكلمات ومطابقة المعنى هو الأفضل.
- في مجموعة بيانات أخرى (LoCoMo)، كانت مطابقة الكلمات وحدها هي الأفضل والأسرع فعلياً.
- الأنظمة القديمة تجبرك على اختيار استراتيجية واحدة والالتزام بها للأبد.
حل AgentIR: AgentIR هو "حرباء". لديه مصنف صغير وسريع (صانع قرار) ينظر إلى سؤالك ويقول: "آه، هذا سؤال عن 'الزمن'، فلنستخدم الاستراتيجية (أ)"، أو "هذا سؤال عن 'الحقائق'، فلنستخدم الاستراتيجية (ب)".
- النتيجة: إنه يضبط نفسه تلقائياً. في أحد الاختبارات، تخطى الأداة البطيئة بنسبة 63% من المرات. وفي اختبار آخر، تخطاها بنسبة 100% لأن الأداة السريعة كانت مثالية. إنه يتكيف مع المهمة المطلوبة دون الحاجة لإعادة تدريبه.
4. محرك "السرعة الفائقة" (تحسين المعالجات الرسومية والمعالجات المركزية - GPU & CPU Optimization)
المشكلة: القيام بعمليات البحث هذه على شرائح الكمبيوتر القياسية (CPUs) سريع، لكن القيام بها على بطاقات الرسوميات القوية (GPUs) غالباً ما يكون صعباً لأن العمليات الحسابية لا تتوافق تماماً. كما أن محركات البحث القياسية غالباً ما تحتوي على أخطاء خفية تجعلها أقل دقة قليلاً عندما تحاول تسريعها.
حل AgentIR:
- المحرك: قاموا ببناء محرك مخصص يعمل على كل من المعالجات المركزية (CPUs) ومعالجات الرسوميات (GPUs) بشكل مثالي.
- "إصلاح الخلل": وجد المؤلفون ثلاثة "أخطاء" دقيقة تحدث غالباً عندما يحاول الناس تسريع محركات البحث (مثل تطبيع الأرقام بشكل خاطئ أو نسيان مسح الذاكرة). هذه الأخطاء تجعل نتائج البحث أسوأ بمقدار 6 إلى 8 مرات دون أن يلاحظ أحد. قام AgentIR بإصلاحها، مما يضمن أن نسخة الـ GPU فائقة السرعة تعطي نفس الإجابات الصحيحة تماماً مثل نسخة الـ CPU الأبطأ.
- النتيجة: حققوا سرعات تصل إلى 132 ضعفاً أسرع من الأنظمة القياسية في مهام معينة، مع الحفاظ على الدقة نفسها تماماً.
ملخص النتائج
- السرعة: يمكنه التعامل مع ملايين السجلات ولا يزال يجيب في أقل من 100 ميكروثانية (أي 1/10,000 من الثانية) للبيانات الأخيرة.
- الكفاءة: يمكنه خدمة 8 وكلاء ذكاء اصطناعي مختلفين في نفس الوقت على جهاز كمبيوتر واحد دون تباطؤ.
- الدقة: يطابق أو يتفوق على أفضل محركات البحث الموجودة حالياً (مثل Lucene) في العثور على الإجابات الصحيحة، ولكنه يفعل ذلك بشكل أسرع بكثير.
- التكلفة: نظرًا لسرعته وكفاءته العالية، فإنه يكلف جزءاً ضئيلاً جداً مما تفرضه خدمات البحث السحابية التجارية.
باختصار: AgentIR هو محرك بحث متخصص وعالي السرعة يعرف متى ينظر إلى الملاحظات الأخيرة، ومتى يستخدم مطابقة الكلمات البسيطة، ومتى يتخطى العمل الشاق تماماً، مما يضمن بقاء وكلاء الذكاء الاصطناعي سريعين وسلسي الاستجابة حتى مع نمو ذاكرتهم لتصبح ضخمة جداً.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.