← أحدث الأبحاث
🤖 machine learning

RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference

إن RetroInfer هو محرك تخزين متجهي مصمم لتسريع استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل من خلال استخدام "فهرس موجي" متخصص ومدير ذاكرة مؤقتة (buffer manager) بين وحدة معالجة الرسومات ووحدة المعالجة المركزية لاسترجاع أكثر رموز ذاكرة الـ KV صلة بكفاءة، مما يزيد الإنتاجية بشكل كبير مع الحفاظ على دقة الانتباه الكامل.

المؤلفون الأصليون: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li
نُشر 2026-04-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li, Yuqing Yang, Fan Yang, Mao Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك باحث عالمي كُلف بكتابة موسوعة ضخمة مكونة من 1,000 صفحة. لكي تؤدي عملك على أكمل وجه، عليك أن تتذكر كل حقيقة كتبتها على الإطلاق.

المشكلة: "ضباب الدماغ" الناتج عن البيانات الضخمة

بينما تواصل الكتابة أكثر فأكثر، يحدث أمران:

  1. مشكلة الذاكرة: يصبح "دفتر ملاحظاتك الذهني" (KV Cache) ضخمًا جدًا لدرجة أنه لا يتسع فيزيائيًا على مكتبك (ذاكرة الـ GPU). تضطر للبدء في حشر الملاحظات داخل خزانة ملفات ضخمة وفوضوية في القبو (ذاكرة الـ CPU).
  2. مشكلة السرعة: في كل مرة تريد فيها كتابة جملة جديدة، يتعين عليك فحص كل صفحة من صفحات الموسوعة المكونة من 1,000 صفحة للتأكد من أنك لا تكرر نفسك. هذا يستغرق وقتًا طويلاً، ويستنزف "دماغك" (نطاق عرض الـ GPU) بمجرد تقليب الصفحات.

تحاول أنظمة الذكاء الاصطناዊ الحالية حل هذه المشكلة عبر النظر فقط في بعض الصفحات "المهمة"، لكنها غالبًا ما تفقد التفاصيل الحاسمة، مما يجعل الذكاء الاصطناعي "نسّاءً" أو "غبيًا".


الحل: RetroInfer (أمين المكتبة الخارق)

RetroInfer يشبه توظيف أمين مكتبة عبقري لإدارة أبحاثك. بدلًا من قيامك بالبحث بجنون في القبو، يستخدم أمين المكتبة أداتين بارعتين: Wave Index و Wave Buffer.

1. الـ Wave Index: "قلم التحديد الذكي"

بدلًا من قراءة كل صفحة، يستخدم أمين المكتبة نظام فهرسة خاص. تخيل أن أمين المكتبة يقسم ملاحظاتك إلى ثلاث مناطق:

  • منطقة "الأهمية الدائمة" (المنطقة المستقرة - Steady Zone): وهي الحقائق الأكثر أهمية (مثل عنوان كتابك) التي يبقيها أمين المكتبة أمام عينيه على المكتب في جميع الأوقات.
  • منطقة "البحث والوجد" (منطقة الاسترجاع - Retrieval Zone): يستخدم أمين المكتبের أداة بحث عالية السرعة للعثور على الصفحات المحددة الأكثر صلة بما تحتاجه الآن وجلبها إلى المكتب.
  • منطقة "الملخص السريع" (منطقة التقدير - Estimation Zone): هذا هو الجزء العبقري. بالنسبة لآلاف الصفحات الأخرى، لا يقرأها أمين المكتبة كلمة بكلمة؛ بل ينظر إلى "ملخص" (centroid) لكل مجموعة من الصفحات. الأمر يشبه قول: "لن أقرأ الفصل بأكمله عن علم الأحياء، لكني أعرف أنه يدور حول الخلايا، لذا سأكتفي بأخذ ذلك في الاعتبار". هذا يمنحك "جوهر" الموضوع بدقة عالية دون عناء العمل الشاق.

2. الـ Wave Buffer: "المساعد الفعال"

حتى مع وجود فهرس ذكي، فإن نقل الصناديق الثقيلة من الورق من القبو (CPU) إلى المكتب (GPU) يستغرق وقتًا. Wave Buffer هو مساعد يدير هذه الحركة بشكل مثالي:

  • "رف الوصول السريع" (ذاكرة الكاش للكتل - Block Cache): يلاحظ المساعد أنك إذا احتجت إلى صفحة عن "الجاذبية" قبل دقيقة، فمن المحتمل أن تحتاج إليها مرة أخرى قريبًا. لذا، يحتفظ بتلك الصفحات على رف صغير بجوار مكتبك مباشرة حتى لا يضطر للذهاب إلى القبو مرة أخرى.
  • "العدّاء الاستباقي" (الإدارة غير المتزامنة - Asynchronous Management): بينما تنشغل أنت بكتابة جملتك الحالية، يكون المساعد بالفعل في طريقه إلى القبو لجلب المجموعة التالية من الصفحات التي قد تحتاجها. إنه يعمل في الخلفية حتى لا تضطر للتوقف عن الكتابة بانتظار عملية التسليم.

النتيجة: أسرع، أذكى، وأطول

بفضل "أمين المكتبة الخارق" هذا، يمكن للذكاء الاصطناعي أن:

  • يقرأ أكثر بكثير: يمكنه التعامل مع كميات هائلة من المعلومات (تصل إلى مليون توكن!) دون أن تنفد "مساحة المكتب".
  • يعمل بشكل أسرع بكثير: يمكنه توليد النصوص بسرعة تصل إلى 12 ضعفًا مقارنة بالطرق السابقة التي حاولت أن تكون "متفرقة" (Sparse).
  • يبقى ذكيًا: على عكس الأنظمة الأخرى التي تصاب بـ "الارتباك" عندما تحاول توفير الذاكرة، يظل RetroInfer بدقة تضاهي قراءته لكل كلمة في الموسوعة بأكملها.

باختًا: يحول RetroInfer الباحث البطئ والمثقل بالأعباء إلى باحث فائق السرعة والذكاء من خلال تنظيم ذاكرته وأتمتة عملية البحث الخاصة به.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →