← أحدث الأبحاث
💬 NLP

MDKeyChunker: Single-Call LLM Enrichment with Rolling Keys and Key-Based Restructuring for High-Accuracy RAG

تُعد MDKeyChunker عبارة عن خط معالجة ثلاثي المراحل لمستندات Markdown، يستخدم تقسيمًا يعتمد على البنية، وإثراءً عبر نموذج لغوي كبير (LLM) في استدعاء واحد مع نشر المفاتيح المتدحرجة للحفاظ على السياق، وتعبئة ثنائية تعتمد على المفاتيح لإعادة هيكلة المحتوى، مما يحقق استرجاعًا عالي الدقة من خلال الحفاظ على الوحدات الدلالية والقضاء على الاستدعاءات المتعددة للنموذج اللغوي الكبير.

المؤلفون الأصليون: Bhavik Mangla

نُشر 2026-03-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bhavik Mangla

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على وصفة محددة في مكتبة ضخمة وغير منظمة.

المشكلة في الأنظمة الحالية (نهج "الحجم الثابت")
تعمل معظم أنظمة البحث الحالية (RAG) مثل روبوت يقوم بتقطيع كل كتاب في المكتبة إلى شرائح متطابقة مكونة من 500 كلمة، بغض النظر عن موضوع الكتاب.

  • المشكلة: إذا كانت الوصفة تحتوي على قائمة مكونات، وفقرة تعليمات، وصورة، فقد يقوم الروبوت بفصل الصورة عن التعليمات. أو قد يفصل خطوة "تسخين الفرن" عن خطوة "خلط العجين".
  • التكلفة: لفهم موضوع كل شريحة، يتعين على الروبوت استدعاء مساعد ذكاء اصطناعي فائق الذكاء (LLM) عدة مرات لكل شريحة—مرة لكتابة عنوان، ومرة لإيجاد الكلمات المفتاحية، ومرة للتلخيص، إلخ. هذا يجعل العملية بطيئة ومكلفة.
  • الارتباك: نظرًا لأن كل شريحة تُعالج بمفردها، فقد يطلق الروبوت على شريحة ما اسم "خبز الكوكيز"، ويطلق على شريحة لاحقة اسم "صنع الكوكيز"، دون أن يدرك أنهما الشيء نفسه.

الحل: MDKeyChunker
تقدم الورقة البحثية MDKeyChunker، وهي طريقة أذكى لتنظيم هذه الكتب. فكر في الأمر كعملية من ثلاث خطوات يقوم بها أمين مكتبة منظم للغاية.

الخطوة 1: "المقص الذكي" (التقطيع المدرك للهيكل)

بدلاً من تقطيع الكتاب إلى قطع عشوائية من 500 كلمة، ينظر أمين المكتبة هذا إلى هيكل المستند (مثل العناوين، كتل الأكواد، الجداول، والقوائم).

  • التشبيه: تخيل أن المستند عبارة عن قلعة من "الليجو" (Lego). القاطع ذو الحجم الثابت سيحطم القلعة إلى أكوام عشوائية من الطوب، مما يكسر الأبراج والجدران. أما MDKeyChuncker فهو يشبه بانيًا حذرًا لا يقطع إلا عند الفواصل الطبيعية للقلعة. إذا كان الجدول مكونًا من 10 صفوف، فيبقى الجدول بأكمله متماسكًا. وإذا كانت كتلة الكود مكونة من 50 سطرًا، فإنها تظل سليمة.
  • النتيجة: لا مزيد من الوصفات المكسورة أو التعليمات المجزأة.

الخطوة 2: "المقابلة الخارقة بطلب واحد" (الإثراء عبر استدعاء واحد)

الآن، يحتاج أمين المكتبة إلى وضع تسميات لهذه الكتل. عادةً، ستحتاج لمقابلة المساعد الذكي خمس مرات مختلفة لخمس تسميات مختلفة. لكن MDKeyChunker يفعل ذلك في مقابلة واحدة فقط.

  • التشبيه: بدلاً من سؤال الذكاء الاصطناعي: "ما هو العنوان؟" ثم "ما هي الكلمات المفتاحية؟" ثم "ما هو الملخص؟" بشكل منفصل، يقوم أمين المكتبة بسؤاله: "إليك قطعة من النص. يرجى إعطائي العنوان، والملخص، والكلمات المفتاحية، وقائمة بالأسماء المهمة، والأسئلة التي تجيب عليها، و'وسم موضوع' محدد، كل ذلك في آن واحد".
  • الخدعة السحرية (المفاتيح المتدحرجة/المتتالية): هذا هو السر الكامن وراء النجاح. يحتفظ أمين المكتبية بـ دفتر ملاحظات متدحرج (قاموس) لـ "أوسمة الموضوعات" المستخدمة حتى الآن.
    • إذا كانت القطعة الأولى تتحدث عن "القبول"، فإن أمين المكتبة يدون "القبول" في دفتره.
    • عندما تأتي القطعة الخامسة وتتحدث عن نفس الشيء، يرى الذكاء الاصطناعي الدفتر ويقول: "أوه، هذا لا يزال يتحدث عن 'القبول'، سأستخدم نفس الوسم بدلاً من ابتكار وسم جديد مثل 'عملية التسجيل'".
    • هذا يمنع الذكاء الاصطناعي من الارتباك بسبب المترادفات ويبقي المستند بأكمله متصلًا.

الخطوة 3: "إعادة تجميع الأحجية" (إعادة الهيكلة القائمة على المفاتيح)

بعد وضع التسميات، ينظر أمين المكتبة إلى "أوسمة الموضوعات".

  • التشبيه: تخيل أن لديك قطع أحجية (Puzzle) مبعثرة في أرجاء الغرفة. بعض القطع بعيدة عن بعضها في الكتاب، لكن كلاهما يحمل وسم "النظام الشمسي".
  • الإجراء: يأخذ أمين المكتبة جميع القطع التي تحمل وسم "النظام الشمسي" ويلصقها معًا لتصبح قطعة واحدة كبيرة ومتماسكة، حتى لو كانت في الأصل مفصولة بـ 30 صفحة من النصوص الأخرى.
  • النتيجة: تحصل على "كتلة فائقة" (Super-Chunk) تحتوي على كل المعلومات المتعلقة بالنظام الشمسي في مكان واحد، مما يسهل على محرك البحث العثور عليها.

لماذا يهم هذا؟

اختبرت الورقة البحثية هذا النظام على 18 مستندًا و30 سؤالًا.

  • الدقة: وجد النظام الإجابات الصحيحة بشكل شبه مثالي (Recall@5 = 1.000 في بعض الإعدادات).
  • الكفاءة: قلل عدد استدعاءات الذكاء الاصطناعي إلى النصف (أو أكثر) من خلال القيام بكل شيء في خطوة واحدة.
  • السلامة: لم يكسر أي جدول أو كتلة برمجية إلى نصفين أبدًا.

باختุปة القول:
MDKeyChunker يشبه الترقية من آلة تقطع المستندات عشوائيًا إلى قطع عشوائية، إلى أمين مكتبة ذكي يحترم الهيكل الطبيعي للمستند، ويجري مقابلات للمحتوى بكفاءة في خطوة واحدة، ويعيد تجميع الأفكار ذات الصلة في حزم مثالية وجاهزة للاستخدام. إنه يجعل البحث بالذكاء الاصطناعي أسرع، وأرخص، وأكثر دقة بكثير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →