← أحدث الأبحاث
💬 NLP

RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

يُعد RAGOCR إطار عمل مبتكرًا يقوم بضغط المستندات المسترجعة إلى تمثيلات بصرية مشروطة بالاستعلام مع آلية دقة ديناميكية، محققًا دقة أعلى بنسبة تزيد عن 15% من نظام RAG القياسي مع تقليل الرموز المدخلة بنسبة 87.5% والتفوق على النماذج المرجعية الحالية للضغط الصلب واللين.

المؤلفون الأصليون: Jiayang Yu, Jialun Zhong, Lei Zou

نُشر 2026-08-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiayang Yu, Jialun Zhong, Lei Zou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز عملاق، ولكن بدلاً من خيط واحد للحل، تم تسليمك مكتبة كاملة من الكتب. أنت بحاجة للعثور على الجملة الوحيدة التي تحمل الإجابة، لكن قراءة كل كلمة في كل كتاب تستغرق وقتاً طويلاً جداً وتجعل عقلك يتعب. هذا هو الصراع اليومي لبرامج الكمبيوتر "الذكية" الحديثة التي تسمى النماذج اللغوية الكبيرة (LLMs). هذه البرامج تشبه المحققين العباقرة الذين يمكنهم كتابة القصص، والإجابة على الأسئلة، وحل المشكلات، ولكن لديهم مدى انتباه قصير عندما يتعلق الأمر بالقراءة. إذا أعطيتهم الكثير من النصوص دفعة واحدة، فسيشعرون بالإرهاق ويبدأون في تفويت التفاصيل المهمة.

ولمساعدة هؤلاء المحققين، يستخدم العلماء حيلة تسمى "التوليد المعزز بالاسترجاع" (RAG). فكر في RAG كأنه أمين مكتبة فائق الكفاءة. عندما تطرح سؤالاً، يقوم أمين المكتبة بسرعة بجلب الكتب الأكثر صلة من الرفوف ويقدمها للمحقق. ولكن هنا تكمن المشكلة: حتى مع مساعدة أمين المكتبة، قد تظل كومة الكتب ثقيلة جداً للحمل. قد يسقط المحقق الكتب، أو والأسوأ من ذلك، قد يضيع في منتصف الصفحات وينسى البداية والنهاية. حاول العلماء تقليص حجم هذه الكتب عن طريق تلخيصها أو حذف الكلمات المملة، لكن الأمر يشبه محاولة طي خريطة تستمر في التمزق أو فقدان المعالم التي تحتاجها بالفعل.

الآن، تخيل طريقة مختلفة لحمل المعلومات. بدلاً من محاولة تقليص الكلمات، ماذا لو استطعت تحويل صفحة النص بأكملها إلى صورة فوتوغرافية واحدة صغيرة؟ تشير اكتشافات حديثة إلى أن أجهزة الكمبيوتر يمكنها "رؤية" صفحة من النص كصورة وفهمها باستخدام عدد أقل بكتمًا من "التوكنز" (الوحدات التي تستخدمها الحواسيب للتفكير) مقارنة بقراءة الكلمات واحدة تلو الأخرى. إنه يشبه الفرق بين قراءة رسالة طويلة وبين إلقاء نظرة خاطفة على صورة لتلك الرسالة؛ فالصورة تجمع نفس المعلومات في مساحة أصغر بكثير. ولكن هناك مشكلة جديدة: إذا حولت كل الكتب إلى صور، فستظل لديك الكثير من الصور لتنظر إليها، وبعضها سيكون مجرد هراء. التحدي الحقيقي هو معرفة أي الصور يجب الاحتفاظ بها كبيرة وواضحة، وأيها يجب ضغطها لتصبح صوراً مصغرة ضبابية وصغيرة دون فقدان الأدلة السرية.

هذا هو بالضبط ما يعالجه بحث "RAGOCR". يقترح المؤلفون، وهم باحثون من جامعة بكين، نظاماً ذكياً يحول مستندات النصوص المسترجعة إلى صور، ثم يستخدم "ضاغطاً" ذكياً لإعادة تغيير حجمها بناءً على مدى أهميتها لسؤالك المحدد.

إليك كيف يعمل سحرهم: أولاً، يأخذ النظام جميع مستندات النصوص التي وجدها أمين المكتبة ويحولها إلى صور، مثل التقاط صورة لكل صفحة. بعد ذلك، ينظر ذكاء اصطناعي ضاغط خاص إلى سؤالك وإلى تلك الصور جميعاً معاً. إنه يعمل كمحرر حكيم يعرف بالضبط ما تحتاجه. إذا كان المستند ذا صلة وثيقة بسؤالك، فإنه يبقيه بدقة عالية، بحيث تكون كل التفاصيل الصغيرة واضحة تماماً. أما إذا كان المستند مرتبطاً بشكل طفيف أو غير ذي صلة تماماً، فإن الضاغط يقلصه بشدة، مما يجعله نقطة صغيرة ضبابية تأخذ مساحة ضئيلة جداً.

يشير البحث إلى أن هذا النهج "المعتمد على الاستعلام" يعد تغييراً جذرياً في قواعد اللعبة. فمن خلال استخدام طريقة تدريب تسمى "تحسين السياسة النسبية للمجموعة" (GRPO)، يتعلم النظام موازنة أحجام الصور بشكل مثالي. وفي اختباراتهم، سمحت هذه الطريقة للكمبيوتر بالإجابة على الأسئلة الطبية بدقة تزيد بنسبة 15% عن أكثر من 15% عن الطريقة القياسية المتبعة، مع استخدام واحد من ثمن المساحة المعتادة لـ "التفكير" (التوكنز). إنه يشبه الحصول على معرفة مكتبة كاملة في حقيبة ظهر واحدة.

ومن المثير للاهتمام، وجد البحث أيضاً أثراً جانبياً مفاجئاً: الطريقة التي يقرر بها الضاغط تقليص الصور تخبرنا في الواقع أي المستندات هي الأكثر أهمية. يتعلم النظام طبيعياً إعطاء درجات عالية للمستندات الأفضل بمجرد تقرير مقدار تقليص حجمها. وهذا يعني أن الأداة نفسها التي تتقلص بها النصوص يمكن أن تعمل أيضاً كفلتر لاختيار أفضل الكتب، مما قد يحل محل أدوات التصنيف المعقدة الأخرى.

اختبر الباحثون هذا على خمس مجموعات مختلفة من الأسئلة الطبية، بما في ذلك الامتحانات الصعبة التي تتطلب تفكيراً عميقاً. ووجدوا أن RAGOCR يتفوق باستمرار على الطرق الأخرى، سواء كانت المستندات نصوصاً عادية، أو إرشادات طبية معقدة، أو حتى شرائح عرض تحتوي على صور ونصوص مختلطة معاً. لقد أظهروا أن مجرد تحويل النص إلى صور يساعد، ولكن تحويلها إلى صور ذات حجم متغير بذكاء يساعد أكثر. يجادل البحث بأن هذا النهج يسد الفجوة بين الضغط "الصلب" (حذف الكلمات) والضغط "اللين" (التلخيص)، مما يوفر طريقة للاحتفاظ بأكثر التفاصيل حيوية مع التخلص من الضجيج.

باختصار، يشير RAGOCR إلى أننا لسنا مضطرين للاختيار بين قراءة كل شيء أو عدم قراءة أي شيء. بدلاً من ذلك، يمكننا منح محققي الذكاء الاصطنابنا خريطة بصرية حيث تكون الطرق المهمة واسعة وواضحة، والطرق المسدودة مجرد نقاط صغيرة وضبابية. هذا يسمح لهم بحل الألغاز بشكل أسرع وأكثر دقة، مما يثبت أن الرؤية أحياناً هي بالفعل تصديق، والرؤية هي أيضاً تفكير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →