← أحدث الأبحاث
💻 computer science

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

تقدم هذه الورقة البحثية Q-Mask، وهو إطار عمل جديد للتعرف الضوئي على الحروف (OCR) يستخدم مفكك قناع مدفوع باستعلام سببي لربط النص صراحةً بالمناطق المكانية قبل عملية التعرف، مدعوماً بمعيار TextAnchor-Bench ومجموعة بيانات TextAnchor-26M واسعة النطاق لتحسين قدرات تثبيت النص في نماذج الرؤية واللغة بشكل كبير.

المؤلفون الأصليون: Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على كلمة محددة في غرفة مزدحمة وفوضوية مليئة بأشخاص يصرخون بأشياء مختلفة.

المشكلة:
نماذج الذكاء الاصطناዊ "الذكية" الحالية (نماذج الرؤية واللغة - Vision-Language Models) تشبه أمناء مكتبات بارعين يمكنهم قراءة أي كتاب بدقة مثالية. إذا أريتهم صورة لإيصال، يمكنهم إخبارك بإجمالي السعر أو التاريخ. ومع ذلك، لديهم نقطة عمياء غريبة: لا يمكنهم الإشارة إلى مكان وجود النص.

إذا سألتهم: "أين كلمة 'Total'؟"، فقد يقول النموذج التقليدي: "إنها 12.50"، لكنه لا يستطيع رسم مربع حولها. الأمر يشبه أمين مكتبة يعرف الإجابة، لكنه يرفض الإشارة إلى الرف الذي يوجد عليه الكتاب. هذه مشكلة للأجهزة التي تحتاج للتفاعل مع العالم المادي، مثل النظارات الذكية أو الروبوتات—فهي تحتاج لمعرفة أين تنظر، وليس فقط ماذا تقرأ.

الحل: Q-Mask
ابتكر الباحثون في Xiaomi نظامًا جديدًا يسمى Q-Mask. فكر في الأمر كتعليم الذكاء الاصطناعي طريقة جديدة للتفكير: "انظر قبل أن تقرأ".

بدلاً من محاولة قراءة الصورة بأكملها وتخمين الإجابة في نفس الوقت، يقوم Q-Mask بتقسيم العملية إلى خطوتين متميزتين، تمامًا كما يحل المحقق قضية ما:

  1. خطوة "أين" (البحث): أولاً، ينظر الذكاء الاصطناعي إلى سؤالك (على سبيل المثال: "أين السعر؟") ويمسح الصورة لرسم "بقعة ضوء" ذهنية أو قناع (mask) فوق المنطقة المحددة التي يُحتمل أن توجد فيها تلك المعلومة. إنه يتجاهل كل شيء آخر.
  2. خطوة "ماذا" (القراءة): فقط بعد عزله لتلك البقعة المحددة، يقوم بالتقريب (zoom in) وقراءة النص الموجود داخل بقعة الضوء تلك.

التشبيه الإبداعي: "المصباح اليدوي" مقابل "الكشاف الضوئي"

  • الذكاء الاصطناعي القديم (الكشاف الضوئي - Floodlight): يسلط ضوءًا ساطعًا على الغرفة الفوضوية بأكملها. يرى كل شيء دفعة واحدة، فيصاب بالارتباك وقد يخلط بين كلمة على ملصق وكلمة على قائمة طعام. إنه يخمن الإجابة بناءً على المشهد بأكمله.
  • Q-Mask (المصباح اليدوي - Flashlight): تسأل: "أين لافتة الخروج؟" فيستخدم الذكاء الاصطناعي أولاً مصباحًا يدويًا للعثور على لافتة الخروج. وبمجرد أن يثبت المصباح على اللافتة، ثم يقرأ الحروف. هذا يضمن أن الإجابة متجذرة في الواقع.

كيف علموه (بيانات التدريب)
لتعليم الذكاء الاصطناعي هذه المهارة الجديدة، لم يستطع الباحثون استخدام الكتب العادية فحسب؛ بل احتاجوا إلى دليل تدريب خاص يسمى TextAnchor-26M.

تخيل أنك تحاول تعليم طفل العثور على أشياء مخفية. لن تكتفي فقط بعرض صورة عليه وسؤاله: "ماذا ترى؟"، بل ستعرض له صورة، وتشير إلى مكان محدد، وتقول له: "الكلمة 'Apple' موجودة هنا تمامًا".

  • لقد أنشأوا 26 مليون مثال من هذا النوع.
  • استخدموا حيلة تسمى "الرندرة المقنعة منزوعة الأسلوب" (De-stylized Mask Rendering). بدلاً من إظهار الخط الفاخر والحقيقي للافتة ما (والذي قد يكون صعب القراءة)، أخذوا النص وطبعوه بخط بسيط وممل على خلفية بيضاء، بما يطابق شكل اللافتة الأصلية. هذا علم الذكاء الاصطناعي التركيز على شكل وموقع النص، وليس على التصميم المزخرف.

النتيجة: اختبار "TextAnchor-Bench" (TABench)
قام الفريق أيضًا ببناء اختبار يسمى TABench لمعرفة ما إذا كانت نماذج الذكاء الاصطناعي الأخرى تستطيع فعل ذلك. ووجدوا أن أشهر نماذج الذكاء الاصطناعي وأكثرها قوة (مثل GPT-4o أو Gemini) كانت سيئة للغاية في الإشارة إلى النص. يمكنها قراءته، لكنها لا تستطيع ربطه بموقع محدد.

أما Q-Mask، فقد اجتاز الاختبار بتفوق. أصبح أفضل بكثير في:

  • القراءة: الحصول على النص الصحيح لأنه ركز على المكان الصحيح.
  • الإشارة: رسم مربع بدقة حول النص.

لماذا هذا مهم؟
الأمر لا يتعلق فقط بالقراءة بشكل أفضل، بل يتعلق بالتفاعل.

  • النظارات الذكية: إذا كنت ترتدي نظارات تخبرك بما تقوله لافتة ما، فأنت تريد للنظارات أن تسلط الضوء على اللافتة لك، لا أن تنطق الكلمات فحسب.
  • الروبوتات: إذا كان على الروبوت التقاط صندوق مكتوب عليه "قابل للكسر" (Fragile)، فعليه معرفة مكان الملصق بالضبط على الصندوق ليمسكه بأمان.

باختصار:
Q-Mask هو طريقة جديدة لتعليم الذكاء الاصطناعي التوقف عن التخمين والبدء في البحث. من خلال إجبار الذكاء الاصطناعي على إيجاد موقع النص قبل قراءته، نجح الباحثون في إنشاء نظام أكثر دقة، وأكثر موثوقية، وأفضل بكثير في فهم العالم المادي. إنه الفرق بين طالب يخمن الإجابة في الامتحان، وطالب يظهر خطوات حله من خلال الإشارة بدقة إلى مكان العثور على الإجابة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →