← أحدث الأبحاث
💻 computer science

TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents

يُعد ™TongGuOCR إطار عمل جديد للتعرف الضوئي على الحروف (OCR) يعتمد على الوعي بالتخطيط وتعزيز الرموز، وهو مصمم لنسخ الوثائق التاريخية الصينية بدقة من خلال توظيف وحدة معالجة مسبقة لكتل التعرف المتماسكة ووحدة تعرّف معززة بالرموز تعمل على توسيع المفردات للرموز النادرة ونمذجة الانتقالات المكانية، مما يجعله يتفوق بشكل كبير على النماذج التقلية ومتعددة الوسائط الحالية في الاختبارات المعيارية الصعبة.

المؤلفون الأصليون: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

نُشر 2026-08-07
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zhongheng Zhou, Yi Sun, Huiguo He, Yuyi Zhang, Peirong Zhang, Yulin Fang, Dezhi Peng, Minghui Liao, Lianwen Jin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول قراءة مذكرات عمرها ألف عام، لكن الصفحات مغطاة بالغبار، والحبر باهت، والخط غريب لدرجة أن أذكى أصدقائك لا يستطيع حتى معرفة ما تقوله الحروف. هذا هو الصراع اليومي للمؤرخين الذين يحاولون فك رموز الوثائق التاريخية الصينية. لقرون، ظلت هذه النصوص الثمينة حبيسة الصور الممسوحة ضوئيًا — صور للأوراق يمكن للحواسيب رؤيتها ولكن لا يمكنها "قراءتها" مثل البشر. لتحويل هذه الصور إلى نص قابل للبحث، يستخدم العلماء تقنية تسمى التعرف الضوئي على الحروف (OCR). فكر في الـ OCR كأنه أمين مكتبة آلي فائق السرعة ينظر إلى صورة صفحة ويكتب الكلمات التي يراها. ومع ذلك، عندما يواجه الروبوت كتبًا قديمة ذات تخطيطات غريبة، ورموزًا غير مألوفة، وجملًا تقفز عبر الصفحة في أنماط مربكة، غالبًا ما يتوه الروبوت، أو يتخطى الأسطر، أو يكتب كلمات غير مفهومة.

هنا يأتي دور فريق جديد من الباحثين بحل ذكي يسمى TongGuOCR. لقد أدركوا أن الطريقة القديمة لتعليم الروبوتات قراءة هذه الكتب كانت تشبه محاولة أكل بيتزا كاملة في قضمة واحدة؛ كانت فوضوية للغاية ولم يستطع الروبوت التعامل مع التفاصيل. بدلاً من ذلك، بنوا نظامًا يقوم أولاً بتقطيع البيتزا إلى شرائح مثالية وسهلة الإدارة (المعالجة المسبقة المدركة للتخطيط) ثم يعلم الروبوت لغة جديدة خاصة لفهم المكونات النادرة والغريبة على تلك الشرائح (التعرف المعزز بالرموز). ومن خلال الجمع بين هاتين الحيلتين، ابتكروا روبوتًا لا يكتفي بالتخمين، بل يفهم بالفعل تدفق النص القديم، حتى عندما يكون مكتوبًا في أعمدة رأسية أو منتشرًا عبر الصفحة.

المشكلة: لماذا تكسر الكتب القديمة عمل الروبوتات؟

تعتبر الوثائق التاريخية الصينية بمثلة كنزًا ثقافيًا، لكنها صعبة القراءة. فهي غالبًا ما تتميز بتخطيطات معقدة حيث يمتد النص رأسيًا، وتوجد حواشي (ملاحظات صغيرة) محشورة بين الأسطر، ولا يكون ترتيب القراءة دائمًا من اليسار إلى اليمين أو من الأعلى إلى الأسın. علاوة على ذلك، تمتلئ هذه الكتب بـ "الحروف النادرة" — وهي رموز قديمة لا توجد في القواميس الحديثة.

عندما تحاول نماذج الذكاء الاصطناعي القياسية قراءة هذه الصفحات، فإنها تواجه ثلاث مشكلات رئيسية:

  1. فوضى التخطيط: إذا نظر الروبوت إلى الصفحة بأكملها دفعة واحدة، تصبح الصورة ضبابية ويفقد سياق الكلمات المجاورة. وإذا نظر إلى خط واحد في كل مرة، فإنه يفقد الصورة الكبيرة ويصاب بالارتباك بشأن الخطوة التالية.
  2. مشكلة الحروف النادرة: يتم تدريب الذكاء الاصطناعي الحديث على لغة اليوم. وعندما يرى حرفًا قديمًا نادرًا، فإنه غالبًا ما يجزئه إلى قطع صغيرة عديمة المعنى (مثل محاولة تهجئة كلمة عن طريق تخمين الحروف الفردية بدلاً من التعرف على الكلمة بأكملها). وهذا يجعل من الصعب ضبط الحرف بشكل صحيح.
  3. ارتباك "ماذا بعد؟": بعد قراءة سطر واحد، غالبًا لا يعرف الروبوت ما إذا كان يجب أن ينتقل إلى السطر أدناه، أو السر إلى اليمين، أو إلى ملاحظة في الهامش. وبدون خريطة واضحة، يتخطى الأسطر أو يقرأها بالترتيب الخاطئ.

الحل: سحر الخطوتين من TongGuOCR

اقترح الباحثون في جامعة جنوب الصين للتكنولوجيا وهواوي إطار عمل يسمى TongGuOCR، وهو مصمم خصيصًا لمعالجة هذه الألغاز القديمة. لم يكتفوا فقط بضخ المزيد من القدرة الحوسبية في المشكلة، بل غيروا كيفية رؤية الروبوت للنص وتفكيره فيه.

الخطوة 1: القاطع الذكي (المعالجة المسبقة المدركة للتخطيط)

تخيل أنك تحاول قراءة جريدة مزدحمة. إذا حاولت قراءة الصفحة بأكملها، ستتعب عيناك. وإذا قرأت كلمة واحدة في كل مرة، ستفقد المعنى. يستخدم TongGuOCR "قاطعًا ذكيًا" لتقطيع الصفحة إلى كتل التعرف.

بدلاً من مجرد قطع خطوط مستقيمة، ينظر النظام إلى الصفحة ويجمع الأسطر المتتالية من النصوص في كتل متماسكة ومنطقية. الأمر يشبه طباخًا يقطع الكعكة بعناية إلى قطع مثالية سهلة التناول تحافظ على الكريمة والكعكة معًا، بدلاً من التقطيع العشوائي.

  • كيف يعمل: يأخذ النظام أسطر النص ويجمعها في كتل منطقية بصريًا. ثم يقوم بتشذيب هذه الكتل، مزيلًا أي أجزاء مشتتة من الصفحة لا تنتمي إلى تلك الكتلة المحددة.
  • النتيجة: يحصل الروبوت على صورة نظيفة ومركزة لقسم صغير من النص. هذا يحافظ على السياق المحلي (بحيث يعرف الكلمات القريبة من بعضها البعض) دون الضجيج الناتج عن بقية الصفحة.

الخطوة 2: المترجم الخاص (التعرف المعزز بالرموز)

بمجرد تقطيع النص إلى كتل مثالية، يحتاج الروبوت إلى قراءتها. هنا، يستخدم TongGuOCR "مترجمًا خاصًا" يتحدث لغتين جديدتين لمساعدة الروبوت على فهم النص القديم بشكل أفضل.

  • اللغة 1: قاموس الحروف النادرة.
    غالبًا ما تقوم أدوات تقسيم النصوص (tokenizers) في الذكاء الاصطناعي الحديث (وهي الأدوات التي تجزئ النص إلى قطع ليقرأها الكمبيوتر) بتقطيع الحروف القديمة النادرة إلى قطع صغيرة ومربكة. يعالج TongGuOCR هذا الأمر من خلال منح كل حرف نادر هويته الخاصة كـ رمز واحد (single-token).

    • التشبيه: تخيل أنك تتعلم لغة جديدة. بدلاً من الاضطرار إلى تهجئة كلمة صعبة حرفًا بحرف في كل مرة تراها، تحصل على ملصق خاص يحتوي على الكلمة كاملة. أنت فقط تلصق الملصق، وينتهي الأمر. هذا يجعل الروبوت يتعرف على الحروف النادرة بشكل أسرع وأكثر دقة.
  • اللغة 2: خريطة "ماذا بعد؟"
    لحل مشكلة الارتباك حول ترتيب القراءة، يدرج النظام رموز انتقال خاصة بين الأسطر. هذه الرموز تشبه الأسهم الصغيرة أو لافتات الإرشاد التي تخبر الروبوت بالضبط أين ينظر بعد ذلك.

    • التشبيه: إذا كنت تقرأ كتابًا مصورًا (كوميكس) حيث تنتقل اللوحات بشكل عشوائي، فأنت بحاجة إلى دليل يقول لك: "بعد هذه اللوحة، انتقل إلى أعلى اليمين". يضيف TongGuCR هذه اللافتات الرقمية (مثل <right|down> أو <left|up>) في تدفق النص. هذا يوجه عين الروبوت على طول المسار الصحيح، مما يمنعه من تخطي الأسطر أو قراءتها بشكل عكسي.

النتائج: رقم قياسي جديد للنصوص القديمة

اختبر الفريق نظام TongOCR على اثنين من المعايير الرئيسية للوثائق التاريخية الصينية: MTHv2 و M5HisDoc. هذه المجموعات من البيانات هي بمثلة "الأولمبياد" للتعرف على النصوص القديمة، وهي مليئة بالتخطيطات الصعبة والحروف النادرة.

كانت النتائج مبهرة. لم يكتفِ TongOCR بأداء جيد فحسب، بل تفوق على أفضل الأساليب الموجودة، بما في ذلك نماذج الذكاء الاصطناعي العامة الضخمة وأدوات الـ OCR المتخصصة الأخرى.

  • في معيار M5HisDoc الصعب، حقق TongOCR معدل دقة (AR) بنسبة 93.76%.
  • قلل من مسافة التحرير المعيارية (NED) — وهو مقياس لعدد الأخطاء التي ارتكبها الروبوت — من 10.43 إلى 6.15.
  • والأهم من ذلك بالنسبة لتدفق القراءة، فقد خفض مسافة تحرير ترتيب القراءة (RO-ED) من 7.53 إلى 3.49. وهذا يعني أن الروبوت كان أفضل بكثير في اتباع المسار الصحيح عبر النص، ونادرًا ما تخطى سطرًا أو تاه في الطريق.

في مقارنة بصرية (الموضحة في الشكل 4 من الورقة البحثية)، بينما أخطأت النماذج الأخرى في الأسطر، أو قرأت النصوص بترتيب خاطئ، أو شوهت الحروف النادرة، نجح TongOCR في استعادة كل سطر مستهدف واتبع تسلسل القراءة الطبيعي للصفحة التاريخية.

ماذا يعني هذا؟

تشير الورقة البحثية إلى أنه لقراءة النصوص القديمة بفعالية، لا يمكننا الاعتماد فقط على نماذج ذكاء اصطناعي أكبر وأقوى. نحن بحاجة إلى أن نكون أكثر ذكاءً في كيفية تغذية النموذج بالبيانات. من خلال تقسيم الصفحة إلى أجزاء منطقية (المعالجة المسبقة المدركة للتخطيط) ومنح النموذج مفردات أفضل وخريطة واضحة لترتيب القراءة (التعرف المعزز بالرموز)، يمكننا فتح أسرار التاريخ التي كانت مغلقة سابقًا خلف صور غير قابلة للقراءة.

يشير الباحثون إلى أنه على الرغم من أن نظامهم يمثل خطوة كبيرة للأمام، إلا أنه ليس مثاليًا بعد. فهو يعتمد على الحروف الموجودة في بيانات التدريب الخاصة به، لذا قد لا يزال يواجه صعوبة مع الرموز غير المعروفة تمامًا أو غير المفككة شيفرتها. ومع ذلك، بالنسبة للغالبية العظمى من الوثائق التاريخية الصينية، يقدم TongOCR مفتاحًا قويًا جديدًا للماضي، محولًا الصور الساكنة إلى نصوص حية قابلة للبحث يمكن للمؤرخين والعقول الفضولية استكشافها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →