← أحدث الأبحاث
💬 NLP

See the Text: From Tokenization to Visual Reading

تقدم الورقة البحثية SeeTok، وهو نهج متمحور حول الرؤية يقوم بتصوير النصوص كصور لتقوم النماذج اللغوية الكبيرة متعددة الوسائط بتفسيرها، مما يستبدل بفعالية عملية تقسيم الكلمات إلى وحدات فرعية (subword tokenization) لتحقيق كفاءة حوسبية كبيرة، وتحسين المتانة تجاه الضجيج الطباعي، وتحقيق تعميم أفضل عبر اللغات من خلال محاكاة القراءة البصرية البشرية.

المؤلفون الأصليون: Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

نُشر 2026-03-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة البحث "من التجزئة إلى القراءة البصرية" (SEETOK)، مقسمة إلى مفاهيم بسيطة مع تشبيهات إبداعية.

🧠 الفكرة الكبرى: كيف يقرأ البشر مقابل الحواسيب

تخيل أنك تقرأ كتابًا.

  • كيف يقرأ البشر: أنت لا تقرأ حرفًا بحرف (مثل ق-ط-ة). بل ترى شكل الكلمة بأكملها. حتى لو قام شخص ما ببعثرة الحروف الوسطى (مثل طةق أو قطة)، فإن دماغك يتعرف على "شكل" الكلمة ويعرف أنها تعني "قطة". أنت تقرأ الكلمة ككائن بصري واحد، مثل الصورة.
  • كيف تقرأ الحواسيب (الطريقة القديمة): نماذج الذكاء الاصطنا eventually الحديثة تشبه أمين مكتبة صارم للغاية. فهي لا ترى الكلمة بأكملها، بل تقطع كل جملة إلى قطع صغيرة محددة مسبقًا تسمى "الرموز" (tokens).
    • بالنسبة للغة الإنجليزية، يعمل هذا بشكل جيد نوعًا ما.
    • لكن بالنسبة للغات ذات عدد المتحدثين القليل (مثل الجورجية أو الكيرغيزية)، يمتلك أمين المكتبة قاموسًا صغيرًا جدًا. ولكي يفهم كلمة ما، يتعين عليه تقطيعها إلى قطع صغيرة كثيرة جدًا، بحيث قد تتحول عبارة بسيئة مكونة من كلمتين إلى أحجية مكونة من 20 قطعة. هذا يجعل الكمبيوتر بطيئًا، ومكلفًا في التشغيل، وسهل الارتباك بسبب الأخطاء الإملائية.

المشكلة: يحاول الكمبيوتر حل أحجية من خلال النظر إلى قطع الأحجية الفردية، بينما يحل البشر المشكلة من خلال النظر إلى الصورة الموجودة على الصندوق.


🎨 الحل: SEETOK (الـ "قارئ البصري")

قرر مؤلفو هذه الورقة البحثية، SEETOK، التوقف عن إجبار الكمبيوتر على القراءة مثل أمين المكتبة والبدء في تركه يقرأ مثل البشر.

التشبيه: "قائمة الطعام المصورة"
تخيل أنك تذهب إلى مطعم.

  • الطريقة القديمة (تجزئة النص): يقرأ لك النادل قائمة الطعام كلمة بكلمة. "لدينا... الحساء... المكون... من... اليوم..." إذا طلبت ترجمة إلى لغة نادرة، سيتعين على النادل تقسيم كل كلمة إلى مقاطع لفظية صغيرة ليجدها في قاموسه. الأمر يستغرق وقتًا طويلاً.
  • طريقة SEETOK (القراءة البصرية): يسلمك النادل صورة لقائمة الطعام. أنت لا تحتاج لمعرفة الكلمات؛ فقط تنظر إلى صورة الحساء والنص الموجود في الصورة. أنت تتعرف على شكل الكلمات فورًا.

كيف يعمل SEETOK:

  1. الرندرة (Render): بدلًا من تغذية الكمبيوتر بنصوص خام (حروف)، يقوم النظام بتحويل النص إلى صورة (صورة للكلمات).
  2. الرؤية: يستخدم الكمبيوتر "عيونه" (مشفر رؤية تم تدريبه على ملايين الصور) للنظر إلى هذه الصورة. إنه يتعرف على الأشكال، تمامًا كما يفعل البشر.
  3. الفهم: يقوم الكمبيوتر بعد ذلك بمعالجة هذه الأشكال البصرية لفهم المعنى.

🚀 لماذا يعد هذا أمرًا هامًا؟ (القوى الخارقة)

تظهر الورقة البحثية أن نهج "القارئ البصري" هذا أفضل بالفعل من نهج "أمين المكتبة النصي" القديم بأربع طرق:

1. قوة "الضغط" 📦

  • الطريقة القديمة: في اللغات النادرة، يحتاج الكمبيوتر إلى 11 رمزًا لقول "المعرفة العالمية". الأمر يشبه محاولة حمل صندوق ثقيل عن طريق تقسيمه إلى 11 طوبة صغيرة.
  • SEETOK: يرى العبارة بأكملها كـ رمز بصري واحد. إنه يشبه حمل الصندوق كاملاً دفعة واحدة.
  • النتيجة: يحتاج الكمبيوتر إلى رموز أقل بمقدار 4.4 مرة للقيام بنفس المهمة. وهذا يجعله أسرع بنسبة 70% ويستهلك كهرباء أقل (قدرة حوسبية).

2. "المترجم العالمي" 🌍

  • الطريقة القديمة: قاموس الكمبيوتر منحاز للغة الإنجليزية. إذا كنت تتحدث لغة نادرة، سيرتبك الكمبيوتر ويقسم كلماتك إلى شظايا بلا معنى.
  • SEETOK: بما أنه ينظر إلى شكل الكلمات، فهو لا يهتم إذا كانت اللغة إنجليزية أو صينية أو لهجة أفريقية نادرة. الكلمة هي كلمة، بغض النظر عن نظام الكتابة.
  • النتيجة: يترجم اللغات النادرة بشكل أفضل وأكثر كفاءة مما كان عليه في السابق.

3. درع "الأخطاء الإملائية" 🛡️

  • الطريقة القديمة: إذا كتبت "recieve" بدلًا من "receive"، سيرتبك مُجزئ النصوص (tokenizer) الخاص بالكمبيوتر. قد يعتقد أنها كلمة مختلفة تمامًا لأن قطع الأحجية لا تتطابق مع القاموس.
  • SECTOK: إذا كتبت "recieve"، يرى الكمبيوتر شكل الكلمة. تبدو مشابهة جدًا لكلمة "receive". الأمر يشبه التعرف على صديق حتى لو كان يرتدي قبعة ونظارات شمسية.
  • النتيجة: هو أكثر متانة ضد الأخطاء الإملائية، والخطوط الغريبة، والضجيج البصري.

4. خدعة "العد" 🔢

  • الطريقة القديمة: اسأل ذكاءً اصطناعيًا قياسيًا، "كم عدد حرف الـ 'r' في كلمة 'strawberry'؟" غالبًا ما يفشل لأنه يرى الكلمة ككتلة واحدة كبيرة (رمز واحد) ولا يمكنه عد الحروف الداخلية.
  • SECTOK: نظرًا لأنه يرى الكلمة كصورة للحروف، يمكنه بالفعل "عد" الأشكال.
  • النتيجة: يصبح أفضل في المهام التي تتطلب النظر في التفاصيل الدقيقة للكلمات، مثل عد الحروف أو إعادة ترتيب الكلمات المبعثرة.

🏁 الخلاصة

تجادل الورقة البحثية بأننا كنا نعلم الحواسيب القراءة مثل الآلات (تقطيع الكلمات إلى قطع) لفترة طويلة جدًا. ومن خلال الانتقال إلى القراءة البصرية (معاملة النص كصور)، يمكننا جعل الذكاء الاصطناعي:

  • أسرع (بيانات أقل للمعالجة).
  • أذكى (أفضل في اللغات النادرة والأخطاء الإملائية).
  • أكثر شبهاً بالبشر (التعرف على الأنماط والأشكال).

إنه تحول من "عد قطع الأحجية" إلى "النظر إلى الصورة". وفي عالم الذكاء الاصطناعي، تعد هذه قفزة هائلة للأمام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →