Yorùbá in Unicode: An Overview of a Problem
تجادل هذه الورقة بأن الفشل المستمر في عرض نصوص لغة اليوروبا عبر المنصات الرقمية ينبع من افتقار نظام "يونيكود" للرموز المسبقة التكوين لتركيبات العلامات التشكيلية الأساسية، وتقترح طلباً رسمياً للترميز لمعالجة حالات عدم الاتساق الناتجة عن الاعتماد على تسلسلات دمج غير مستقرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
إن اللغة أكثر من مجرد مجموعة من الأصوات؛ فبالنسبة لملايين البشر، هي نظام يتغير فيه معنى الكلمة تماماً بتغير طبقة الصوت. في لغة اليوروبا، التي يتحدث بها أكثر من 40 مليون شخص عبر غرب أفريقيا والمهجر، يمكن للفرق بين نغمة عالية ونغمة منخفضة أن يحول كلمة تعني "يد" إلى كلمة تعني "مكنسة" أو "احترام". إن هذا الاعتماد على طبقة الصوت، المعروف باسم "النغمة"، ليس زخرفاً شعرياً بل هو ضرورة قواعدية. فبدون علامات الطبقة الصحيحة، يمكن لجملة بسيطة أن تتحول إلى لغز محير بوجود عشرات المعاني المحتملة، مما يترك القراء في حيرة من أمرهم فيما إذا كان الأب قد تحرك داخل مزرعة كبيرة أم سيارة كبيرة. ولحل هذه المعضلة، يستخدم الكتاب نظاماً من العلامات التشكيلية (diacritics) — وهي علامات صغيرة توضع فوق أو تحت الحروف — للإشارة إلى هذه التغيرات في طبقة الصوت.
ومع ذلك، فإن العالم الرقمي لم يُصمم مع وضع هذه العلامات المعقدة في الاعتبار. فعندما وصلت الحواسيب لأولครั้ง، صُممت للتعامل مع الحروف القياسية من الأبجدية الإنجليزية، وليس مع الرموز المتعددة الطبقات المطلوبة للغات النغمية. وقد خلق هذا مشكلة مستمرة: فبينما كانت التكنولوجيا قادرة تقنياً على عرض العلامات، إلا أنها لم تكن تستطيع دائماً وضعها في مكانها الصحيح أو عدّها بشكل صحيح. فقد يبدو حرف يحمل علامة نغمية جيداً على شاشة ما، لكنه يتحول إلى مربع فارغ أو رمز في غير مكانه على شاشة أخرى. تبحث هذه الورقة التي كتبها كولا توبوسون في سبب حدوث ذلك، متتبعةً القضية من تاريخ الكتابة باللغة اليوروبية إلى القواعد الصارمة التي تحكم كيفية تخزين الحواسيب للنصوص اليوم. ويجادل المؤلف بأن النظام الحالي معطوب جوهرياً بالنسبة للغات النغمية، ويقترح تغييراً هيكلياً محدداً لإصلاحه.
بدأت قصة كتابة اليوروبا قبل عصر الكمبيوتر بوقت طويل. ففي الأصل كانت لغة شفهية، ثم دُوّنت لأول مرة بواسطة المبشرين والتجار في القرن التاسعي عشر باستخدام الأبجدية اللاتينية. عانى الكتاب الأوائل في تطويع الحروف الإنجليزية لتناسب لغة تهتم بطبقة الصوت. حاول البعض استخدام حروف إضافية، مثل إضافة "h" أو "r" لإظهار النغمة، بينما استخدم آخرون نقاطاً أو خطوطاً فوق الحروف المتحركة. ومع مرور الوقت، ظهر نظام قياسي يستخدم نقاطاً تحت بعض الحروف المتحركة وعلامات فوقها لإظهار الطبقة. وبحلول منتصف القرن العشرين، كان هذا النظام راسخاً، مما سمح للكتاب بالتمييز بين الكلمات التي تبدو متطابقة ولكنها تختلف في النطق. ولكن عندما حل العصر الرقمي، اصطدم هذا النظام المصمم بعناية بحائط سد.
يكمن جوهر المشكلة في كيفية تخزين الحواسيب للنصوص. ولجعل النصوص تنتقل بسهولة بين الأجهزة والبرامج المختلفة، أنشأت منظمة عالمية تسمى "اتحاد يونيكود" (Unicode Consortium) قائمة معيارية للحروف. في هذا النظام، غالباً ما يتم تخزين حرف يحمل علامة واحدة، مثل حرف "o" مع علامة تشكيل، كوحدة واحدة جاهزة. وهذا يعمل جيداً للعديد من اللغات. ومع ذلك، بالنسبة لليوروبا، يتطلب النظام تكديس علامتين مختلفتين على حرف واحد: نقطة تحت الحرف لتوضيح نوع الحرف المتحرك، وعلامة فوقه لتوضية طبقة الصوت. إن المعيار الرقمي الحالي لا يمتلك كوداً واحداً جاهزاً لهذه التوليفات المتراكمة. بدلاً من ذلك، يجبر الكمبيوتر على بناءها عن طريق لصق قطعتين منفصلتين معاً: الحرف الأساسي مع النقطة، ثم علامة النغمة في الأعلى.
وهذا الأسلوب في بناء الحروف قطعة بقطعة هو مكمن الخلل. فبينما قد يعمل على جهاز كمبيوتر واحد، يمكن للقطع أن تنفصل أو تنزاح عند نقل النص إلى منصة أخرى، أو خط مختلف، أو بلد آخر. قد يكتب الكاتب اسماً بشكل مثالي، ليجد علامة النغمة قد قفزت إلى الحرف الخطأ أو اختفت تماماً عند حفظ المستند أو طباعته. ويوثق المؤلف هذا الفشل عبر عقود من النشر، مستعرضاً أغلفة كتب حيث رُسمت علامات النغمة يدوياً بعد طباعة النص لأن آلات التنسيق لم تكن قادرة على التعامل معها. وفي المكتبات الرقمية، يقوم المشتغلون بالفهرسة أحياناً باستبدال الرموز الصحيحة برموز خاطئة بسبب فقدان الرموز الصحيحة، مما يجعل من المستحيل على الباحثين العثح على الكتب بعناوينها الحقيقية. وحتى منصات التواصل الاجتماعي، التي تعد كل حرف، تعامل هذه العلامات المتراكمة كحروف منفصلة متعددة، مما يحد بشكل غير عادل من كمية النصوص المكتوبة باللغة اليوروبية في المنشور الواحد.
تتحدى الورقة التفسير الرسمي لسبب عدم إمكانية إصلاح هذه الحروف. إذ يزعم اتحاد يونيكود أن نظامهم مستقر وأن إضافة تركيبات جاهزة جديدة من شأنها أن تكسر اتساق النصوص المخزنة في الأنظمة القديمة. ويجادلون بأن الطريقة الحالية لدمج القطع كافية، وأن المشكلات تنبع من سوء جودة الخطوط أو البرمجيات القديمة. ويعارض المؤلف هذا الادعاء، مشيراً إلى أن حالات الفشل تحدث حتى عندما يتم ترميز النصوص بشكل صحيح ونقلها بين أنظمة حديثة وعالية الجودة. إن القضية لا تتعلق فقط بكيفية ظهور النص، بل بكيفية سلوكه: فهو يفشل في البحث بشكل صحيح، ويُعد بشكل خاطئ، ويتلف عند النقل. ويشير المؤلف إلى أنه بينما فُتح المجال لآلاف الرموز التعبيرية (emojis) الجديدة في السنوات الأخيرة، فقد رفض النظام تحديث قواعده لتلبية الاحتياجات الأساسية للغات الأفريقية النغمية.
ولحل هذه المشكلة، تقترح الورقة تدخلاً مباشراً ومحدداً: إنشاء أربعة حروف جديدة جاهزة في المعيار الرقمي. ستكون هذه الحروف وحدات واحدة للحروف المتحركة المفتوحة "o" و "e" مع وجود نقطة تحتها وعلامة طبقة فوقها. ومن شأن هذا أن يسمح للنص بالانتقال كوحدة واحدة غير قابلة للكسر، مما يضمن أن تظل كلمة "يد" كلمة "يد" أينما قرئت. ويقر المؤلف بأن الأدوات الحالية، مثل لوحات المفاتد المتخصصة أو البرامج التي تضيف علامات النغمة تلقائياً، قد سهلت الكتابة، لكنها تظل مجرد حلول مؤقتة. فهي لا تعالج الخلل الهيكلي الأساسي الذي يتسبب في تضرر النص عند انتقاله.
الخلاصة هي أن المشكلة ليست في نقص الجهد من جانب الكتاب أو فشل في برمجيات فردية، بل هي فجوة في القواعد العالمية التي تحكم التواصل الرقمي. ويجادل المؤلف بأن اتحاد يونيكود يمتلك القدرة التقنية على إصلاح ذلك، وأن القيام بذلك ضروري لبقاء واستخدام اللغة بشكل سليم في العالم الحديث. ومن خلال إنشاء هذه الحروف الأربعة المحددة، يمكن للعالم الرقمي أخيراً دعم لغة اليوروبا بنفس الطريقة التي يدعم بها اللغات التي لا تتطلب علامات متراكمة. لن يساعد هذا ملايين المتحدثين باليوروبا فحسب، بل سيضع أيضاً سابقة للغات النغمية الأخرى التي تواجه نفس الحواجز الرقمية. وتعد هذه الورقة سجلاً للصراع وخارطة طريق واضحة لحل كان ينتظر منذ عقود.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.