تنتقد هذه الورقة حدود نظام TeX في عصر النماذج اللغوية الكبيرة وتقدم Mogan STEM، وهو محرر هيكلي يعتمد على مبدأ "ما تراه هو ما تحصل عليه" (WYSIWYG)، يوفر كفاءة فائقة في التجميع، وتحديداً دقيقاً لمواضع الأخطاء، وإنتروبيا معلوماتية أقل من أجل ضبط أدق للنماذج اللغوية الكبيرة.
المؤلفون الأصليون:Tianyou Liu, Ziqiang Li, Xurui Liu, Yansong Li
تخيل أنك تحاول كتابة ورقة علمية. لعقود من الزمن، كانت الأداة القياسية لهذا العمل هي LaTeX (المبني على نظام TeX القديم). فكر في LaTeX كأنه خريطة يدوية قديمة. إنها دقيقة للغاية وقد استخدمها المستكشفون لمدة 40 عامًا، ولكن بها بعض العيات الجوهرية:
بطيئة في التحديث: إذا قمت بتغيير اسم شارع واحد على الخريطة، يجب عليك إعادة رسم الخريطة بالكامل من الصفر لترى ما إذا كان المسار لا يزال يعمل.
مربكة: إذا ارتكبت خطأً صغيرًا (مثل فاصلة مفقودة)، فإن الخريطة لا تخبرك أين أخطأت؛ بل تقول فقط: "الرحلة بأكملها فشلت"، وعليك أن تخمن أي جزء هو الذي تعطل.
ثقيلة: لاستخدام هذه الخريطة، تحتاج إلى حمل حقيبة ظهر ضخمة مليئة بكل لافتات الطرق والخطوط وكتيبات القواعد الممكنة، حتى لو كنت تريد فقط المشي إلى متجر البقالة في زاوية الشارع.
يجادل مؤلفو هذه الورقة بأنه في عصر الذكاء الاصطناعي (النماذج اللغوية الكبيرة أو LLMs)، أصبح استخدام هذه الخريطة القديمة عبئًا. لذا يقترحون أداة جديدة تسمى Mogan STEM، وهي تشبه نظام GPS حديث. فهي تُحدث نفسها فورًا، وتخبرك بمكانك بالضبط، ولا تُحمل إلا الميزات التي تحتاجها في تلك اللحظة.
المشكلات في الطريقة القديمة (LaTeX)
توضح الورقة ثلاث مشكلات رئيسية تسببها LaTeX:
1. مشكلة "إعادة الكتابة بالكامل" (المعالجة بالدفعات - Batch Processing)
التشبيه: تخيل أنك تكتب قصة. في الطريقة القديمة، في كل مرة تحذف فيها فقرة، يتعين على الكمبيوتر إعادة قراءة قصتك بأكملها من الصفحة الأولى وحتى النهاية، فقط ليرى ما إذا كانت أرقام الصفحات لا تزال صحيحة.
الواقع: تعمل LaTeX بنظام "الدفعات". فهي تقرأ الكود الخاص بك، وتجري العمليات الحسابية، ثم تخرج ملف PDF. إذا غيرت كلمة واحدة، فهي لا تقوم بتحديث تلك الكلمة فحسب، بل تعيد تشغيل العملية برمتها. هذا يجعل الأمر بطيئًا ومحبطًا عندما تريد الحصول على استجابة فورية.
2. مشكلة "المعصوب العينين" (تحديد موقع الخطأ - Error Localization)
التشبيه: تخيل أنك تبني قلعة من قطع الليغو (Lego). لقد نسيت وضع قطعة في الأساس. في الطريقة القديمة، لا تنهار القلعة فورًا. تستمر في بناء البرج، وفقط عندما تحاول وضع العلم في الأعلى ينهار كل شيء. ثم يقول لك الكمبيوتر: "خطأ! العلم لن يثبت!"، لكنه لا يخبرك أن الأساس كان مفقودًا.
الواقع: غالبًا ما تخفي LaTeX الأخطاء. خطأ مطبعي صغير في الفقرة الأولى قد يتسبب في انهيار (عطل) في الفقرة الأخيرة. رسالة الخطأ تشير إلى موقع الانهيار، وليس إلى السبب، مما يجعل إصلاحها كابوسًا.
3. مشكلة "حقيبة الظهر" (التثبيت والتعقيد)
التشبيه: لاستخدام LaTeX، عليك تحميل "مطبخ" يتضمن كل الأجهزة الممكنة (محمص خبز، خلاط، فرن صناعي) حتى لو كنت تريد فقط تحميص قطعة خبز.
الواقع: تثبيت LaTeX ضخم (يصل إلى ما يقرب من 6 جيجابايت). ويتطلب إعدادًا معقدًا وعدة خطوات لمجرد تشغيل مستند بسيط.
الحل الجديد: Mogan STEM
يقدم المؤلفون Mogan STEM، وهو محرر جديد مصمم لإصلاح هذه المشكلات.
1. هيكل "الشجرة الحية"
التشبيه: بدلاً من نص طويل متدفق (مثل LaTeX)، ينظم Mogan مستندك مثل شجرة العائلة أو المخطط الانسيابي. كل قسم، وكل معادلة، وكل صورة هي "عقدة" (Node) متميزة (أي فرع).
الفائدة: إذا قمت بتغيير فرع (مثل معادلة رياضية)، يقوم الكمبيوتر بإعادة حساب ذلك الفرع المحدد فقط. إنه لا يمس بقية الشجرة. وهذا يجعل العملية سريعة للغاية.
2. "ما تراه هو ما تحصل عليه" (WYSIWYG)
التشبيه: مع LaTeX، تكتب كودًا مثل 21 وتأمل أن يبدو صحيحًا. مع Mogan، أنت فقط تكتب الكسر، ويظهر ككسر فورًا، تمامًا مثل Microsoft Word، ولكن مع قدرات محرر الرياضيات الخارقة.
الفائدة: لن تضطر أبدًا للتخمين ما إذا كان الكود الخاص بك صحيحًا أم لا. إذا ارتكبت خطأً، سيكتشفه المحرر في مكانه مباشرة، حتى لا تضطر للانتظار حتى يحدث "انهيار" لتكتشف ذلك.
3. حقيبة الظهر "عند الطلب"
التشبيه: بدلاً من حمل حقيبة ظهر مليئة بالأدوات، فإن Mogan يشبه صندوق أدوات ذكي. فهو يسحب المطرقة فقط عندما تحتاج إلى دق مسمار، والمفك عندما تحتاج إلى ربط مسمار.
الفائدة: البرنامج صغير جدًا (حوالي 100 ميجابايت) ويبدأ العمل فورًا. إنه لا يهدر مساحة على أشياء لا تستخدمها.
لماذا يهم هذا الذكاء الاصطناعي (السر الخفي)
هذا هو الجزء الأكثر إثارة في الورقة. اختبر المؤلفون مدى قدرة نماذج الذكاء الاصطناعي (مثل تلك التي تكتب هذا الملخص) على فهم هذين التنسيقين.
النتيجة: يتعلم الذكاء الاصطناعي من ملفات Mogan بشكل أفضل بكثير من ملفات LaTeX.
التشبيه:
LaTeX يشبه وصفة طبخ مكتوبة بشفرة سرية: "أضف كوبين من الدقيق، ثم إذا كان الفرن ساخنًا، أضف بيضة واحدة، ولكن إذا كان الدقيق من العلامة التجارية (X)، فأضف بيضتين". إنها مليئة بالضجيج والتعليمات المربكة.
النتيجة: نظرًا لأن Mogan منظم ومنطقي (مثل الشجرة)، يمكن للذكاء الاصطناعي التنبؤ بما سيأتي بعد ذلك بسهولة أكبر. توضح الورقة أنه عند تدريب الذكاء الاصطناعي على كتابة الرياضيات أو العلوم، فإن استخدام ملفات Mogan يجعل الذكاء الاصطناعي أكثر ذكاءً، وأسرع، وأقل عرضة للوقوع في الأخطاء.
الخلاصة
تجادل الورقة بأنه بينما كان LaTeX بطلاً في الثمانينيات، فإنه يعيق تقدمنا اليوم. إنه بطيء للغاية، ومربك، وثقيل بالنسبة لعصرنا الحالي الذي يتطلب استجابة فورية وتعاونًا مع الذكاء الاصطناعي.
Mogan STEM هو الترقية التي نحتاجها: فهو سريع، وسهل الاستخدام، ويصلح الأخطاء فورًا، ويتحدث اللغة التي يفهمها الذكاء الاصطناعي بشكل أفضل. يدعو المؤلفون العلماء والمطورين للبدء في الانتقال إلى هذا التنسيق الجديد لجعل كتابة الأبح الورقية وتدريب الذكاء الاصطناعي أكثر كفاءة.
إليك ملخص تقني مفصل لورقة البحث بعنوان "LATEX Compilation: Challenges in the Era of LLMs" (تجميع LaTeX: التحديات في عصر النماذج اللغوية الكبيرة) من قبل Liu وآخرون.
1. بيان المشكلة
تجادل الورقة بأنه بينما ظل TeX/LaTeX المعيار الفعلي للطباعة العلمية لعقود، فإن بنيته التحتية غير ملائمة جوهرياً للعصر الحديث المتمثل في النماذج اللغوية الكبيرة (LLMs) والكتابة التفاعلية في الوقت الفعلي. حدد المؤلفون ثلاث فئات أساسية من القيود:
عيوب بنية التجميع (Compilation Architecture):
المعالجة بالدفعات وأحادية الاتجاه: يستخدم TeX نموذج معالجة خطي أحادي المسار (أو متعدد المسارات). إنه يفتقر إلى حالة هيكلية وسيطة، مما يعني أن التعديلات المحلية تتطلب إعادة تجميع كاملة (لا توجد تحديثات تدريجية).
التغذية الراجعة المتأخرة: الأخطاء (مثل الأقواس غير المغلقة) غالباً ما تظهر بعيداً عن مصدرها، وأحياناً بعد عدة عمليات تجميع، مما يجعل تصحيح الأخطاء أمراً صعباً.
ضعف الدلالات (Semantics): تحليل القواعد (Syntax parsing)، وتوسيع الماكرو (Macro expansion)، والطباعة مرتبطة ببعضها بشكل وثيق. أوامر مثل \section تدمج بين الدلالات الهيكلية وتعليمات التنسيق، مما يمنع أدوات التحليل الساكن من فهم بنية المستند دون تنفيذ الكود.
مشكلات تجربة المستخدم والنظام البيئي:
التجزئة: توجد محركات متعددة (pdfLaTeX، XeLaTeX، LuaLaTeX) بميزات غير متوافقة (مثل دعم Unicode)، مما يجبر المستخدمين على إدارة سير عمل معقد. cast التضخم: نمت توزيعات مثل TeX Live لتصل إلى حوالي 6 جيجابايت، مع أعباء إضافية هائلة للمستخدمين الأساسيين.
محدودية الأدوات: المعاينات في الوقت الفعلي في المحررات هي مجرد محاكاة لعمليات التجميع في الخلفية، مما يؤدي إلى زمن انتقال وعدم اتساق في التنسيق.
عدم كفاءة النماذج اللغوية الكبيرة (LLM Inefficiency):
الاعتلاج العالي (High Entropy): قواعد LaTeX صاخبة وغامضة (على سبيل المثال، طرق متعددة لكتابة نفس الصيغة الرياضية)، مما يزيد من تكلفة الرموز (Tokens) ويسبب الارتباك للنماذج اللغوية الكبيرة.
العتامة الهيكلية: تواجه النماذج اللغوية الكبيرة صعوبة في تحليل بنية المستند (المراجع، الأقسام) لأن البنية المنطقية مخفية خلف توسيع الماكرو وتتطلب عدة عمليات تجميع لحلها.
2. المنهجية والحل المقترح: Mogan STEM
قدم المؤلفون Mogan STEM، وهو محرر مهيكل يعتمد على مبدأ "ما تراه هو ما تحصل عليه" (WYSIWYG) بناءً على GNU TeXmacs، كبديل متفوق.
البنية الأساسية:
التمثيل القائم على الأشجار: على عكس تدفق الرموز الخطي في LaTeX، يمثل Mogan المستندات والصيغ كـ أشجار مهيكلة (باستخدام تعبيرات S-expressions في لغة Scheme). على سبيل المثال، يتم تخزين الكسر كـ (frac "1" "2") بدلاً من \frac{1}{2}.
الرسم الوظيفي (Functional Rendering): تُعامل الرموز الرياضية كدوال (مثل الأقواس القابلة للتوسع) بدلاً من سلاسل نصية ثابتة.
التحميل عند الطلب: بدلاً من مستودع حزم ضخم مثبت مسبقاً، يستخدم Mogan نواة متجانسة مع إضافات (Plugins) يتم تحميلها ديناميكياً فقط عندما تستدعيها هياكل مستندات معينة.
التصميم التجريبي:
اختبارات الأداء: مقارنة أوقات التجميع/الرسم وسرعات التحديث التدريجي بين LaTeX وMogan STEM عبر 6 أوراق بحثية حقيقية من arXiv.
تقييم مهام النماذج اللغوية الكبيرة: اختبار 4 نماذج رائدة (Deepseek، Claude، Gemini، ChatGPT) في ثلاث مهام:
تحديد بنية المستند.
دمج الملفات ذات أنماط المستندات المتعارضة (الماكرو/الحزم).
تصحيح المستندات غير السليمة باستخدام رسائل الخطأ.
كفاءة الضبط الدقيق (Fine-Tuning): إجراء تجربة ضبط دقيق تحت الإشراف (SFT) باستخدام تقنية LoRA على نموذج Qwen2.5-7B للتنبؤ بالرمز التالي في تنسيقات LaTeX مقابل Mogan.
3. المساهمات الرئيسية
التحليل النقدي لـ TeX: تفكيك منهجي لعيوب بنية TeX (المعالجة بالدفعات، غياب التحديثات التدريجية، الاقتران الدلالي) التي تعيق التكامل مع الذكاء الاصطناعي الحديث.
تقديم Mogan STEM: عرض محرر مهيكل قائم على الأشجار يفصل المحتوى عن التنسيق، مما يتيح الرسم الفوري وعزل الأخطاء.
الأدلة التجريبية للنماذج اللغوية الكبيرة:
اعتلاج معلوماتي منخفض: تنسيق .tmu الخاص بـ Mogan (الشجرة المهيكلة) أكثر حتمية وأقل غموضاً من LaTeX، مما يسهل على النماذج تعلمه والتنبؤ به.
تحديد موقع الخطأ: يتم تحديد الأخطاء في Mogan ضمن عقد شجرية محددة، بينما تنتشر أخطاء LaTeX عالمياً، مما يربك النماذج اللغوية الكبيرة.
نتائج الضبط الدقيق: أظهرت التجارب أن الضبط الدقيق للنماذج اللغوية الكبيرة على بيانات Mogan يؤدي إلى تقارب أسرع وخسارة (Loss) أقل مقارنة ببيانات LaTeX بسبب انخفاض الضجيج النحوي.
4. النتائج التجريبية
سرعة التجميع/الرسم:
تفوق Mogal STEM على LaTeX في التحديثات التدريجية عبر جميع المستندات المختبرة (أسرع بـ 10 مرات في بعض الحالات) لأنه يعيد رسم العقد الشجرية المتأثرة فقط.
بالنسبة للتجميع الكامل، كان Mogan منافساً أو أسرع، رغم أن المستندات الكبيرة (أكثر من 120 صفحة) أظهرت عبئاً أعلى في الإدخال/الإخراج بسبب طبيعة WYSIWYG.
أداء النماذج اللغوية الكبيرة:
تحديد البنية: سمحت ملفات Mogan للنماذج اللغوية بتحديد الأقسام والمراجع بشكل أسرع بكثير (درجات منفعة أعلى) لأن المراجع تُخزن كروابط هيكلية صريحة بدلاً من الحاجة إلى التجميع لحلها.
دمج الملفات: حقق Mogan درجات تقارب المثالية في دمج أنماط المستندات المتعارضة. عانت النماذج اللغوية مع LaTeX بسبب تعدد الأسماء (Aliasing) وتضارب الحزم، بينما قضت قواعد Mogane المتسقة على هذا الغموض.
تصحيح الأخطاء: حلت النماذج اللغوية جميع حالات خطأ Mogan بسرعة. في المقابل، استهلكت النماذج اللغوية عدداً مفرطاً من الرموز (Tokens) لمحاولة تصحيح أخطاء LaTeX لأن سجلات الأخطاء كانت طويلة ومنفصلة عن السبب الجذري.
الضبط الدقيق (LoRA):
على مجموعة بيانات تضم 1,000 صيغة رياضية، وصل النموذج المدرب على بيانات Mogan إلى خسارة تقارب ~0.4، بينما وصل النموذج المدرب على LaTeX إلى ~0.7.
يعزو المؤلفون ذلك إلى الاعتلاج المنخفض للمعلومات في Mogan وغياب "الضجيج النحوي" (على سبيل المثال، يسمح LaTeX بوجود عدة قواعد نحوية متكافئة لنفس المخرج، مما يربك النموذج).
5. الأهمية
تطرح الورقة تحولاً جذرياً في الكتابة العلمية في عصر الذكاء الاصطناعي:
من المعالجة بالدفعات إلى التفاعل: الانتقال من التجميع بالدفعات نحو التحرير المهيكل والتدريجي أمر ضروري للتعاون في الوقت الفعلي والكتابة بمساعدة الذكاء الاصطناعي.
تنسيقات أصلية للذكاء الاصطناعي (AI-Native Formats): يُقدم تنسيق .tmu (أو تنسيقات الأشجار المهيكلة المماثلة) كصيغة بيانات تدريب متفوقة للنماذج اللغوية الكبيرة. فهو يقلل تكلفة الرموز، ويحسن دقة الاستدلال فيما يتعلق ببنية المستند، ويسرع تقارب النماذج.
مستقبل الأدوات: يدعو المؤلفون إلى الانتقال بعيداً عن "الدين الموروث" لـ TeX. ويرون أنه بينما تعمل منصات مثل Overleaf على تحسين الواجهة لـ LaTeX، إلا أنها لا تحل العيوب البنيوية. إن هناك حاجة لجيل جديد من المحررات المهيكلة (مثل Mogan) للاستفادة الكاملة من قدرات النماذج اللغوية الكبيرة الحديثة.
في الختام، تشير الورقة إلى أن TeX هو أثر تاريخي، ورغم قوته في الطباعة الثابتة، إلا أنه يشكل عائقاً أمام سير العمل العلمي الديناميكي المدفوع بالذكاء الاصطناعي. إن اعتماد التنسيقات المهيكلة القائمة على الأشجار مثل Mogan STEM يوفر فوائد فورية في السرعة، وسهولة الاستخدام، والتوافق مع الذكاء الاصطناعي.