← أحدث الأبحاث
💬 NLP

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

تقدم هذه الورقة "فقدان الإنتروبيا الرقمية" (Digit Entropy Loss - DEL)، وهو هدف تدريب مبتكر يعيد صياغة تحسين الإنتروبيا غير الخاضع للإشراف إلى إطار عمل خاضع للإشراف وخالٍ من المسافة، وذلك لتحسين دقة النماذج اللغوية الكبيرة في التنبؤ بكل من الأعداد الصحيحة والأعداد العشرية عبر مهام الاستدلال الرياضي وتوليد الكود البرمجي.

المؤلفون الأصليون: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تقوم بتعليم روبوت ذكي جداً، ولكنه مرتبك قليلاً، كيف يقوم بالرياضيات. هذا الروبوت بارع في كتابة القصص والدردشة، ولكن عندما يتعلق الأمر بالأرقام، فإنه غالباً ما يخطئ في الأرقام. قد يقول "12" بينما الإجابة هي "13"، أو قد يخمن "14" بدلاً من "12".

هذه الورقة البحثية، الصادرة عن مختبر الحوسبة المرئية في جامعة هونغ كونغ المتعددة التقنيات، تقدم طريقة جديدة لتعليم هذا الروبوت كيفية التعامل مع الأرقام بشكل أفضل. إنهم يسمون طريقتهم الجديدة فقدان اعتلاج الرقم (Digit Entropy Loss - DEL).

إليك قصة كيف أصلحوا مهارات الروبوت في الرياضيات، باستخدام تشبيهات بسيطة:

1. المشكلة: عادة الروبوت في "التخمين الأفضل"

تقليدياً، عندما نقوم بتدريب هذه الروبوتات الذكية (التي تسمى النماذج اللغوية الكبيرة)، نستخدم طريقة تسمى تقدير الاحتمال الأقصى (Maximum Likelihood Estimation - MLE).

  • التشبيه: تخيل أن الروبوت يخوض اختباراً من نوع الاختيار من متعدد. تخبره طريقة MLE: "فقط اختر الإجابة التي تعتقد أنها الأكثر احتمالاً".
  • العيب: الروبوت مهذب للغاية. يفكر قائلاً: "حسناً، '12' هي أفضل إجابة، لكن '13' و'11' قريبتان نوعاً ما، لذا سأعطيهما نسبة احتمالية ضئيلة أيضاً".
  • النتيجة: يصبح الروبوت متردداً. إنه يحوم بين الأرقام، مما يؤدي إلى أخطاء مثل قول "12.4" بينما يجب أن تكون الإجابة رقماً صحيحاً، أو ببساطة اختيار الرقم الخطأ لأنه لم يكن واثقاً بما يكفي.

2. الحلول القديمة: "فخ المسافة"

حاول الباحثون إصلاح ذلك بإضافة نظام "جزاءات".

  • التشبيه: أخبروا الروبوت: "إذا كانت الإجابة هي 5، وخمنت أنت 4، فلا بأس، هذا قريب. لكن إذا خمنت 9، فهذا سيء جداً!". لقد أنشأوا خريطة حيث تترتب الأرقام في خط، ويُعاقب الروبوت بناءً على مدى بعد تخمينه عن الحقيقة.
  • المشكلة: تجادل الورقة البحثية بأن "خريطة المسافة" هذه اصطناعية. في العالم الحقيقي، الأرقام ليست مجرد نقاط على خط؛ بل هي رموز لها معانيها الخاصة. أحياناً، يتعلم الروبوت أن الرقم "2" يشبه حرف "Z" أكثر مما يشبه الرقم "3". إجبار الروبوت على اتباع قاعدة مسافة صارمة يربكه ويجعل تخميناته إما شديدة الصلابة (حادة) أو غامضة جداً (مسطحة).

3. الحل الجديد: "مدرب الثقة" (DEL)

يقترح المؤلفون فقدان اعتلاج الرقم (Digit Entropy Loss - DEL). بدلاً من قياس مدى بعد الروبوت عن الإجابة، هم يركزون على مدى تأكده.

  • التشبيه: تخيل مدرباً لا يهتم بالمسافة بين تخمينك والهدف. بدلاً من ذلك، يقول المدرب: "لا يهمني إذا كنت قريباً أو بعيداً. أنا فقط أريدك أن تكون متأكداً بنسبة 100% من إجابتك. إذا كنت متأكداً بنسبة 90% من '5' و10% من '6'، فأنت متردد. أريدك أن تكون متأكداً بنسبة 100% من '5' و0% من أي شيء آخر".
  • كيف يعمل:
    1. اليقين الخاضع للإشراف: يعلمون الروبوت أن يعامل كل رقم كأنه سؤال بسيط من نوع "نعم/لا". "هل هذا الرقم هو 5؟ نعم أم لا؟" هذا يجبر الروبوت على اتخاذ قرار حاد وواضح بدلاً من التخمين الضبابي.
    2. لا قواعد للمسافة: يتخلصون من "خريطة المسافة". يتركون الروبوت يتعلم العلاقة الطبيعية بين الأرقام بناءً على البيانات التي رآها، بدلاً من فرض قاعدة بشرية الصنع عليه.
    3. التعامل مع الكسور العشرية: الطرق السابقة كانت تعامل الأعداد الصحيحة (مثل 10) والأجزاء العشرية (مثل 10.5) بشكل مختلف، مما يسبب "منحدراً" حيث يتعثر الروبوت. تعامل طريقة DEL مع العدد الصحيح والجزء العشري كتدفق واحد مستمر وسلس، مثل خط أرقام طويل واحد بدلاً من جزيرتين منفصلتين.

4. النتائج: رياضيات أكثر حدة

اختبر الباحثون هذا "المدرب الواثق" الجديد على أربعة أنواع مختلفة من الروبوتات الذكية (CodeLlama, Mistral, DeepSeek, Qwen-2.5) باستخدام سبعة معايسات رياضية مختلفة.

  • النتيجة: الروبوتات التي تدربت باستخدام DEL ارتكبت أخطاء أقل. لم تكن تحصل على الإجابة الصحيحة بشكل متكرر فحسب؛ بل عندما كانت تخطئ، كانت الإجابة الخاطئة أقرب بكثير إلى الإجابة الصحيحة (على سبيل المثال، تخمين 12 بدلاً من 13، بدلاً من 50).
  • الدليل البصري: في أمثلة الورقة البحثية، يمكنك أن ترى أن الطرق القديمة غالباً ما كانت تصيب المنطق ولكن تخطئ في الرقم النهائي (مثل حساب التكلفة الإجمالية لرحلة تسوق ولكن الحصول على المبلغ النهائي بالدولار بشكل خاطئ). طريقة DEL حصلت على كل من المنطق والرقم النهائي بشكل صحيح.

الملخص

باخت_صار، تقول هذه الورقة البحثية: توقفوا عن تعليم الروبوتات الذكية كيفية تخمين مدى "قرب" الرقم. بدلاً من ذلك، علموهم أن يكونوا متأكدين تماماً من الرقم الدقيق الذي يتوقعونه. من خلال إزالة قواعد المسافة الاصطناعية والتركيز على بناء توقعات حادة وواثقة، أصبح الروبوتات أفضل بكثير في الرياضيات وتوليد الأكواد البرمجية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →