← أحدث الأبحاث
💬 NLP

Calibrating LLMs with Semantic-level Reward

تقترح الورقة البحثية "المعايرة بالمكافأة الدلالية" (CSR)، وهو إطار عمل يعمل على تحسين معايرة عدم اليقين في النماذج اللغوية الكبيرة من خلال استبدال درجات الثقة اللفظية غير المتسقة بمكافأة على المستوى الدلالي تشجع على الاتفاق بين المخرجات الصحيحة وتثبط الاتساق الزائف بين المخرجات غير الصحيحة، محققاً بذلك معدلات خطأ أقل بكثير وموثوقية أعلى عبر مختلف المعايير المرجعية.

المؤلفون الأصليون: Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

نُشر 2026-05-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "معايرة النماذج اللغوية الكبيرة باستخدام المكافأة على المستوى الدلالي" (Calibrating LLMs with Semantic-Level Reward) بلغة بسيطة واستخدام تشبيهات من الحياة اليومية.

المشكلة: لعبة التخمين المفرط في الثقة

تخيل أنك تخوض اختبارًا مهمًا جدًا، مثل امتحان ترخيص طبي. لديك زميل دراسة (الذكاء الاصطناعي) يساعدك في الإجابة على الأسئلة.

في الوقت الحالي، معظم طرق تدريب الذكاء الاصطناعي تشبه المعلم الذي يهتم فقط بما إذا كانت الإجابة النهائية صحيحة أم خاطئة.

  • إذا خمن زميل الدراسة أن "السماء خضراء" بثقة 100% وأخطأ، يعطيه المعلم صفرًا.
  • إذا خمن زميل الدراسة أن "السماء زرقاء" بثقة 100% وأصاب، يعطيه المعلم نجمة ذهبية.

ما هي المشكلة؟ المعلم يعامل التخمين الخاطئ الواثق تمامًا مثل التخمين الصحيح الواثق من حيث إشارة "صح/خطأ". هذا يعلم الذكاء الاصطناعي أن يكون "مقامرًا واثقًا". فهو يتعلم أن أن يكون صاخبًا ومؤكدًا أمر جيد، حتى لو كان مخطئًا. وفي المواقف عالية الخطورة (مثل القانون أو الطب)، يكون التخمين الخاطئ الواثق خطيرًا لأنك قد تثق به أكثر مما ينبغي.

الحل القديم: طلب قول الذكاء الاصطناعي "مدى تأكده"

حاول الباحثون إصلاح ذلك بتعليم الذكاء الاصطنا strip يقول: "أنا متأكد بنسبة 80%". كانوا يكافئون الذكاء الاصطناعي إذا تطابقت درجة ثقته مع عدد المرات التي كان فيها محقًا بالفعل.

العيب: تجادل الورقة البحثية بأن هذا يشبه طلب كتابة مدى ثقة الشخص على ورقة. ولكن إذا سألت نفس الشخص نفس السؤال بطريقة مختلفة قليلاً (مثل: "ما لون السماء؟" مقابل "أخبرني بلون السماء")، فقد يكتب "80%" للأول و"90%" للثاني، رغم أنه يشعر بنفس الشعور.

تظهر الورقة أن درجات "الثقة اللفظية" هذه غير مستقرة. فهي تتغير بناءً على كيفية طرح السؤال، وليس بناءً على الحقيقة الفعلية. الأمر يشبه خبير الأرصاد الجوية الذي يغير توقعاته لمجرد أنك طلبت منه ارتداء قميص أزرق بدلاً من الأحمر.

الحل الجديد: CSR (المعايرة باستخدام المكافأة الدلالية)

يقترح المؤلفون طريقة جديدة تسمى CSR. بدلاً من طلب قول الذكاء الاصطناعي لمدى ثقته، هم يتركون سلوك الذكاء الاصطناعي يظهر مدى ثقته.

التشبيه: "حشد المستكشفين"

تخيل أنك أرسلت 8 مستكشفين مختلفين (يُطلق عليهم اسم "rollouts") إلى غابة للعثور على كنز مخفي (الإجابة الصحيحة).

  1. إذا كان الكنز سهل العثور عليه (الإجابة الصحيحة):

    • باستخدام CSR: يعود المستكشفون الثمانية ويقولون: "لقد وجدناه عند شجرة البلوط الكبيرة!" جميعهم يتفقون. ولأنهم جميعًا يتفقون على معنى الموقع، يعرف النظام: "واو، الذكاء الاصطناعي واثق جدًا ومن المرجح أنه محق".
    • المكافأة: يحصل الذكاء الاصطناعي على مكافأة لهذا الاتفاق.
  2. إذا كان الكنز صعب العث {الإجابة الخاطئة):

    • باستخدام CSR: يعود المستكشفون بقصص مختلفة. أحدهم يقول: "إنه بالقرب من النهر". والآخر يقول: "إنه في كهف". والآخر يقول: "إنه تحت صخرة". إنهم جميعًا يتحدثون عن أشياء مختلفة.
    • المكافأة: يرى النظام هذه الفوضى ويقول: "هذا الذكاء الاصطناعي مرتبك ومن المرجح أنه مخطئ". ويقوم بمعاقبة الذكاء الاصطناعي على هذا الافتقار إلى الاتفاق.

المكون السحري:
تقدم الورقة البحثية "مكافأة دلالية" خاصة. هي لا تهتم إذا استخدم المستكشفون نفس الكلمات بالضبط (مثل "شجرة البلوط" مقابل "الشجرة الكبيرة ذات الأوراق العريضة"). بل تستخدم "حكماً" ليرى ما إذا كانوا يقصدون نفس الشيء.

  • إذا كان الذكنا الاصطناعي محقًا، فإن المكافأة تشجع المستكشفين الثمانية على التجمع معًا في مجموعة واحدة متماسكة (اتفاق عالٍ).
  • إذا كان الذكاء الاصطناعي مخطئًا، فإن المكافأة تشجع المستكشفين الثمانية على التشتت في اتجاهات مختلفة (اتفاق منخفض).

لماذا هذا أفضل؟

  1. لا حاجة لـ "رمز الثقة": لا يتعين على الذكاء الاصطناعي التوقف وقول "أنا متأكد بنسبة 90%". هو فقط يجيب على السؤال. النظام يستنتج الثقة من خلال النظر في مدى اتفاق الإجابات الثمانية المختلفة مع بعضها البعض.
  2. نتائج مستقرة: لأن النظام ينظر إلى معنى الإجابات بدلاً من الكلمات المحددة، فإنه لا يرتبك بسبب كيفية صياغة السؤال.
  3. سلامة أفضل: اختبرت الورقة هذه الطريقة على ثلاثة نماذج ذكاء اصطنا_م مختلفة (Llama, Qwen, Mistral) وأربعة أنواع من الأسئلة. ووجدوا أن CSR جعلت الذكاء الاصطناعي أفضل بكثير في معرفة متى كان محقًا ومتى كان مخطئًا.
    • قلل "خطأ المعايرة المتوقع" (وهو مقياس لمدى ارتباك الذكاء الاصطناعي) بنسبة تصل إلى 40%.
    • حسن القدرة على ترتيب الإجابات الصحيحة في مرتبة أعلى من الإجابات الخاطة بنسبة تصل إلى 31%.

الملخص

تقول الورقة البحثية: توقف عن سؤال الذكاء الاصطناعي ليخبرك بمدى تأكده. بدلاً من ذلك، اطلب منه تقديم 8 إجابات مختلفة. إذا كانت الإجابات الثماني تعني نفس الشيء، فالذكاء الاصطناعي واثق ومن المرجح أنه محق. أما إذا كانت الإجابات الثماني مشتتة في كل مكان، فالذكاء الاصطناعي مرتبك ومن المرجح أنه مخطئ.

هذه الطريقة تجعل الذكاء الاصطناعي أكثر أمانًا وموثوقية دون الحاجة إلى كتابة جمل إضافية حول مشاعره.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →