← أحدث الأبحاث
🤖 machine learning

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

من خلال تطبيق نماذج الثقة من الدرجة الثانية المستمدة من علم الأعصاب القراري، تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تمتلك إشارة تقييمية داخلية — وتحديداً مخزنة عند سطر ما بعد الإجابة الجديد (PANL) — تتنبأ بشكل مستقل باكتشاف الخطأ وتحدد ما إذا كان النموذج يمتلك المعرفة اللازمة للتصحيح الذاتي.

المؤلفون الأصليون: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

نُشر 2026-04-27
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Velickovic, Nathaniel Daw

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تخوض اختبار معلومات عام عالي المخاطر. كتبت إجابة، ولكن قبل أن تنتقل إلى السؤال التالي، تمر بلحظة من أجزاء الثانية تفكر فيها: "مهلاً، هل كانت تلك الإجابة صحيحة حقاً؟"

تستكشف هذه الورقة البحثية ما إذا كانت النماذج اللغوية الكبيرة (LLMs) —وهي العقول الكامنة وراء الذكاء الاصطناعي مثل ChatGPT— تمتلك نفس لحظة "الشعور الحدسي" هذه، والأهم من ذلك، ما إذا كان بإمكانها استخدام هذا الشعور لتصحيح أخطائها.

إليك تفصيل لاكتشافهم باستخدام بعض التشبيهات البسيطة.

1. "دماغ الدرجة الأولى" مقابل "دماغ الدرجة الثانية"

استخدم الباحثون مفهوماً من علم الأعصاب لشرح كيفية تفكيرنا.

  • دماغ الدرجة الأولى (الطيار الآلي): تخيل أنك عازف بيانو محترف يعزف مقطوعة سريعة. أنت مركز بشدة على عزف النوتات الصحيحة لدرجة أنك لا تفكر فعلياً في الموسيقى؛ أنت فقط تستجيب. إذا عزفت نوتة خاطئة، فإن "الطيار الآلي" لديك لا يهتم — فهو يستمر فقط لأن النوتة التي عزفها للتو هي التي كان ينوي عزفها في ذهنه. هذا هو حال معظم أنظمة الذكاء الاصطناي: فهي تتنبأ بالكلمة التالية بناءً على الاحتمالات. وإذا اختارت كلمة خاطئة، فإن حساباتها الداخلية تقول: "أنا متأكد بنسبة 99% أن هذه هي الكلمة الصحيحة"، مما يجعل من المستحيل على الذكاء الاصطناعي إدراك أنه ارتكب خطأً.
  • دماغ الدرجة الثانية (الناقد): الآن، تخيل أن نفس عازف البيانو لديه "ناقد" يجلس على كتفه. الناقد لا يعزف على البيانو؛ هو فقط يستمع. حتى لو كان الطيار الآلي يعزف، يمكن للناقد أن يسمع نوتة نشاز ويفكر: "هذا بدا خاطئاً".

الاكتشاف: وجد الباحثون أن النماذج اللغوية الكبيرة تمتلك بالفعل هذا "الناقد". فحتى عندما يقوم "الطيار الآلي" بإخراج إجابة خاطئة بثقة، هناك إشارة داخلية منفصلة تدرك: "مهلاً، هذا لا يتطابق مع السؤال".

2. "سطر الجديد بعد الإجابة" (الزفير العميق)

كيف يجدون هذا "الناقد"؟ لقد بحثوا في لحظة محددة جداً في "عملية التفكير" لدى الذكاء الاصطناعي.

عندما ينهي الذكاء الاصطناعي إجابة ما، فإنه غالباً ما يضغط على "سطر جديد" (ما يعادل الضغط على مفتاح 'Enter'). أطلق الباحثون على هذه اللحظة اسم PANL (سطر الجديد بعد الإجابة).

فكر في الـ PANL على أنه "الزفير العميق" الذي يأخذه الرياضي بعد تنفيذ حركة ما. في تلك الوقفة الصغيرة بين الحركة والخطوة التالية، لا يقوم الذكاء الاصطناعي بتوليد نص فحسب؛ بل يقوم بـ "تخزين" أو حفظ ملخص لما قام به للتو. وجد الباحثون أن هذا "الزفير العميق" هو بالضبط المكان الذي يعيش فيه "الناقد". إنها لحظة متخصصة حيث يقوم الذكاء الاصطناعي بتقييم أدائه.

3. "فحص المعرفة" (هل يمكنني حقاً إصلاح هذا؟)

هذا هو الجزء الأكثر إثارة في الورقة البحثية. وجد الباحثون أن هذا "الناقد" الداخلي لا يكتفي بالقول: "كان ذلك خطأً"، بل إنه يعرف في الواقع لماذا كان خطأً وما إذا كان بإمكانه إصلاحه.

تخيل أنك طالب تدرك أنك أخطأت في مسألة رياضية.

  • السيناريو (أ): تدرك أنك ارتكبت خطأً، لكنك لا تعرف الصيغة الرياضية في الواقع، لذا أنت مجرد تخمن مرة أخرى.
  • السيناريو (ب): تدرك أنك ارتكبت خطأً، وتتذكر فوراً الصيغة الصحيحة.

وجد الباحثون أنه من خلال النظر إلى إشارة "الناقد" الداخلية للذكاء الاصطناعي (الـ PANL)، استطاعوا التنبؤ بالأخطاء التي يمكن للذكاء الاصطناعي إصلاحها بنجاح، وتلك التي سيظل يخطئ فيها باستمرار. سلوك الذكاء الاصطناعي الخارجي (ما يقوله) لم يكن قادراً على التنبؤ بذلك، لكن "شعوره الحدسي" الداخلي كان قادراً.

لماذا يهم هذا؟

في الوقت الحالي، إذا ارتكب الذكاء الاصطناعي خطأً، فعادة ما يتعين علينا إخباره: "أنت مخطئ، حاول مرة أخرى".

تشير هذه الورقة البحثية إلى أن "الذكاء" اللازم للتصحيح الذاتي موجود بالفعل داخل النموذج، مختبئاً في تلك الوقفات الصغيرة بين الكلمات. إذا تعلمنا كيف "نستمع" إلى هذا الناقد الداخلي —ربما من خلال التدخل عندما يشير الناقد إلى وجود خطأ— فيمكننا إنشاء ذكاء اصطناعي يلتقط أخطاءه ويصلحها فوراً، دون أن يضطر إنسان أبداً للإشارة إليها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →