← أحدث الأبحاث
💬 NLP

The {\alpha}-Law of Observable Belief Revision in Large Language Model Inference

تقدم هذه الورقة "قانون ألفا" (α\alpha-Law)، وهو قانون قياس ضربي يحكم كيفية مراجعة النماذج اللغوية الكبيرة لمعتقداتها أثناء الاستدلال التكراري، مما يثبت أن وجود أسٍ أقل من واحد يضمن الاستقرار التقاربي ويكشف عن سلوكيات تحديث قريبة من السلوك البايزي عبر نماذج ومعايير متنوعة.

المؤلفون الأصليون: Mike Farmer, Abhinav Kochar, Yugyung Lee

نُشر 2026-03-23
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mike Farmer, Abhinav Kochar, Yugyung Lee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً ذكياً جداً، ولكنه مغرور قليلاً، كيفية حل الألغاز الصعبة. تعطيه سؤالاً، فيخمن إجابة، ثم تظهر له تلميحاً أو خطوة للتحقق. بعد ذلك، يغير رأيه ويعطيك إجابة جديدة.

تسأل هذه الورقة البحثية سؤالاً بسيطاً ولكنه عميق: عندما يغير هذا الطالب رأيه، هل يفعل ذلك بطريقة منطقية ومستقرة، أم أنه يبالغ في رد الفعل ويدخل في دوامة من الفوضى؟

اكتشف المؤلفون "قانوناً" رياضياً يصف بدقة كيف تقوم هذه النماذج من الذكاء الاصطناعي (مثل GPT-5.2 أو Claude) بتحديث معتقداتها. وقد أطلقوا عليه اسم قانون α\alpha (α\alpha-Law).

إليك تفصيل ذلك بكلمات بسيطة:

1. المفهوم الجوهري: "مضاعف الثقة" (α\alpha)

فكر في معتقد الذكاء الاصطناعي كأنه مفتاح التحكم في مستوى الصوت.

  • المعتقد القديم: ما كان يعتقده الذكاء الاصطناعي قبل رؤية التلميح.
  • الدليل الجديد: التلميح أو خطوة التحقق التي قدمتها له.
  • التحديث: كيف يجمع الذكاء الاصطناعي بين المعتقد القديم والدليل الجديد.

في عالم مثالي ومنطقي (مثل عالم رياضيات بشري يستخدم نظرية بايز الصارمة)، سيقوم الذكاء الاصطناعي بالجمع بين المعتقد القديم والدليل الجديد بشكل مثالي. وهذا "المضاعف" سيكون 1.0.

وجد المؤلفون أن هذه النماذج من الذكاء الاصطناعي لديها مضاعف يسمى α\alpha (ألفا).

  • إذا كان α=1\alpha = 1: يكون الذكاء الاصطناعي منطقياً تماماً؛ حيث يحدث معتقده بقدر ما يستدعي الدليل بالضبط.
  • إذا كان α<1\alpha < 1: يكون الذكاء الاصطناعي حذراً للغاية؛ فهو يتجاهل الدليل الجديد ويتمسك بتخمينه الأصلي.
  • إذا كان α>1\alpha > 1: يكون الذكاء الاصطناد مفرط الثقة؛ فهو يبالغ في رد الفعل تجاه الدليل الجديد، وينحرف بقوة نحو الاتجاه الجديد.

النتيجة: في الخطوة الواحدة، تمتلك هذه النماذج α\alpha تبلغ حوالي 1.16.

  • تشبيه: تخيل أنك تقول لصديق: "أعتقد أنها ستمطر". فيقول هو: "حقاً؟ دعني أتفقد تطبيق الطقس". يخبره التطبيق: "هناك احتمال بنسبة 50%". الصديق المنطقي تماماً سيقول: "حسناً، الآن أعتقد أن هناك احتمال بنسبة 50%".
  • أما صديق الذكاء الاصطناعي هذا، فيقول: "واو، التطبيق يقول 50%؟ هذا يعني أنها حتماً ستمطر!". لقد بالغ في رد الفعل قليلاً. إنه "قريب من النموذج البايزي" (شبه مثالي)، لكنه مندفع قليلاً للإيمان بالمعلومات الجديدة.

2. القلق الكبير: "تأثير كرة الثلج"

إذا بالغ الذكاء الاصطناعي في رد الفعل (α>1\alpha > 1) لمرة واحدة فقط، فلا بأس في ذلك. ولكن ماذا لو كان عليه مراجعة إجابته عشر مرات متتالية (مثل سلسلة طويلة من الأفك_ أو نقاش بين عدة وكلاء)؟

  • الخطر: إذا ضربت رقماً أكبر من 1 في نفسه عشر مرات، فإنه سينفجر. ستتأرجح ثقة الذكاء الاصطناعي بجنون، محولةً شكاً صغيراً إلى يقين خاطئ هائل. يُسمى هذا نظاماً توسعياً (expansive).
  • الأخبار الجيدة: وجد المؤلفون أنه بينما يكون النموذج مفرط الثقة (α1.16\alpha \approx 1.16) في الخطوة الأولى، إلا أنه يصبح أكثر حذراً كلما زاد تفكيره.
  • التشبيه: تخيل سيارة بمقود مرتخٍ قليلاً. في أول منعطف، تبتعد السيارة قليلاً عن المسار. ولكن مع إدراك السائق أنه يبتعد، يقوم لا شعورياً بتضييق قبضته على المقود. بحلول المنعطف السابع، يكون السائق يقود بحذر شديد.
  • النتيجة: عبر 7 خطوات من المراجعة، ينخفض α\alpha من 1.16 إلى 0.54. ولأن القيمة تنخفض في النهاية لتصبح أقل من 1، فإن "كرة الثلج" تتوقف عن النمو وتبدأ في التقلص فعلياً. النظام يستقر ذاتياً بمرور الوقت.

3. "بصمة الثقة"

نظرت الورقة البحثية أيضاً في كيفية وزن عائلات الذكاء الاصطنا المختلفة للأدلة.

  • GPT-5.2: يعمل كقاضٍ متوازن؛ فهو يزن فكرته الأصلية والدليل الجديد بالتساوي (τ1.0\tau \approx 1.0).
  • Claude: يعمل كمحقق أكثر استجابة؛ فهو يثق في الدليل الجديد أكثر بقليل من فكرته الأصلية (τ1.1\tau \approx 1.1).
  • Gemini (نتائج أولية): يعمل كمحقق شديد القفز والاندفاع؛ فهو يبالغ في رد الفعل تجاه الأدلة بشكل كبير (τ2.3\tau \approx 2.3)، رغم أن البيانات كانت غير دقيقة.

4. لماذا هذا مهم (لماذا يجب أن أهتم؟)

هذا ليس مجرد رياضيات من أجل الرياضيات فقط. إنه أداة تشخيصية لمستقبل الذكاء الاصطناعي.

  • "جهاز كشف الكذب": إذا كان الذكاء الاصطناعي يراجع إجابته وأظهرت الرياضيات أن α\alpha تتصرف بشكل غريب (أو إذا كانت الأدلة فاسدة/مشوشة)، يمكننا اكتشاف أن الذكاء الاصطناعي على وشك ارتكاب خطأ قبل أن يعطي الإجابة النهائية.
  • "مكبح الاستقرار": بما أننا نعرف القاعدة (α\alpha-law)، يمكننا بناء "مكبح" لأنظمة الذكاء الاصطناعي. إذا بدأ الذكاء الاصطناعي في المبالغة في رد الفعل (يصبح واثقاً جداً بسرعة كبيرة)، يمكن لنظام سلامة التدخل وقول: "تمهل، أنت تبالغ في رد الفعل"، وإجباره على أن يكون أكثر تحفظاً.
  • الواقع مقابل الكتب المدرسية: تحذر الورقة من أنه بينما تكون هذه النماذج مستقرة في الاختبارات النظيفة والمثالية، فإنها قد تنهار في العالم الحقيقي (حيث تكون الأدلة مشوشة وغير دقيقة). إذا فسدت الأدلة، فإن "منطق" الذكاء الاصطناعي ينهار.

الملخص

اكتشفت الورقة البحثية أن نماذج اللغات الكبيرة لديها "سمة شخصية" خفية فيما يتعلق بكيفية تغيير آرائها. فهي مفرطة الثقة قليلاً عندما تسمع معلومات جديدة لأول مرة، ولكنها تتعلم الهدوء كلما طال تفكيرها.

يطلق المؤلفون على هذا اسم قانون α\alpha. إنه يمنحنا طريقة لقياس وتوقع والتحكم في كيفية تحديث أنظمة الذكاء الاصطناعي لمعتقداتها، مما يضمن عدم خروجها عن السيطرة عند حل المشكلات المعقدة. إنه يشبه العثور على "فيزياء التفكير" للذكاء الاصطناعي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →