← أحدث الأبحاث
💻 computer science

Adaptive Stopping for Multi-Turn LLM Reasoning

تقدم هذه الورقة MiCP، وهو أول إطار عمل للتنبؤ المطابق للاستدلال متعدد الخطوات في النماذج اللغوية الكبيرة، والذي يقوم بتخصيص ميزانيات الخطأ عبر الخطوات لتوفير ضمانات تغطية رسمية مع تمكين التوقف المبكر التكيفي لتقليل التكلفة وزمن الاستجابة في التطبيقات عالية المخاطر.

المؤلفون الأصليون: Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

نُشر 2026-04-03
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiaofan Zhou, Huy Nguyen, Bo Yu, Chenxi Liu, Lu Cheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حل لغز صعب للغاية. لديك مساعد فائق الذكاء (الذكاء الاصطناعي) يمكنه التحدث إليك، لكنه أحياناً لا يعرف الإجابة على الفور.

في الماضي، واجهنا مشكلتين رئيسيتين مع هؤلاء المساعدين:

  1. كانوا يتوقفون مبكراً جداً: حيث يخمنون الإجابة قبل جمع ما يكفي من الأدلة، مما يؤدي إلى الوقوع في الأخطاء.
  2. كانوا يتحدثون طويلاً جداً: حيث يستمرون في طلب المزيد من الأدلة حتى بعد أن عرفوا الإجابة بالفعل، مما يهدر الوقت والمال.

السؤال الكبير هو: كيف يعرف المساعد متى يتوقف تماماً عن الكلام ويعطي الإجابة النهائية؟

تعتمد معظم الأنظمة الحالية فقط على "الحدس" (مثل: "أنا متأكد بنسبة 80%، لذا سأتوقف"). ولكن في المواقف عالية الخطورة — مثل تشخيص حالة مريض أو إدارة حساب بنكي — لا يكون الحدس كافياً. أنت بحاجة إلى ضمان بأن الإجابة صحيحة.

الحل: نظام MiCP (نظام "شبكة الأمان")

يقدم هذا البحث نظاماً جديداً يسمى MiCP. فكر في الأمر كأنك تمنح الذكاء الاصطناعي شبكة أمان مهيكلة وميزانية ذكية لعملية التفكير الخاصة به.

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. فلتر "التذكرة الذهبية" (معايرة الاسترجاع)

تخيل أن الذكاء الاصطناعي محقق يبحث عن أدلة في مكتبة ضخمة. في كل مرة يطلب فيها كتاباً، يسلمه أمين المكتبة 10 كتب.

  • المشكلة: بعض الكتب مفيدة، والبعض الآخر مجرد هراء. إذا قرأ الذكاء الاصطناعي الهراء، فسيصاب بالارتباك.
  • حل MiCP: قبل أن يبدأ الذكاء الاصطناعي في القراءة، يعمل MiCP كأمين مكتبة صارم. لديه اختبار "التذكرة الذهبية". إذا لم يحصل الكتاب على درجة عالية من الصلة بالموضوع، يتم التخلص منه فوراً. هذا يضمن أن يقرأ الذكاء الاصطناعي فقط "الكتب الذهبية" التي تساعد حقاً في حل اللغز.

2. "ميزانية التفكير" (تخصيص ميزانية الخطأ)

هذا هو الجزء الأكثر ذكاءً. تخيل أن لديك ميزانية قدرها 100 "رمز خطأ" (mistake tokens) لإنفاقها على حل سلسلة من الألغاز.

  • الطريقة القديمة: تنفق نفس القدر من الرموز على كل لغز. إذا كان اللغز سهلاً، فأنت تهدر الرموز. وإذا كان صعباً، فستنفد منك الرموز وتفشل.
  • طريقة MiCP: يعمل MiCP كمحاسب ذكي. ينظر إلى اللغز ويقول:
    • "هذا يبدو سهلاً. لنصرف 5 رموز فقط. إذا حللناه، فهذا رائع. وإذا لم نستطع، سنتوقف."
    • "هذا يبدو صعباً. دعونا نوفر 20 رمزاً للجولات اللاحقة."

هذا يسمح للذكاء الاصطناعي بالتوقف مبكراً في الأسئلة السهلة (لتوفير الوقت والمال) ولكن الاستمرار في الأسئلة الصعبة حتى يتأكد. والأهم من ذلك، أنه يحتفظ بسجل مستمر لضمان أن إجمالي عدد الأخطاء في النهاية لن يتجاوز حد الأمان الذي وضعته في البداية.

3. "علامة التوقف" (التوقف التكيفي)

في كل خطوة من المحادثة، يسأل MiCP: "هل لدينا ثقة كافية للتوقف؟"

  • إذا كان الذكاء الاصطناعي يجمع نفس الإجابة مراراً وتكراراً (ثقة عالية)، يرفع MiCP علماً أخضر: "توقف! لدينا الإجابة."
  • إذا كان الذكاء الاصطناعي مرتبكاً ويعطي إجابات مختلفة، يرفع MiCP علماً أحمر: "استمر! ابحث عن مزيد من الأدلة."
  • إذا نفدت ميزانيتك ولا تزال مرتبكاً، يمتلك MiCP حركة أمان أخيرة: يقول: "لا أعرف،" بدلاً من تخمين إجابة خاطئة. وهذا أفضل من الكذب!

لماذا يعد هذا أمراً هاماً؟

فكر في الأمر مثل نظام ملاحة GPS:

  • بدون MiCP: قد يخبرك نظام GPS بأن تنعطف يساراً فوراً (التوقف مبكراً) ويجعلك تضل الطريق، أو قد يستمر في إعادة حساب المسار لمدة 20 دقيقة بينما تجلس عالقاً في الزحام (التوقف متأخراً).
  • مع MiCP: يعرف نظام GPS تماماً متى يمتلك بيانات كافية ليعطيك توجيهات دقيقة خطوة بخطوة. وإذا كان الطريق مغلقاً ولم يستطع إيجاد طريق، فسيخبرك بصدق: "لا يمكنني إيصالك إلى هناك"، بدلاً من قيادتك نحو حائط.

النتائج

اختبر الباحثون هذا النظام على العديد من الأسئلة الصعبة (مثل "أين هي عاصمة الدولة التي تحد X؟"). ووجدوا أن MiCP:

  1. يوفر المال: يمنع الذكاء الاصطنا ملي من القيام بعمل غير ضروري.
  2. يوفر الوقت: يجيب بشكل أسرع.
  3. أكثر أماناً: يضمن أن الإجابة صحيحة (أو يعترف بأنه لا يعرف) بمستوى مثبت رياضياً من اليقين.

باختصار، يعلم MiCP الذكاء الاصطناعي أن يكون صبوراً عندما يحتاج لذلك، وسريعاً عندما يستطيع، وصادقاً عندما يعلق. إنه يحول "لعبة التخمين" إلى "عملية موثوقة".

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →