← أحدث الأبحاث
💻 computer science

When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning

تقدم هذه الورقة البحثية "الاستنتاج المتداخل جنباً إلى جنب" (SxS Interleaved Reasoning)، وهو إطار عمل يُمكّن النماذج اللغوية الكبيرة من التحكم ديناميكياً في توقيت الكشف عن المحتوى أثناء التوليد لموازنة المقايضة بين وقت التداول والالتزام المبكر، مما يؤدي إلى تحسين أداء الدقة والكمون عبر مختلف المعايكير.

المؤلفون الأصليون: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

نُشر 2026-05-06
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaqi Wei, Xuehang Guo, Pengfei Yu, Xiang Zhang, Wanli Ouyang, Siqi Sun, Qingyun Wang, Chenyu You

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تطلب من صديق ذكي ولكن حذر للغاية المساعدة في حل لغز معقد.

الطريقة القديمة: "ضريبة الصمت"
في الطريقة الحالية التي تعمل بها النماذج اللغوية الكبيرة (LLMs)، يتعين على صديقك أن يفكر بصوت عالٍ. ولكن هنا تكمن المشكلة: بمجرد أن ينطق بكلمة، تصبح هذه الكلمة علنية. لا يمكنه التراجع عنها.

  • إذا ظل صامتًا ليفكر بعمق، ستجلس أنت هناك تنتظر في صمت محرج ("ضريبة الصمت").
  • إذا بدأ في التحدث فورًا من باب اللباقة، فقد يقول شيئًا خاطئًا أو غير مكتمل. ولأنه قال ذلك بالفعل، فإنه يصبح الآن "ملتزمًا" بهذه الفكرة، مما قد يجعل من الصعب عليه تصحيح مساره لاحقًا. هو مجبر على الاستمرار في البناء على أساس مهزوز لمجرد أنه تحدث قبل أوانه.

الفكرة الجديدة: التفكير جنباً إلى جنب (SxS)
تقدم هذه الورقة البحثية طريقة جديدة لتحدث الذكاء الاصطناي، تُسمى التفكير المتداخل جنباً إلى جنب (SxS).

تخُيل الأمر كأنه برنامج طبخ مباشر مع مكون سري.

  • "وضع التفكير" (خاص): الشيف (الذكاء الاصطناعي) موجود في المطبخ، يقطع، ويتذوق، ويمزج المكونات. لا يمكنك رؤية هذا الجزء؛ إنه مساحة عمله الخاصة.
  • "وضع التحدث" (علني): يخرج الشيف إلى المنصة ويقول لك: "أنا أضيف الملح الآن".
  • القاعدة السحرية: يُسمح للشيف فقط بالخروج والتحدث إذا كان قد تذوق الطبق بالفعل وهو متأكد بنسبة 100% أن إضافة الملح هي الخطوة الصحيحة. هو لا يكتفي بإلقاء تخمينات لمجرد ملء الفراغ.

كيف يعمل الأمر (خدعة "الاستلزام")
تعلمت الورقة البحثية الذكاء الاصطناعي قاعدة محددة: "لا تتحدث حتى يدعم تفكيرك ما أنت على وشك قوله".

  1. تدريب الشيف: أخذ الباحثون آلاف الأمثلة حيث قام ذكاء اصطناعي بحل مشكلة ما. استخدموا "مشرفًا" (ذكاءً اصطناعيًا آخر) للتحقق: "هل خطوة التفكير المحددة هذه تثبت فعليًا خطوة الإجابة المحددة هذه؟"
  2. رقصة التداخل: ابتكروا تنسيق تدريب جديد حيث يتدرب الذكاء الاصطناعي على التبديل ذهابًا وإيابًا بين "التفكير" (خاص) و"التحدث" (علني).
    • فكر: "أحتاج لحساب المساحة." (خاص)
    • فكر: "المعادلة هي الطول في العرض." (خاص)
    • تحدث: "المساحة هي 50." (علني، لأن التفكير أثبت ذلك للتو).
    • فكر: "انتظر، دعني أتأكد من الوحدات." (خاص)
    • تحدث: "إذًا، 5 50 مترًا مربعًا." (علني).

النتائج: أفضل ما في العالمين
اختبرت الورقة البحثية هذا الأسلوب على مسائل رياضية (AIME25) وأسئلة علمية (GPQA-Diamond) باستخدام حجمين مختلفين من نماذج الذكاء الاصطناعي.

  • تحديثات أسرع: بدلاً من الانتظار لمدة 20,000 توكن (فترة طويلة جدًا) للوصول إلى الإجابة النهائية، يقدم لك الذكاء الاصطناعي الآن قطعًا صغيرة ومحققة من الإجابة في وقت مبكر. إنه يشبه الحصول على شريط تقدم يتحرك فعليًا، بدلاً من دائرة تحميل تدور بلا نهاية.
  • لا يوجد "حشو": نظرًا لأنه تم تدريب الذكاء الاصطناعي على التحدث فقط عندما يمتلك دليلًا، فهو لا يهذي بكلام فارغ لملء الصمت.
  • الدقة تظل عالية: أحيانًا، إجبار الذكاء الاصطناعي على التحدث مبكرًا يجعله أقل ذكاءً. ولكن لأن هذه الطريقة تستخدم عملية تدريب من خطوتين (أولاً تعلم كيفية التبديل بين الأنماط، ثم استخدام التعلم المعزز للتأكد من أن الإجابات لا تزال صحيحة)، يظل الذكاء الاصطناعي ذكيًا.
  • فوز "باريتو": تزعم الورقة البحثية أن هذا يخلق توازنًا أفضل (مقايضة باريتو). تحصل على تحديثات أسرع وأكثر تكرارًا دون التضحية بجودة الإجابة النهائية.

باختاًصر
تحل هذه الورقة البحثية مشكلة "ضريبة الصمت" عبر تعليم الذكاء الاصطناعي أن يكون متحدثًا واثقًا وموثقًا. فهي تسمح للنموذج بالإبقاء على "قبعة التفكير" مرتديًا إياها أثناء العمل، ولا ينزعها إلا لمشاركة جزء من الحل عندما يتأكد من أن ذلك الجزء صلب. هذا يجعل التفاعل يبدو أسرع وأكثر استجابة، دون إجبار الذكاء الاصطناعي على التخمين أو الكذب لملء الصمت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →